[吴恩达Coursea机器学习] 笔记004 无监督学习
问题
- 什么是无监督学习?
- 无监督学习的分类:聚类(clustering)、非聚类(non-clustering)
无监督学习
我们面对的是一组无标记(没有标签,结果未知)的训练数据,数据之间,不具有任何相关联的标记。比如下面的数据点,都一个样。

Unsupervised learning allows us to approach problems with little or no idea what our results should look like. We can derive structure from data where we don't necessarily know the effect of the variables.
We can derive this structure by clustering the data based on relationships among the variables in the data.
With unsupervised learning there is no feedback based on the prediction results.
问:如何自动的找出这些数据中的”结构”,也就是如何对这些数据分类?
答:下面是聚类算法的一种可能划分方式,分为2部分(下图中A和B)

聚类算法(clustering)例子:
-
Google News:爬取网络上不同来源的新闻,自动的将同一主题的新闻聚合在一起
![]()
-
机器集群管理:比如你有几千台机器,你能自动的找出哪些机器趋向于协同工作,如果把这些机器放在一起,你就可以让你的数据中心更高效的工作
![]()
-
社交网络分析:自动识别哪些是很要好的朋友,哪些事互联网认识的朋友,然后自动分组
![]()
-
市场划分:给定客户数据集(不知道有哪些细分市场,也不知道哪个客户在哪个细分市场),你能否自动的找出不同的市场分割,并自动将你的客户分到不同的细分市场中,从而进行更有效的销售
![]()
-
基因:给定一组不同的个体,对于每个个体,检测它们是否拥有某个特定的基因,颜色表示不同个体包含该特定基因的不同程度
![]()
运行一个聚类算法,把不同的个体归入不同的类

Non-clustering(非聚类):
鸡尾酒宴算法:音频分离,将聚会中不同的声音(人的声音、音乐)分离出来
Non-clustering: The "Cocktail Party Algorithm", allows you to find structure in a chaotic environment. (i.e. identifying individual voices and music from a mesh of sounds at a cocktail party).
问:non-clustering算法和分类算法有什么区别?
答:non-clustering是无监督学习,分类算法是监督学习
总结:
无监督学习:我们事先对数据中蕴含的类型知道的并不多或者一无所知,要做的是自动的找出数据中蕴含的类型结构






浙公网安备 33010602011771号