7.17 机器学习(九) 聚类
一.基础概念:
无监督学习,无标签,仅依据样本相似度自动划分簇;同一簇样本相似度高,不同簇差异大
与分类的区别在于分类是带标签(事先定义好的类),聚类是不带标签仅根据样本的相似度进行分类
三要素:
相似度 / 距离度量
聚类准则(目标函数)
聚类算法(优化求解)
三原则:
同质性原则(同类很相似)
互斥性原则(不同类差异大)
完备性原则(单个体仅能进一类中)
二.距离计算公式们:
聚类对特征尺度敏感,必须标准化 / 归一化!
当特征是数值时:
1.欧式距离(多维度的勾股定理):

2.曼哈顿距离(每维度的距离相加):

3.切比雪夫距离(所有维度中最大的距离):

4.闵可夫斯基通式(前几个的总结):

5.余弦相似度:

当特征是类别时:
杰卡德系数:

三.主流算法:
(一)划分式聚类:K-Means:
1.定义:试图找到平方误差函数最小的簇的算法
2.优点:高效应对数据量大的情况
3.缺点:要事先确定簇数K常以局部最优结束
基本流程:
预设簇数 K,随机选 K 个样本为初始中心
分配阶段:每个样本归入距离最近中心对应的簇
更新阶段:重新计算每簇均值作为新中心
循环 2、3,直到中心不再变化 / SSE 变化小于阈值收敛
目标函数:
(二)层次聚类Hierarchical Clustering:
凝聚式
1.基本原理类似于Kruskal 最小生成树:
初始每个样本单独一簇
计算所有簇间距离,合并距离最小两簇
重复合并直到只剩 1 簇,生成树状图(谱系图 dendrogram)
2.簇间距离计算方式
最小距离(单链接):两簇最近样本距离,易链式拉长
最大距离(全链接):两簇最远样本距离,抑制细长簇
平均距离:两簇所有样本两两距离均值,均衡稳定
中心距离:簇中心之间欧氏距离
3.优点:可直观显示
4,缺点:时间复杂度极高
(三)密度聚类 DBSCAN(不规则簇专用)
1.参数:
邻域半径,邻域内最少样本数
2.样本分类:
核心点:邻域内样本≥邻域内最少样本数
边界点:落在核心点邻域内,但自身不是核心点
噪声点:既非核心、也不属于任何核心邻域(离群点)
3.连通关系
直接密度可达:边界点 ↔ 核心点
密度可达:传递链相连
密度相连:互相密度可达的点构成一个簇
4.算法流程:
随机选未访问样本
判断是否核心点,是则遍历所有密度可达点形成簇
标记全部访问样本,重复至全部遍历
未归入任何簇的点标记噪声
四.聚类评估指标:
(一)无外部标签
1.轮廓系数 Silhouette Coefficient

a:样本到同簇平均距离;b:到最近异簇平均距离
s∈[-1,1],越接近 1 聚类效果越好,0 重叠,-1 分簇错误。
2.CH 指数
簇间方差 / 簇内方差,数值越大聚类质量越高。
3.SSE(簇内平方和):随 K 增大单调递减,肘部法则选最优 K。
(二)有真实标签:
1.ARI 调整兰德系数:[-1,1],1 完全匹配,0 随机划分
2.NMI 归一化互信息:[0,1],越高聚类和真实标签越吻合

浙公网安备 33010602011771号