1 数据聚类 概述
这是我的这一篇文章 ,主要是本人做笔记用的,希望日后能有所帮助
这个阶段主要学习聚类方向的知识,以下是近期的总结 ,也是聚类算法的总结,具体算法并未详细介绍,只是一个大纲,若有错误,请多指教
众所周知,机器学习包括监督学习和非监督学习,而聚类是无监督学习的主要内容,那聚类究竟是什么呢?
聚类的目标是在一个对象(模式,数据点)的集合中发现其自然的分组,但如何形式化的描述聚类问题确实相当困难的,一个比较常用的定义:聚类是把一个数据对象的集合划分为簇(子集),使簇内对象彼此相似,簇间对象不相似的过程。
对于聚类问题,簇的三个属性
1 尺度不变性:对于任意距离函数d和任意常数a>0 ,有F(d) = F(ad);
2 划分丰富性:聚类函数F输出的数据簇划分集合包含数据所有可能的簇划分结果;
3 距离一致性:令d 和 d' 是两个距离函数。如果d'在 d 的基础上缩小同一个簇中数据之间的距离,扩大不同簇中数据之间的距离,则F(d) = F(d').
尺度不变性是自然的要求,即聚类结果不能依赖于节点间距离的量纲;划分丰富性要求聚类结果由节点间相似性函数控制;距离一致性要求若两个已经被划分到同一个簇的变得更近,或不同簇的两个点更远,那么在新的距离下,聚类函数应该取得与原来结果一样的结果。
聚类方法大体分为三个阶段
1 经典算法 2000年以前
2 高级算法 2000年以后 在经典算法的基础上,针对更复杂的数据和任务开发的算法
3 多源数据算法 针对多源数据开发的算法
| 多源数据算法 | 多视角聚类 | 多任务聚类 | 多模态聚类 | 迁移聚类 | ||||
| 谱聚类 | NMF | 共享子空间 | NMF | 等周高阶 | 约束驱动 | 自学习 | 谱聚类 | |
| 高级算法 | 谱聚类 | 非负矩阵分解聚类 | 子空间聚类 | 半监督聚类 | ||||
| 正则化 | 非正则化 | 对称NMF | NMF | 轴平行子空间 | 任意子空间 | 约束满足 | 测度学习 | |
| 经典算法 | 基于模型的聚类 | 基于划分的聚类 | 基于密度的聚类 | 层次聚类 | ||||
| 高斯模型 | 伯努利模型 | k -均值 | 扩展算法 | 密度估计 | 网格融合 | 聚类方法 | 分裂方法 | |
数据类型 特定的数据类型需要特定的相似度度量,并对模型选择产生巨大影响。
1 属性数据
1.1属性数据的相似度
汉明距离 概率测度 信息论测度
1.2 属性数据聚类算法
1.2.1基于划分的算法
K-modes算法 Squeerzer算法 COOLCAT算法
1.2.2层次聚类
ROCK算法 COBWEB 算法 LIMBO算法
1.2.3基于密度算法
CACTUS 算法 CLICKS算法 STIRR算法 CLOPE算法
1.3 混合数据聚类算法
1.3.1 基于模型的算法
BILCOM算法 AutoClass 算法 SVM 算法
1.3.2 基于划分的算法
k-prototypes 算法
2离散序列数据
常用的相似度函数 汉明距离 编辑距离,最长公共子序列
算法: 基于序列 基于图的 基于概率模型 基于后缀树和后缀数组的
3 时间序列数据
常用的相似性度量:Lp 距离 ,动态时间规整距离 ,编辑距离 LCSS距离 多维子序列匹配SMBGT
算法 在线相关分析 离线形状分析
4 文本数据
4.1特征选择 文本频数,单词权,单词熵 单词贡献
特征变换 潜在语义分析 概率潜在语义分析 NMF
4.2 聚类算法 基于划分 层次聚类 混合聚类
4.3 基于单词和短语的聚类
4.4 概率文本聚类和主题模型
5 多媒体数据
视觉单词学习 人脸识别 数据相册识别 图像分割
视频概要 视频数据监测 视频故事聚类 音乐概要
6 流数据
流数据聚类包括两个重要的步骤: 数据抽取(在线进行)和聚类(离线进行)
数据抽取 数据结构 时间窗口
离线数据聚类 k-mean 基于密度 基于网格
此外聚类中一些重要的问题
特征选择 测度学习 聚类集成 软聚类 多解聚类 聚类验证 可视化和交互聚类

浙公网安备 33010602011771号