1 数据聚类 概述

这是我的这一篇文章 ,主要是本人做笔记用的,希望日后能有所帮助

这个阶段主要学习聚类方向的知识,以下是近期的总结 ,也是聚类算法的总结,具体算法并未详细介绍,只是一个大纲,若有错误,请多指教

众所周知,机器学习包括监督学习和非监督学习,而聚类是无监督学习的主要内容,那聚类究竟是什么呢?

聚类的目标是在一个对象(模式,数据点)的集合中发现其自然的分组,但如何形式化的描述聚类问题确实相当困难的,一个比较常用的定义:聚类是把一个数据对象的集合划分为簇(子集),使簇内对象彼此相似,簇间对象不相似的过程。

对于聚类问题,簇的三个属性

  1 尺度不变性:对于任意距离函数d和任意常数a>0 ,有F(d)  = F(ad);

  2 划分丰富性:聚类函数F输出的数据簇划分集合包含数据所有可能的簇划分结果;

  3 距离一致性:令d 和 d' 是两个距离函数。如果d'在 d 的基础上缩小同一个簇中数据之间的距离,扩大不同簇中数据之间的距离,则F(d) = F(d').

尺度不变性是自然的要求,即聚类结果不能依赖于节点间距离的量纲;划分丰富性要求聚类结果由节点间相似性函数控制;距离一致性要求若两个已经被划分到同一个簇的变得更近,或不同簇的两个点更远,那么在新的距离下,聚类函数应该取得与原来结果一样的结果。

 

聚类方法大体分为三个阶段

  1 经典算法 2000年以前

  2 高级算法 2000年以后 在经典算法的基础上,针对更复杂的数据和任务开发的算法

  3 多源数据算法 针对多源数据开发的算法

多源数据算法 多视角聚类 多任务聚类 多模态聚类 迁移聚类
谱聚类 NMF 共享子空间 NMF 等周高阶 约束驱动 自学习 谱聚类
高级算法   谱聚类   非负矩阵分解聚类   子空间聚类   半监督聚类
 正则化  非正则化  对称NMF  NMF  轴平行子空间  任意子空间  约束满足  测度学习
经典算法   基于模型的聚类   基于划分的聚类   基于密度的聚类   层次聚类
 高斯模型  伯努利模型  k -均值  扩展算法  密度估计  网格融合  聚类方法  分裂方法

 

 

 

 

 

 

 

 

数据类型    特定的数据类型需要特定的相似度度量,并对模型选择产生巨大影响。

  1 属性数据

  1.1属性数据的相似度   

    汉明距离  概率测度 信息论测度

  1.2 属性数据聚类算法

    1.2.1基于划分的算法

      K-modes算法  Squeerzer算法 COOLCAT算法 

    1.2.2层次聚类

      ROCK算法 COBWEB 算法 LIMBO算法

    1.2.3基于密度算法

      CACTUS 算法 CLICKS算法 STIRR算法 CLOPE算法

  1.3 混合数据聚类算法

    1.3.1 基于模型的算法

      BILCOM算法 AutoClass 算法 SVM 算法

    1.3.2 基于划分的算法

      k-prototypes 算法

 

  2离散序列数据

    常用的相似度函数 汉明距离 编辑距离,最长公共子序列

    算法: 基于序列 基于图的 基于概率模型 基于后缀树和后缀数组的

  3 时间序列数据

    常用的相似性度量:Lp 距离 ,动态时间规整距离 ,编辑距离  LCSS距离 多维子序列匹配SMBGT

    算法 在线相关分析  离线形状分析

  4 文本数据

    4.1特征选择     文本频数,单词权,单词熵 单词贡献

     特征变换      潜在语义分析 概率潜在语义分析     NMF

    4.2 聚类算法 基于划分   层次聚类  混合聚类

    4.3 基于单词和短语的聚类

    4.4 概率文本聚类和主题模型

  5 多媒体数据

    视觉单词学习 人脸识别 数据相册识别 图像分割

    视频概要 视频数据监测 视频故事聚类 音乐概要

  6 流数据

    流数据聚类包括两个重要的步骤: 数据抽取(在线进行)和聚类(离线进行)

    数据抽取 数据结构 时间窗口

    离线数据聚类 k-mean 基于密度 基于网格

此外聚类中一些重要的问题

  特征选择 测度学习 聚类集成 软聚类 多解聚类 聚类验证 可视化和交互聚类

    

  

posted @ 2019-03-02 17:07  一思索  阅读(565)  评论(0)    收藏  举报