阅读心得_ICML_2015_Spectral Clustering via the Power Method - Provably

       这是一篇对谱聚类进行理论分析的文章,本文主要分析用Power迭代求相似度矩阵的特征向量时,所得到的近似特征向量与真实特征向量之间的误差关系。这种误差Golub等人在文献[2]已经详细分析过,但本文是以k-means算法作为基础来进行分析,也就是说,这篇文章的分析基础是基于如下的k-means目标函数(这是一种近似函数):

$$\|Y-X_{\gamma}X_{\gamma}^TY\|\leq \gamma\min_X\|Y-XX^TY\|_F^2=\gamma F_{opt}$$

下面先介绍什么是谱聚类。

       谱聚类可以克服以距离为中心的聚类算法(比如k-means)的缺点,比如数据以圆心分布时(见原文的图1),若以距离为中心的算法就无法得到正确的聚类结果,但谱聚类方法却可以得到正确结果。在谱聚类中,将训练样本当成图的顶点,样本之间的相似度当成边。谱聚类的目的就是通过相似图(similarity graph)的拉普拉斯矩阵的特征向量来表示这些点,使其可分。这是一种低维表示,因此也称为数据样本的谱嵌入(spectral embedding)。

假充有$n$个样本,每个样本的维度为$d$。对于计算得到的相似矩阵$\tilde{W}\in R^{n\times n}$,要得到$\tilde{W}$的前$k$个特征向量(用矩阵$Y\in R^{n\times k}$表示),得到这些特征向量的时间复杂度为$O(n^3)$,注意这里的$k$是由用户指定的聚类数)。若用 Power迭代方法来计算其特征向量,其时间复杂度可降为$n^2kp+k^2n$,注意,这里的$k$为要取多少个特征向量交给k-means进行聚类,$p$为power迭代的次数。下面是Power迭代方法实现的具体细节:

 用独立同分布的高斯变量来初始化矩阵$S\in R^{n\times k}$,$tilde{Y}\in R^{n\times k}$是下面这个矩阵的左奇异向量[1]

  $$B=(\tilde{W}\tilde{W}^T)^p\tilde{W}S=\tilde{W}^{2p+1}S$$

用Power迭代得到的$\tilde{Y}$与真实的$Y$之间究竟差多少?Golub等给出了具体的分析[2]。Golub给出了$\tilde{Y}$以收敛率$\frac{|\lambda_k|}{|\lambda_{k+1}|}$收敛到$Y$(见参考文献[2]的定理8.2.2),但Golub并没有给出这三者的关系:收敛率、迭代次数、$\tilde{Y}$与$Y$。而本文却给出了这样的关系(见原文中的定理6):

对于用Power迭代方法所构成的$\tilde{Y}$,各个参数满足下面的条件:

$$p\geq\frac{\frac{1}{2}\ln\left(4.n.\epsilon^{-1}.\delta^-1.\sqrt{k}\right)}{\ln\gamma_k}$$

其中,$\epsilon$和$\delta$是任意给定的正数,而且有

$\gamma_k=\frac{\sigma_k(\tilde{W})}{\sigma_{k+1}(\tilde{W})}=\frac{1-\sigma_k(\tilde{L})}{1-\sigma_{k+1}(\tilde{L})}$

这里的$\tilde{L}=I_n-\tilde{W}$是归一化的Laplacian矩阵(normalized Laplacian matrix)。通过基于$\gamma$近似的k-means算法来得到$\tilde{Y}$,其失败的概率为$\delta_{\gamma}$。设$X_{\gamma}\in R^{n\times k}$是得到的聚类的指示矩阵(indicator matrix),再令$X_{opt}$是最优的指示矩阵,则至少以概率$1-e^{-2n}-2.35\delta-\delta_{\gamma}$使得下面的不等式成立:

$$\|Y-X_{\gamma}X_{\gamma}^TY\|\leq (1+4\epsilon).\gamma. \|Y-X_{opt}X_{opt}^TY\|_F^2+4\epsilon$$

下面对这个定理进行分析。

由于有$\sigma_1(\tilde{W})\geq\sigma_2(\tilde{W})\geq \sigma_k(\tilde{W}) \geq \sigma_{k+1}(\tilde{W})\geq \sigma_n(\tilde{W})$,则总有$\gamma_k \geq 1$,下面分两种情况对$\gamma_k $进行讨论。

 (1)当$\gamma_k =1$时,对于具有$k$个类别的谱聚类而言没有意义。这说明选择的类别数$k$不恰当,需要重新选择[3]

(2) 当$\gamma_k >1$时。若在$N$,$\epsilon$,$\delta$,$k$固定时,$p$的最小值与$\gamma_k $如下:

$$p=\frac{\frac{1}{2}\ln\left(4.n.\epsilon^{-1}.\delta^-1.\sqrt{k}\right)}{\ln\gamma_k}$$

也就是说,在这种情形下,若已知$\gamma_k$,就可计算出$p$。$\gamma_k$与$\tilde{W}\in R^{n\times n}$的第$k$和$k+1$特征值有关,直接计算$\tilde{W}$的特征值比较麻烦,可用power迭代来进行计算。

 

 参考文献:

[1] Lin, Frank and Cohen, William W. Power iteration clustering. In ICML, 2010.

[2] Golub, Gene H and Van Loan, Charles F. Matrix computations, volume 3. JHU Press, 2012

[3] Lee, James R, Oveis Gharan, Shayan, and Trevisan, Luca. Multi-way spectral partitioning and higher-order cheeger inequalities. In Proceedings of the forty-fourth annual ACM symposium on Theory of computing, pp. 1117–1130. ACM, 2012.

posted @ 2016-11-06 16:20  flyinsky518  阅读(209)  评论(0)    收藏  举报