特征工程----降维
线性降维:
PCA和LDA:
PCA:无监督数据降维
主成分分析,以n维数据降到m维为例:
对数据矩阵进行特征值分解,将分解得到的n个特征值由大到小排序,找到前m个特征值,再由这m个特征值对应的特征向量将原始n维数据重构为m维数据矩阵,即完成了数据降维。
LDA:有监督数据降维
线性判别分析,核心思想:将高维数据投影到低维后,使得类内方差最小,类间方差最大
https://blog.csdn.net/yaoqi_isee/article/details/71036320
PCA与ZCA:
白化的目的是去掉数据之间的相关联度,是很多算法进行预处理的步骤。比如说当训练图片数据时,由于图片中相邻像素值有一定的关联,所以很多信息是冗余的。这时候去相关的操作就可以采用白化操作。数据的whitening必须满足两个条件:一是不同特征间相关性最小,接近0;二是所有特征的方差相等(不一定为1)。常见的白化操作有PCA whitening和ZCA whitening。
PCA 白化是指将数据x经过PCA降维为z后,可以看出z中每一维是独立的,满足白化的第一个条件,这是只需要将z中的每一维都除以标准差就得到了每一维的方差为1,也就是说方差相等。公式为:

ZCA 白化是指数据x先经过PCA变换为z,但是并不降维,因为这里是把所有的成分都选进去了。这是也同样满足白化的第一个条件,特征间相互独立。然后同样进行方差为1的操作,最后将得到的矩阵左乘一个特征向量矩阵U即可。
ZCA whitening公式为:

https://www.cnblogs.com/nice-forever/p/5381740.html
非线性降维:
K均值聚类:
https://www.cnblogs.com/xiaobingqianrui/p/10684104.html
浙公网安备 33010602011771号