西瓜书第3章线性模型-线性判别分析
线性判别分析(LDA)
线性判别分析(Linear Discriminant Analysis, LDA)是一种经典的分类方法,主要用于降维和分类任务。LDA假设数据集中的不同类别服从高斯分布,并通过找到能够最有效区分类别的投影方向,实现数据的分类。
1. 基本原理
LDA的基本思想是找到一个投影方向,使得投影后类别间的距离最大,而类别内的散布最小。该方法基于以下假设:
- 各类别服从多元高斯分布。
- 各类别的协方差矩阵相同。
假设有 \(K\) 个类别,每个类别的均值向量为 $ \mu_k $,总体均值向量为 $ \mu $。类内散布矩阵 $ S_W $ 和类间散布矩阵 $ S_B $ 的定义如下:
其中,$ N_k $ 表示第 $ k $ 类的样本数量。
2. 适用范围
LDA适用于以下场景:
- 数据分布服从多元正态分布或近似满足正态分布。
- 不同类别的协方差矩阵相同或差异不大。
- 特征数量较多时,降维需求较高。
LDA常用于二分类和多分类任务,并在高维小样本(如人脸识别)中具有较好的表现。
3. 二分类任务中的LDA
在二分类任务中,LDA的目标是找到一个一维投影方向,使得两个类别的类间方差最大、类内方差最小。假设两个类别的均值向量分别为 $ \mu_1 $ 和 $ \mu_2 $,并且类内协方差矩阵相同(即 $ \Sigma $),目标是找到一个投影方向 $ w $ 使得两个类别在投影方向上的分离最大化。
投影向量的计算
在二分类情况下,类内散布矩阵 $ S_W $ 定义为:
我们希望找到一个向量 $ w $,使得类间距离与类内散布的比值最大化。为此,可以定义一个目标函数:
该目标函数表示投影后类间距离与类内散布的比值。通过优化该目标函数,可以得出最优的投影向量 $ w $:
该投影向量 $ w $ 是一个一维方向,使得投影后的数据点可以得到良好的分类效果。
分类过程
将样本点 $ x $ 投影到方向$ w $ 上得到一维坐标 $ y = w^T x $,然后可以根据投影均值点的阈值来判断样本所属类别:
若 $ y $ 小于或等于阈值,则样本被分类为第一个类别;若 $ y $ 大于阈值,则被分类为第二个类别。该阈值通常取两个类别投影后的均值:
4. 多分类任务中的LDA
在多分类任务中,LDA可以通过找到 $ K-1 $ 个最优的投影方向来区分 $ K $ 个类别。这是因为,对于 $ K $ 个类别,其最大有效投影维度是 $ K-1 $。通过这样的投影,数据被映射到 $ K-1 $ 维空间中。
投影矩阵的构造
对于多分类问题,LDA的目标是找到一个 $ d \times (K-1) $的投影矩阵 $ W $,其中 $ d$ 为原始特征维数。此投影矩阵$ W $ 是由最大化目标函数所得到的 $ K-1 $ 个特征向量组成的:
此投影矩阵的列向量 $ w_i $ 是广义特征值问题 \(S_W^{-1}S_B w =\lambda{w}\)的前$ K-1 $ 个特征向量。通过该投影矩阵,原始数据在降维空间中的投影结果可以实现最优的分类效果。
5. 最优化损失函数
LDA的目标是通过投影向量 $ w $ 最大化类间散布$ S_B $ 与类内散布 $ S_W $的比值。目标函数可以表示为:
通过求解广义特征值问题,可以得到最优的投影向量 $ w $。为最大化上述目标函数,可将其转化为矩阵求逆问题:
其中 $ \lambda $ 是特征值,通过求解该特征值问题获得投影方向。通常选择最大的 $ d $ 个特征值对应的特征向量作为投影矩阵,将数据降到 $ d $ 维空间,以达到降维和分类的目的。
在多分类任务中,选择前 $ K-1 $ 个特征值对应的特征向量可以使得原始 $ d $ 维数据降到 $ K-1 $ 维空间,并在此空间中进行分类,从而达到多分类的目标。

浙公网安备 33010602011771号