L2 范数及 Ln 范数
一、什么是 L2 范数(\(\ell_2\) Norm)?
1. 直观理解:向量的"长度"
L2 范数就是我们最熟悉的欧几里得长度——从原点到向量终点的直线距离。
2. 严格定义
对于 \(n\) 维向量 \(x = (x_1, x_2, \ldots, x_n)\),其 L2 范数为:
\[\|x\|_2 = \sqrt{x_1^2 + x_2^2 + \cdots + x_n^2} = \sqrt{\sum_{i=1}^n x_i^2}
\]
更一般地,Lp 范数定义为 \(\|x\|_p = \left(\sum |x_i|^p\right)^{1/p}\),L2 是 \(p=2\) 的特例。
3. 核心性质
- 正定性:\(\|x\|_2 \geq 0\),且 \(\|x\|_2 = 0 \iff x = 0\)
- 齐次性:\(\|\alpha x\|_2 = |\alpha| \cdot \|x\|_2\)
- 三角不等式:\(\|x + y\|_2 \leq \|x\|_2 + \|y\|_2\)
这三条是"范数"的公理,L2 范数全部满足。
4. 与微积分/优化的深度连接
从你熟悉的分析视角来看,L2 范数有几个关键优势:
- 光滑性:\(\|x\|_2^2 = \sum x_i^2\) 处处可微,梯度为 \(2x\),Hessian 为 \(2I\)(常数正定矩阵)。这使得基于 L2 的优化问题有闭式解。
- 旋转不变性:对任意正交矩阵 \(Q\),\(\|Qx\|_2 = \|x\|_2\)。这意味着 L2 范数只关心向量的"内在长度",不依赖于坐标系的选择。
- 与内积的关系:\(\|x\|_2^2 = \langle x, x \rangle\),L2 范数平方就是向量与自身的内积。这直接连接到了 \(X^TX\)——它本质上是在计算特征向量之间的内积矩阵(Gram 矩阵)。
5. 为什么最小二乘用 L2 而不是 L1?
| 对比项 | L2 范数(平方) | L1 范数(绝对值) |
|---|---|---|
| 光滑性 | 处处可微 | 在原点不可微 |
| 闭式解 | 有(正规方程) | 无,需迭代求解 |
| 对大误差 | 惩罚更重(平方放大) | 惩罚线性 |
| 对异常值 | 敏感 | 鲁棒 |
| Hessian | 常数矩阵 \(X^TX\) | 不存在/不连续 |
L2 的选择本质上是用光滑性换取解析可解性——这正是牛顿法能一步收敛的根源。
二、两者如何串联起最小二乘的几何图景?
把两个概念放在一起,最小二乘的完整几何故事就清晰了:
- 列空间定义了"模型能表达的范围"——所有可能的预测值 \(Xw\) 都落在这个子空间里
- L2 范数定义了"距离的度量方式"——我们用欧氏距离衡量预测值与真实值的差距
- 最小二乘 = 在列空间中找一点,使它到 \(y\) 的 L2 距离最小 = 正交投影
而投影的最优条件恰好是:残差 \(y - Xw^*\) 与列空间中的每个基向量(即 \(X\) 的每一列)都正交,即:
\[X^T(y - Xw^*) = 0 \quad \Rightarrow \quad X^TXw^* = X^Ty
\]
你看,\(X^TX\) 又出现了——它既是 Gram 矩阵(列空间的内积结构),又是 Hessian(误差曲面的曲率),还是投影算子的核心组成部分。这三重身份在 L2 几何下完美统一。

浙公网安备 33010602011771号