L2 范数及 Ln 范数

一、什么是 L2 范数(\(\ell_2\) Norm)?

1. 直观理解:向量的"长度"

L2 范数就是我们最熟悉的欧几里得长度——从原点到向量终点的直线距离。

2. 严格定义

对于 \(n\) 维向量 \(x = (x_1, x_2, \ldots, x_n)\),其 L2 范数为:

\[\|x\|_2 = \sqrt{x_1^2 + x_2^2 + \cdots + x_n^2} = \sqrt{\sum_{i=1}^n x_i^2} \]

更一般地,Lp 范数定义为 \(\|x\|_p = \left(\sum |x_i|^p\right)^{1/p}\),L2 是 \(p=2\) 的特例。

3. 核心性质

  • 正定性\(\|x\|_2 \geq 0\),且 \(\|x\|_2 = 0 \iff x = 0\)
  • 齐次性\(\|\alpha x\|_2 = |\alpha| \cdot \|x\|_2\)
  • 三角不等式\(\|x + y\|_2 \leq \|x\|_2 + \|y\|_2\)

这三条是"范数"的公理,L2 范数全部满足。

4. 与微积分/优化的深度连接

从你熟悉的分析视角来看,L2 范数有几个关键优势:

  • 光滑性\(\|x\|_2^2 = \sum x_i^2\) 处处可微,梯度为 \(2x\),Hessian 为 \(2I\)(常数正定矩阵)。这使得基于 L2 的优化问题有闭式解。
  • 旋转不变性:对任意正交矩阵 \(Q\)\(\|Qx\|_2 = \|x\|_2\)。这意味着 L2 范数只关心向量的"内在长度",不依赖于坐标系的选择。
  • 与内积的关系\(\|x\|_2^2 = \langle x, x \rangle\),L2 范数平方就是向量与自身的内积。这直接连接到了 \(X^TX\)——它本质上是在计算特征向量之间的内积矩阵(Gram 矩阵)。

5. 为什么最小二乘用 L2 而不是 L1?

对比项 L2 范数(平方) L1 范数(绝对值)
光滑性 处处可微 在原点不可微
闭式解 有(正规方程) 无,需迭代求解
对大误差 惩罚更重(平方放大) 惩罚线性
对异常值 敏感 鲁棒
Hessian 常数矩阵 \(X^TX\) 不存在/不连续

L2 的选择本质上是用光滑性换取解析可解性——这正是牛顿法能一步收敛的根源。


二、两者如何串联起最小二乘的几何图景?

把两个概念放在一起,最小二乘的完整几何故事就清晰了:

  1. 列空间定义了"模型能表达的范围"——所有可能的预测值 \(Xw\) 都落在这个子空间里
  2. L2 范数定义了"距离的度量方式"——我们用欧氏距离衡量预测值与真实值的差距
  3. 最小二乘 = 在列空间中找一点,使它到 \(y\) 的 L2 距离最小 = 正交投影

而投影的最优条件恰好是:残差 \(y - Xw^*\) 与列空间中的每个基向量(即 \(X\) 的每一列)都正交,即:

\[X^T(y - Xw^*) = 0 \quad \Rightarrow \quad X^TXw^* = X^Ty \]

你看,\(X^TX\) 又出现了——它既是 Gram 矩阵(列空间的内积结构),又是 Hessian(误差曲面的曲率),还是投影算子的核心组成部分。这三重身份在 L2 几何下完美统一。

posted @ 2026-09-16 19:39  立体风  阅读(12)  评论(0)    收藏  举报