《黑客帝国》拉片
I.
矩阵由一个乘法和一个加法构成。显然,任何环上都可以定义矩阵。
用 \(\top\) 表示转置,\(\H\) 表示复共轭转置(Hermitian 转置)。
内积条件:
- \(\ip{\b x,\b x}\geq0\),当且仅当 \(\b x=\b0\) 时取等。
- \(\ip{\b x+\b z,\b y}=\ip{\b x,\b y}+\ip{\b z,\b y}\)。
- \(\ip{c\b x,\b y}=c^*\ip{\b x,\b y}\)。
- \(\ip{\b x,\b y}=\ip{\b y,\b x}^*\)。
范数条件:
- \(\|\b x\|\geq0\),当且仅当 \(\b x=\b0\) 时取等。
- \(\|c\b x\|=|c|\|\b x\|\)。
- \(\|\b x+\b y\|\leq\|\b x\|+\|\b y\|\)。
常见的内积:
- 复常数向量的内积:\(\ip{\b x,\b y}=\b x^\H\b y\)。
- 复函数向量的内积:\(\ip{\b x(t),\b y(t)}=\int_a^b\b x^\H(t)\b y(t)\d t\)。
- 复随机向量的内积:\(\ip{\b x(\xi),\b y(\xi)}=\E[\b x^\t H(\xi)\b y(\xi)]\)。
常见的范数:
- \(\ell_0\),不是范数,只是「准范数」。
- \(\ell_1\)。
- \(\ell_2\),称作 Euclidean 范数或 Frobenius 范数。
- \(\ell_\infty\)。
- \(\ell_p\),称作 Hölder 范数,需要 \(p\geq1\)。
- 加权范数/椭圆范数/RKHF 范数 \(\|\b x\|_A=\sqrt{\b x^\H A\b x}\),其中 \(A\) 正定。
相似性度量方法:
- Euclidean 距离。
- 夹角余弦值(通过 Cauchy 不等式定义)。
- (一般仅对非负向量考虑)Tanimoto 测度 \(T(\b x,\b y)=\dfrac{\ip{\b x,\b y}}{\|\b x\|^2_2+\|\b y\|^2_2-\ip{\b x,\b y}}\)。特别地,在 Boolean 向量的场合其变为 Jaccard 相似性 \(J(A,B)=\dfrac{|A\cap B|}{|A\cup B|}\)。对于 \(D(\b x,\b y)=1-T(\b x,\b y)\),其是距离,称作 Tanimoto 距离。
[!TIP]
此处的「测度」与测度论中的测度不同。更好的称呼或许是 Tanimoto 相似性。
可以参考 LLM 获取其在 hash 中的作用。
- Mahalanobis 距离。对于模式向量 \(\b s_{1\sim n}\),其 Gaussian 回归出均值 \(\b m\) 和协方差 \(\b C\),则定义 \(D(\b x,\b y)=\sqrt{(\b x-\b y)^\top\b C^{-1}(\b x-\b y)}\)。它是对数据做白化变换,把特征值全都设为 \(1\) 后的结果,因而无法区分椭圆的长轴与短轴。另一方面,在 Muon 中使用的 msign 则是把特征值保留符号。
线性相关:线性相关的向量列只保证存在一者可以被他者线性表出,不意味着所有向量都可以。
线性变换:对于两个不同向量空间间的映射,考虑两个空间各自的基变换,可以得到 \(\tilde{\b A}=\b Q^{-1}\b A\b P\) 的关系,于是满足该条件的矩阵 等价。而对于向量空间到自身的映射,对于基变换有 \(\tilde{\b A}=\b S^{-1}\b A\b S\) 的关系,满足该条件的矩阵 相似。
[!TIP]
没错,「等价」弱于「相似」:相似矩阵必然等价,反之不亦然。因为不同向量空间之间映射的性质不好,所以等价在此时是一个强概念;而向量空间到自身的映射性质更好,对它的期望更高,此时相似反倒是一个弱概念。
矩阵内积:就是拍扁后向量内积。
[!TIP]
为什么内积无区别?因为内积定义的是空间的结构,只要能定义内积就是合法的 Hilbert 空间。
矩阵范数:除了向量的三条以外,还有第四条:
- \(\|\b X\b Z\|_\alpha\leq\|\b X\|\|\b Z\|_\beta\)。其中 \(\|\cdot\|_\alpha,\|\cdot\|_\beta\) 分别是某个指定空间下的某种已知范数。这样定义的范数是「与 \(\alpha,\beta\) 相容的范数」。当然,也可以直接定义一族范数,这样的范数是自相容(子乘性)的。
这一条是「矩阵范数」区分于「矩阵上定义的向量范数」的根本:矩阵是一个线性算子,而范数则量化了其拉伸作用。
常见的矩阵范数:
-
首先是三种 \(p\) 范数。
-
诱导 \(p\)-范数/从属 \(p\)-范数 \(\|\b A\|_p=\max_{\|\b x\|_p=1}\|\b A\b x\|_p=\max\dfrac{\|\b A\b x\|_p}{\|\b x\|_p}\)。
其例子为:- 列和范数 \(\|\b A\|_1=\max_j\sum_i|a_{i,j}|\)。
- 谱范数 \(\|\b A\|_2=\sqrt{\lambda_\max(\b A^\H\b A)}=\sigma_\max(\b A)\)。
- 行和范数 \(\|\b A\|_\infty=\max_i\sum_j|a_{i,j}|\)。
一方面,按照定义它们与向量 \(\ell_p\) 范数相容。另一方面,
\[\|\b A\b B\b x\|_p\leq\|\b A\|_p\|\b B\b x\|_p\leq\|\b A\|_p\|\b B\|_p\|\b x\|_p \]其对于一切 \(\|\b x\|_p=1\) 均成立,于是直接有 \(\|\b A\b B\|_p\leq\|\b A\|_p\|\b B\|_p\),也即有自相容性。
-
元素 \(p\)-范数 \(\|\b A\|_{m_p}=n^{1-1/p}(\sum|a_{i,j}|^p)^{1/p}\)。一般只考虑方阵场合。
其例子为:- \(\|\b A\|_{m_1}=\sum|a_{i,j}|\)。
- \(\|\b A\|_{m_p}=n\max|a_{i,j}|\)。
前面带上的神秘幂次是不可省的,用以补偿矩阵的求和效应:只有这样才能保证自相容性。因此元素 \(p\)-范数没有诱导 \(p\)-范数紧。
其与对应的向量 \(\ell_p\) 范数相容,同时自相容。
-
Schatten \(p\)-范数 \(\|\b A\|_{S_p}=(\sum\sigma_i^p)^{1/p}\),其中 \(1\leq p\leq\infty\)。
其例子为:- \(p=1\) 时的核范数 \(\|\b A\|_*=\sum\sigma_i\)。
- \(p=2\) 时的 Frobenius 范数 \(\|\b A\|_\t F=\sqrt{\sum|a_{i,j}|^2}=\sqrt{\tr(\b A^\H\b A)}=\sqrt{\sum\sigma_i^2}\)。
- \(p=\infty\) 时就是谱范数。
不论 \(p\) 为何值,它们统一与向量的 \(\ell_2\) 范数相容;同时它们自相容。
其优势在于旋转不变性。
因为 Schatten \(p\)-范数可以被看做对奇异值向量的 \(\ell_p\) 范数,所以其能更好继承向量范数的不等式。例如矩阵 Hölder 不等式:\(|\tr(\b A^\H\b B)|=|\ip{\b A,\b B}_\t F|\leq\|\b A\|_{S_p}\|\b B\|_{S_q}\),其中 \(1/p+1/q\)
这三种 \(p\) 范数的 notation 有时会被混用,注意区分。
-
-
与 Mahalanobis 距离类似的 Mahalanobis 范数 \(\|\b A\|_\Omega=\sqrt{\tr(\b A^\top\Omega\b A)}\),一般与向量的 Mahalanobis 范数 \(\|\b x\|_\Omega=\sqrt{\b x^\top\Omega\b x}\) 配合。但是要满足相容性和自相容性,需要对 \(\Omega\) 的谱加以限制,具体地要求 \(\lambda_\min(\Omega)\geq1\)。
行列式。
- 分块矩阵行列式:\(\det\bmat{\b A&\b B\\\b C&\b D}=\det\b A\det(\b D-\b C\b A^{-1}\b B)\),需求 \(\b A\) 可逆。
- Hadamard 不等式:对于正定或半正定的 \(\b A\),有 \(\det(\b A)\leq\prod a_{i,i}\)。
迹。
- 相似不变性。
- 对角线元素之和,同时也是特征值之和。
II.
四种特殊矩阵:形状特殊;结构特殊;性质特殊;功能特殊。
-
形状特殊:
- 对角矩阵/反对角矩阵。
- 上三角/下三角。对角元素为 \(1\) 时称作单位上/下三角矩阵。
- 带状矩阵:只在 \(|i-j|\leq k\) 的区域有值。
- Hessenberg 矩阵:比上三角/下三角多一条对角线。
- 基本矩阵:\(\b E_{i,j}^{(m\times n)}\) 为只有 \((i,j)\) 为 \(1\) 其它都为 \(0\) 的矩阵。有分解 \(\b A=\sum\sum a_{i,j}\b E_{i,j}^{(m\times n)}\)。
-
性质特殊:
- 正交矩阵 \(\b Q\b Q^\top=\b Q^\top\b Q=\b I\)。
- 半正交矩阵(适用于非方阵)。
- 酉矩阵 \(\b U\b U^\H=\b U^\H\b U=\b I\)。
- 仿酉矩阵(非方阵)
- 正规阵 \(\b A^\H\b A=\b A\b A^\H\)。必须是方阵。
- Hadamard 矩阵:所有元素取 \(\pm1\),满足 \(\b H_n\b H_n^\top=\b H_n^\top\b H_n=n\b I_n\)。可以用 \(-1\) 乘以某一行或某一列保证 Hadamard 性,于是可以造出第一行第一列全为 \(1\) 的标准 Hadamard 性。可以把 \(4\) 个小 Hadamard 阵拼成一个边长翻倍的 Hadamard 阵,因此 Hadamard 阵只对 \(2\) 幂次边长有效。
正交矩阵信息熵密度高,对信息丢失很敏感。
-
功能特殊。
-
初等矩阵。
-
置换矩阵。
-
交换矩阵。
-
互换矩阵:就是反对角单位阵。
-
移位矩阵:描述 \(i\to i+1\) 的 shift。
-
广义置换矩阵:每行每列仅有一个非零元素的方阵。当且仅当其能被分解为置换阵和对角阵之积。
-
选择矩阵:描述选取某几行/某几列的矩阵。
-
Fourier 矩阵即单位根的 Vandermonde 矩阵。有 \(\b F^\H\b F=n\b I\),因此对于 DFT \(\hat{\b x}=\b F\b x\),其逆为 \(\b x=\dfrac1n\b F^\H\hat{\b x}\)。
-
这样的变换不对称,所以也可以用改造的 Fourier 矩阵 \(\hat{\b F}=\dfrac1{\sqrt n}\b F\)。
-
对称:\(\b A=\b A^\top\)。
-
反对称:\(\b A=-\b A^\top\)。
-
斜对称:关于副对角线对称。
-
中心对称。
-
复共轭对称(Hermitian)矩阵:\(\b A=\b A^\H\)。
-
反 Hermitian:\(\b A=-\b A^\H\)。
-
Vandermonde:\([x_i^j]\) 或 \([x_j^i]\)。
-
Toeplitz 矩阵:沿每一条对角线均相同的矩阵。描述了一个 stationary kernel。
-
对称 Toeplitz 矩阵。可以只由第一行描述,因此可记作 \(\b A=\t{Toep}[a_1,\dots,a_n]\)。
-
实 Toeplitz 矩阵引导的线性方程组有高效算法可以 \(O(n^2)\) 求解。
-
循环 Toeplitz 矩阵可以被 DFT 矩阵对角化;但因其不完全循环,DCT 矩阵则可将其转成一个高度对角化(但不完全对角)的矩阵,便于压缩或滤波。JPEG 就使用了相似的逻辑。
-
Hankel 矩阵:沿反对角线相同矩阵。无穷阶的 Hankel 矩阵有有限秩 \(r\),当且仅当其反对角线元素 \(s_0,s_1,\dots\) 满足常系数齐次线性递推关系 \(s_i=\sum_{j=1}^r\alpha_js_{i-j}\)。令 \(Q(x)=1-\alpha_1x-\dots-\alpha_rx^r\),则 \(S(x)Q(x)=P(x)\),其中 \(P\) 是度数小于 \(r\) 的多项式。故,以下三条件等价:
- 矩阵 \(\b S\) 有有限秩 \(r\)。
- 生成数列满足 \(r\) 阶常系数齐次线性递推关系。
- 生成函数是 \(r\) 阶有理函数。
-
离散 LTI 的冲激响应序列为 \(h\)、激励为自 \(0\) 时刻通入的 \(e\) 时,零状态响应 \(r\) 由卷积
\[r[n]=\sum_{k=0}^\infty e[k]h[n-k] \]描述。写成矩阵形式就是
\[\bmat{r[0]\\r[1]\\r[2]\\\vdots}=\bmat{h[0]&h[-1]&h[-2]&\dots\\h[1]&h[0]&h[-1]&\dots\\h[2]&h[1]&h[0]&\dots\\\vdots&\vdots&\vdots&\ddots}\bmat{e[0]\\e[1]\\e[2]\\\vdots} \]得到了一个 Toeplitz 矩阵。
另一方面,考虑零输入响应,即所有 \(n\geq0\) 有 \(e[n]=0\) 的场景,此时历史的 \(e\) 为系统提供了记忆,则有
\[\bmat{r[0]\\r[1]\\r[2]\\\vdots}=\bmat{h[1]&h[2]&h[3]&\dots\\h[2]&h[3]&h[4]&\dots\\h[3]&h[4]&h[5]&\dots\\\vdots&\vdots&\vdots&\ddots}\bmat{e[-1]\\e[-2]\\e[-3]\\\vdots} \]得到了一个 Hankel 矩阵。
-
循环矩阵。
-
III.
矩阵变换。
-
列向量化 \(\t{vec}\):按列拉直为列向量。
-
行向量化 \(\t{rvec}\):按行拉直为行向量。
-
矩阵化 \(\t{unvec}\):把向量一列列拼成矩阵(逆列向量化)。
-
(右)Kronecker 积:
\[\b A\otimes\b B=[a_{i,j}\b B]=\bmat{a_{1,1}\b B&\dots&a_{1,m}\b B\\\vdots&\ddots&\vdots\\a_{n,1}\b B&\dots&a_{n,m}\b B}_{np\times mq} \] -
左 Kronecker 积:\([\b A\otimes\b B]_\t{left}=[\b Ab_{i,j}]\)。
-
Kronecker 积满足:非交换性;\((\b A\b B)\otimes(\b C\b D)=(\b A\otimes\b C)(\b B\otimes\b D)\);关于加减的分配律;\((\b A\otimes\b B)^\dagger=\b A^\dagger\otimes\b B^\dagger\) 其中 \(\dagger\) 是伪逆。\(\tr(\b A\otimes\b B)=\tr(\b A)\tr(\b B),\rank(\b A\otimes\b B)=\rank(\b A)\rank(\b B)\)。
定理:\(\t{vec}(\b{ABC})=(\b C^\top\otimes\b A)\t{vec}(\b B)\)。对形如 \(\b A\b X\b B=\b D\) 或 \(\b A\b X+\b X\b B=\b C\) 的方程求解格外有用。
-
广义 Kronecker 积:对于多个形状相同的矩阵组 \(\cur{\b A_i}\),和行数与矩阵组长度相同的矩阵 \(\b B\) 的广义 Kronecker 积是
\[\cur{\b A}_n\otimes\b B=\bmat{\b A_1\otimes\b b_1\\\vdots\\\b A_n\otimes\b b_n} \]其中 \(\b b_i\) 是第 \(i\) 个行向量。
-
Khatri-Rao 积:对于 \(m\times n\) 的 \(\b A\) 和 \(p\times n\) 的 \(\b B\),有
\[\b A*\b B=\bmat{\b a_1\otimes\b b_1&\dots&\b a_n\otimes\b b_n}_{mp\times n} \]其中 \(\b a_i,\b b_i\) 是第 \(i\) 列。
-
Hadamard 积,也称 Schur 积。
-
直和:\(\b A\oplus\b B=\bmat{\b A&\b O\\\b O&\b B}\)。
矩阵分解。
- LU 分解 \(\b A=\b L\b U\),其中 \(\b A\) 是方阵、\(\b L\) 是下三角、\(\b U\) 是上三角。其不唯一,因此需要人为添加条件,即规定对角线元素值。
- Doolittle 分解:让 \(\b L\) 的主对角线为 \(1\),就是裸的 Gauss 消元的结果。
- Crout 分解:让 \(\b U\) 的主对角线为 \(1\)。
- LDR 分解:把主对角线单独抽离,有 \(\b A=\b{LDU}\),其中 \(\b L,\b D\) 的主对角线都为 \(1\)。
- 如果前 \(n-1\) 阶主子式 \(\Delta_k\neq0\),则三种分解都有唯一性,且 \(d_k=\Delta_k/\Delta_{k-1}\),其中 \(d_k\) 为 \(\b U/\b L/\b D\) 主对角线元素。
Givens 变换:对于标准正交基 \(\b e_1,\dots,\b e_n\),沿 \([\b e_i,\b e_j]\) 平面的顺时针旋转变换,对应的矩阵是 Givens 矩阵
Givens 矩阵可以选取适当的 \(\theta\) 把 \(i,j\) 两维的能量 \(x_i,x_j\) 集中到某一维上,变成 \(\sqrt{x_i^2+x_j^2},0\)。因此存在有限个 Givens 矩阵的乘积 \(\b G\),对非零的 \(\b x\) 有
进一步,\(\b e_1\) 可以换成任何单位向量。
Householder 矩阵:\(\b H=\b I-2\b u\b u^\top\),其中 \(\b u\) 是单位向量,对应的线性变换是 Householder 变换,即 \(\b H\b x=\b x-2\b u(\b u^\top\b x)\)。可以发现,它是关于 \(\b u\) 的反射变换。
则对于任何单位向量 \(\b z\),都存在 Householder 矩阵使得 \(\b H\b x=\|\b x\|_2\b z\),同时 Givens 矩阵总是可以表示为两个 Householder 矩阵的乘积。
Cholesky 分解:任何实对称正定矩阵都存在下三角矩阵 \(\b L\) 使得 \(\b A=\b L\b L^\top\),且若限定对角元素为正则分解唯一。
Schur 分解:任何复方阵 \(\b A\) 都存在酉矩阵 \(\b P\) 使得 \(\b P^{-1}\b A\b P=\b P^\H\b A\b P=\b R\),其中 \(\b R\) 是对角线元素为全体特征值的上三角阵。于是 \(\b A=\b P\b R\b P^\H\)。
QR 分解:若 \(\b A_{m\times n}\) 矩阵满足 \(n\leq m\) 且满列秩,则存在仿酉的 \(\b Q_{m\times n}\) 和上三角的 \(\b R_{n\times n}\) 使得 \(\b A=\b Q\b R\),且除了一个对角线元素的模长均为 \(1\) 的对角矩阵因子外分解唯一。
- Householder 法:用 Householder 矩阵可以依次把主对角线下方元素全部消成零,且如果从左往右消的话,新矩阵不会破坏已消掉的部分(因为第 \(i\) 次选取的 \(\b u\) 与 \(\b e_1,\dots,\b e_{i-1}\) 全部正交)。
- Givens 法:一次只动一个元素,对稀疏矩阵和 Hessenberg 矩阵友好。
满秩分解:\(\b A_{m\times n}=\b F_{m\times r}\b G_{r\times n}\)。
特征值分解。奇异值分解。
总结:
- 相抵变换(等价关系):\(\b B=\b P\b A\b Q\),其中 \(\b P,\b Q\) 均可逆。相抵变换不改变秩;任意矩阵都可以被相抵变换为左上角为 \(\b I_r\)、此外全零的矩阵。
- 相似变换:\(\b B=\b P^{-1}\b A\b P\)。相似变换不改变谱;可对角化时可以被相似变换为对角阵,否则变换为 Jordan 标准型。
- 合同变换:\(\b B=\b P^\H\b A\b P\),主要用于研究二次型(Hermitian 阵)。不改变对称性和惯性(Sylvester 惯性定律)。标准型是 msign。
- 正交相似变换/酉变换:\(\b B=\b Q^\top\b A\b Q\)(\(\b Q\) 正交)或 \(\b B=\b U^\H\b A\b U\)(\(\b U\) 酉)。标准型是谱分解或 Schur 分解。
IV.
矩阵求逆。有很多神奇的求逆公式。
- Sherman-Morrison 处理低秩修正:\(\b A+\b x\b y^\t H\)。
- Woodbury 进一步扩展:\(\b A+\b U\b B\b V\)。
- Duncan-Guttman:\(\b A-\b U\b D^{-1}\b V\)。
- 分块矩阵 \(\bmat{\b A&\b U\\\b V&\b D}\):在 \(\b A\) 可逆、\(\b A,\b D\) 均可逆时,各自有公式。
- Hermitian 矩阵 \(\b R_{m+1}=\bmat{\b R_m&\b r_m\\\b r_m^\H&\rho_m}\),则它们的逆存在递推公式。
非方阵的场合,可以对 \(m\times n\) 矩阵 \(\b A\) 与另一个 \(n\times m\) 矩阵 \(\b G\) 提出以下性质:
- \(\b{AGA}=\b A\)。
- \(\b{GAG}=\b G\)。
- \(\b{AG}^\H=\b{AG}\),即 \(\b{AG}\) 是 Hermite 矩阵。
- \(\b{GA}^\H=\b{GA}\),同上。
满足以上性质的称作 Moore-Penrose 广义逆,可以证明其存在且唯一,记作 \(\b A^\dagger\)。特别地,只满足某几条的矩阵可以使用编号来命名,例如 \(\b A^{(1,2,4)}\),某些特殊的方案也有专有名称:
- (1) 称作 基本广义逆,记作 \(\b A^-\)。它的意义在于对线性方程 \(\b{Ax}=\b b\) 求解:当 \(\b b\neq\b0\),且方程一致(存在解)时,解 \(\b x_0\) 和广义逆乘积 \(\b{Gb}\) 存在一一对应关系。
- (1,2) 称作 自反广义逆 (reflextive generalized inverse)。
- (1,2,3) 称作 正规广义逆 (normalized generalized inverse)。
- (1,2,4) 称作 弱广义逆 (weak generalized inverse)。
满足 \(\b{LA}=\b I\) 的矩阵 \(\b L\) 被称作 左逆矩阵。左乘不改变行秩,因此只有行数 \(m\) 大于等于列数 \(n\) 时,得到的 \(n\times n\) 矩阵才可能为单位阵,左逆才能存在。进一步,左逆存在当且仅当满列秩,但在 \(m>n\) 时其不唯一。
同理,满足 \(\b{AR}=\b I\) 即是 右逆矩阵。右乘不变列秩,因此只有 \(m\leq n\) 时右逆可能存在。同理,右逆存在当且仅当满行秩。
容易验证,左逆和右逆都是基本广义逆;另一方面,满列秩时基本广义逆都是左逆,满行秩时都是右逆:因为 \(\rank(\b A^-\b A)=\rank(\b A\b A^-)=\rank(\b A)\)。
虽然左/右逆不唯一,但是 \(\b L=(\b A^\H\b A)^{-1}\b A^\H\) 可以显式确定一个特定的左逆阵,称作 左伪逆矩阵。同理,\(\b R=\b A^\H(\b A^\H\b A)^{-1}\) 是对应的 右伪逆矩阵。这两个东西在 最小二乘法 中见过类似的结构:事实上,\(\b L\b b\) 给出了超定方程组 \(\b A\b x=\b b\) 的最小误差近似。
普通逆的若干性质对广义逆并不成立。具体地:
基本广义逆满足:
- \((\b A^-)^\H=(\b A^\H)^-\)。
- \((\lambda\b A)^-=\lambda^\dagger\b A^-\),其中 \(\lambda^\dagger\) 在 \(\lambda\neq0\) 时为 \(\lambda^{-1}\),否则为 \(0\)。
- \(\rank(\b A^-)\geq\rank(\b A)\)。【与普通逆不同!】
- \((\b A\b B)^-\) 和 \(\b A^-,\b B^-\) 没有明确关系;\((\b A^-)^-\) 和 \(\b A\) 也没有明确关系。
Moore-Penrose 逆满足:
- 矩阵可逆时,\(\b A^{-1}=\b A^\dagger\)。
- 满列秩/行秩时,左/右伪逆就是 M-P 逆。
- 左逆是 (1,2,4) 逆,右逆是 (1,2,3) 逆。
- 一般地,\((\b{AB})^\dagger\neq\b A^\dagger\b B^\dagger\);但是,如果 \(\rank(\b A\b B)=\rank(\b A)=\rank(\b B)\),换言之 \(\b A,\b B\) 是 \(\b A\b B\) 的满秩分解,则此时成立。
- \(\b A^\dagger=\b A^{(1,4)}\b A\b A^{(1,3)}\)。
- \(\b A^\dagger=(\b A^\H\b A)^\dagger\b A^\H=\b A^\H(\b A\b A^\H)^\dagger\)。
- \((\b A^\dagger)^\dagger=\b A\)。
- 对角阵的 M-P 逆是把全体非零元求逆、零元保持。
- \(\rank(\b A^\dagger)=\rank(\b A)\)。
在线性映射 \(\b x\mapsto\b A\b x\) 的角度审视 M-P 四条件。
- \(\b{AGA}=\b A\)。这是一切的基础,即基本广义逆;常用的逆的定义都保证这一点。它要求,「至少在 \(\b A\) 的列空间中,\(\b G\) 像是一个逆,把 \(\b A\b x=\b b\) 中的 \(\b b\) 通过 \(\b x=\b G\b b\) 拉回到 \(\b x\) 上」。
- \(\b{GAG}=\b G\)。与第一条结合,保证了 \(\rank(\b A)=\rank(\b B)\)。
- \(\b{AG}^\H=\b{AG}\)。(1,2,3) 是左伪逆,因此保证超定方程组的误差 \(\|\b A\b x-\b b\|_2\) 最小。
- \(\b{GA}^\H=\b{GA}\)。用来保证本身范数 \(\|\b x\|_2\) 最小。
假设在 SVD 视角下是 \(\b A=\b{U\Sigma\b V}^\H\),其中 \(\b\Sigma=\bmat{\b\Sigma_r&\b0\\\b0&\b0}\)。则全体广义逆都可以写成
则四个条件分别对应着:
- \(\b{AGA}=\b A\iff\b X_{1,1}=\b\Sigma_r^{-1}\),对另外三个矩阵没有限制。
- \(\b{GAG}=\b A\iff\b X_{2,2}=\b X_{2,1}\b\Sigma_r\b X_{1,2}\)。
- \(\b{AG}^\H=\b{AG}\iff\b X_{1,2}=\b0\)。
- \(\b{GA}^\H=\b{GA}\iff\b X_{2,1}=\b0\)。
如何算 M-P 逆?
- 直接嗯解方程。具体地,从 \(\b A\b A^\H\b X^\H=\b A\) 解出 \(\b X\),从 \(\b A^\H\b A\b Y=\b A^\H\) 解出 \(\b Y\),然后有 \(\b A^\dagger=\b X\b A\b Y\)。
- 递推算。
- 迹方法。
- SVD。
- 满秩分解。
V.
定理:矩阵方程组 \(\b{AXB}=\b D\) 相容(有解)的充要条件是 \(\b A\b A^{(1)}\b D\b B^{(1)}\b B=\b D\),通解为 \(\b X=\b A^{(1)}\b D\b B^{(1)}+\b Y-\b A^{(1)}\b A\b Y\b B\b B^{(1)}\),其中 \(\b Y\) 任意。
推论:线性方程组 \(\b{Ax}=\b b\) 相容的充要条件是 \(\b A\b A^{(1)}\b b=\b b\),通解为 \(\b x=\b A^{(1)}\b b+(\b I-\b A^{(1)}\b A)\b z\)。
另一方面,基本广义逆集合 \(\b A\cur{1}\) 与特解 \(\b A^{(1)}\) 的关系是 \(\b A\cur{1}=\cur{\b A^{(1)}+\b Z-\b A^{(1)}\b A\b Z\b A\b A^{(1)}\mid\b Z\in\C^{n\times m}}\)。
定理:线性方程组 \(\b{Ax}=\b b\) 的极小 \(2\)-范数解唯一,它位于 \(\b A^\H\) 的列空间中。
定理:\(\b A\cur{1,4}\) 由方程 \(\b X\b A=\b A^{(1,4)}\b A\) 的所有解 \(\b X\) 组成,其中 \(\b A^{(1,4)}\) 是特解。于是 \(\b A\cur{1,4}=\cur{\b A^{(1,4)}+\b Z-\b Z\b A\b A^{(1,4)}\mid\b Z\in\C^{n\times m}}\)。则极小范数解可以且仅可以写成 \(\b x=\b A^{(1,4)}\b b\) 的形式。
同理,\(\b A\cur{1,3}\) 是 \(\b A\b X=\b A\b A^{(1,3)}\) 的解,\(\b A\cur{1,4}=\cur{\b A^{(1,4)}+\b Z-\b A^{(1,3)}\b A\b Z\mid\b Z\in\C^{n\times m}}\),对应最小二乘解。
最新版的 JPEG 压缩流程是:先小波变换 \(\b x=\b\Psi^\top\b s\),然后扔掉 \(\b 0\) 得到 \(M\ll N\) 的 \(\hat{\b x}\),传输,然后补零并重建 \(\hat{\b s}=\b\Psi\hat{\b x}\)。
这个流程涉及到弃零-补零的流程。
已知小波变换后的 \(\b x\) 是稀疏的,换言之 \(\|\b x\|_0\ll N\)。现在用一个 \(M\times N\) 的压缩阵 \(\b\Phi\) 压缩 \(\b s\) 得到 \(\b y\),则有
压缩感知表明,在 \(\b\Phi\) 是 RIP 阵时,最小化 \(\ell_0\) 范数等效于最小化 \(\ell_1\) 范数,于是求 \(\b{\Phi\b\Psi\b x}=\b y\) 的最小范数解,此时的矩阵 \(\b\Phi\b\Psi\) 是 \(M\times N\) 的扁矩阵。
VI.
参数是实数、值是实矩阵 \(\b A(t)\) 的导数就是每一项分别求导。
参数是实矩阵、值是实 \(f(\b X)\) 的导数是 \(\left(\dfrac{\p f}{\p x_{i,j}}\right)_{m\times n}\) 的梯度矩阵;如果矩阵是行/列向量,则就是梯度/梯度转置。
参数和值都是实矩阵时,\(\b F(\b X)\) 的导数有类似 Kronecker 积的形式 \(\left(\dfrac{\p\b F(\b X)}{\p x_{i,j}}\right)_{m\times n}\)。
定义:
- \(f(\b x)\) 的梯度 \(\nabla_\b x f(\b x)\) 与 \(\b x\) 同形状,而协梯度 \(\D_\b xf(\b x)\) 是梯度的转置。
- \(f(\b X)\) 的梯度 \(\nabla_\b Xf(\b X)\) 与 \(\b X\) 同形状,协梯度 \(\D_\b Xf(\b X)\) 是其转置,可以向量化展平为 \(\t{vec}(\nabla_\b Xf(\b X))\)。
- \(\b f(\b x)\) 的 Jacobian 就是协梯度矩阵 \(\D_\b x\b f(\b x)\):若 \(\b f\) 是 \(p\) 维、\(\b x\) 是 \(n\) 维,其形状为 \(p\times n\)。
- \(\b F(\b X)\) 的行向量偏导 \(\D_{\t{vec}(\b X)}\b F(\b X)=\dfrac{\d\t{vec}{\b F(\b X)}}{\d\t{vec}^\top(\b X)}\)。
- Hessian \(\dfrac{\d^2f(\b x)}{\d\b x\d\b x^\top}\)。\(\nabla^2_\b xf(\b x)=\D_\b x(\nabla_\b xf(\b x))=\nabla_{\b x^\top}(\nabla_\b xf(\b x))\)。\(\nabla^2_\b Xf(\b X)=\D_\b X(\nabla_\b Xf(\b X))\)。
全微分
(为什么要把它向量化?因为本质上是张量积,只有向量化后才能定义合适的向量积)
因此,实值标量函数可微分,则其对应的梯度 \(\nabla_\b Xf(\b X)\) 有定义,即为协梯度转置。形式化地,
复矩阵的微分更倾向于使用形式导数或称 Wirtinger 导数 的方式描述。具体地,复变量 \(z=x+\j y\) 的实部和虚部彼此独立
于是
而在向量的场合,可以定义梯度算子和共轭梯度算子
以及协梯度算子、共轭协梯度算子
(区分 \(\b z^*\)、\(\b z^\top\) 和 \(\b z^\H\))
复向量函数微分:
复矩阵函数微分:
复 Hessian:
这个 \(\b H\) 是 Hermitian 的:有 \(\b H=\b H^\H\),被称作全 Hessian 矩阵。
VII.
考虑等式约束的优化问题
其中 \(\b A\in\R^{m\times n}(m\leq n)\),即约束是欠定方程。
- 可以直接使用 Lagrange 乘子法。
- 当 \(\b A\) 满行秩时,可以对 \(\b A\) 消元变成无约束优化问题。
梯度下降
Newton 迭代
- 缺点:需要对 Hessian 求逆(而它一般不可逆)。
Levenberg-Marquardt 法
加上 \(\delta\b I\) 把 Hessian 强制改造为正定进而可逆。
共轭梯度法:一种用于求解线性方程组 \(\b A\b x=\b b\) 的方法。
引理:对于 Hermitian 正定矩阵 \(\b B\),称非零向量组 \(\cur{\b p}\) 关于 \(\b B\) 相互共轭,若对于 \(i\neq j\) 有 \(\b p_i^\H\b B\b p_j=0\)。因为 \(\b B\) 是 Hermitian 正定的,易推知 \(\cur{\b p}\) 是在原始空间下也是正交的。
现在考虑把 \(\b A\b x=\b b\) 的解 \(\b x\) 在相互共轭基上分解。
- 如果 \(\b A\) 本身就是 Hermitian 正定矩阵,那么没有问题。
- 否则,只要 \(\b A\) 满行秩,方程 \(\b A^\H\b A\b x=\b A^\H\b b\) 就与原方程同解,因此可以转而对 \(\b A^\H\b A\) 考虑。因此,一般地,我们认为 \(\b A\) 是正定的。
假设已经有相互共轭基,则可以直接通过
求出系数 \(\cur{\alpha}\) 进而还原出 \(\b x\)。问题是这个相互共轭基怎么造?
一个朴素的想法类似 Gram-Schmidt 正交化。具体地,令当前迭代解是 \(\b x_k\),\(\b g_k=\b A\b x_k-\b b\) 是残差,我们希望从中剔除所有与历史 \(\b p_i\) 正交的部分得到当前的 \(\b p_k\)。具体地,有
理论上,只要取 \(\b p_k=\sum\beta_i\b p_i-\b g_k\) 就能得到下一个相互共轭向量。但是,由正交性可以发现对所有 \(i<k-1\) 系数 \(\beta_i=0\)。于是算法可以直接表述为:
- 计算残差 \(\b g_k=\b A\b x_k-\b b\)。特别地,令二次泛函 \(J(\b x)=\dfrac12\b x^\H\b A\b x-\b b^\H\b x\),则残差就是共轭梯度 \(\nabla_{\b x^*}J(\b x)\),因此这个算法也得名为共轭梯度法。
- 计算基向量 \(\b p_k=-\b g_k+\beta_{k-1}\b p_{k-1}\),其中 \(\beta_{k-1}=\dfrac{\b p_{k-1}^\H\b A\b g_k}{\b p_{k-1}^\H\b A\b p_{k-1}}\)。可以发现,这样做只用存储前一个基向量 \(\b p_{k-1}\),而不用存储所有历史基向量。
- 修正 \(\b x_{k+1}=\b x_k+\alpha_k\b p_k\),其中 \(\alpha_k=\dfrac{\b p_k^\H\b b}{\b p_k^\H\b A\b p_k}=-\dfrac{\b p_k^\H\b g_k}{\b p_k^\H\b A\b p_k}\)。
其性质概括如下:
- 相互共轭性:\(\b p_i^\H\b A\b p_k=0\)。
- 正交性:\(\b g_k^\H\b g_i=0\)。
- 下降性:\(\b p_k^\H\b g_k\leq0\)。
VIII.
若 \(\b A\b u=\lambda\b u\),则 \(\lambda\) 是特征值、\(\b u\) 是特征向量、\((\lambda,\b u)\) 是特征对。
- 特征的代数重数是 \(\det(\b A-\lambda\b I)\) 的重根次数。
- 而几何重数是能找到的线性无关特征向量数目。
- 简单特征值 (simple eigenvalue) 是有 \(1\) 的代数重数的特征值。非简单特征值即为多重特征值。半单特征值 (semi-simple) 是代数重数等于几何重数的特征值,否则即为亏损特征值 (defective eigenvalue)。
性质报菜名:
- 若 \(\lambda\) 是 \(\b A\) 特征值,则:
- \(\lambda\) 是 \(\b A^\top\) 特征值。
- \(\lambda^*\) 是 \(\b A^\H\) 特征值。
- \(\lambda+\sigma^2\) 是 \(\b A+\sigma^2\b I\) 特征值。
- 可逆时,\(1/\lambda\) 是 \(\b A^{-1}\) 特征值。
- \(\lambda^k\) 是 \(\b A^k\) 特征值。
- 幂等矩阵 \(\b A^2=\b A\) 的特征值为 \(0\) 或 \(1\)。
- 特征值的积是行列式,和是迹;相似矩阵保特征值。
- 若 \((\lambda,\b u)\) 是 \(\b A\) 的特征对,则对于多项式 \(f(\cdot)\),\((f(\lambda),\b u)\) 是 \(f(\b A)\) 的特征对;\((e^\lambda,\b u)\) 是 \(e^\b A\) 的特征对。
- \((\lambda_A\lambda_B,\b u_A\otimes\b u_B)\) 是 Kronecker 积 \(\b A\otimes\b B\) 的特征对。
- \((\lambda_A,\b u_A\oplus\b 0),(\lambda_B,\b0\oplus\b u_B)\) 是直和 \(\b A\oplus\b B\) 的特征对。
- \(\b{AB}\) 与 \(\b{BA}\) 特征值相同。
可对角化当且仅当存在 \(n\) 个线性无关特征向量,当且仅当所有特征值都半单。若存在 \(n\) 个不同特征值则必然可对角化。
好玩的小定理之 Wilkinson 交织定理,描述了低秩修改矩阵的谱变化量。具体地,令 \(\cur\lambda\) 是对称矩阵 \(\b A\) 的降序排列特征值,\(\b z\) 是单位向量,\(\cur\xi\) 是 \(\b A+a\b z\b z^\top\) 的降序排列特征值,则:
- 当 \(a>0\) 时,有 \(\xi_1\geq\lambda_1\geq\dots\geq\xi_n\geq\lambda_n\)。
- 当 \(a<0\) 时,有 \(\lambda_1\geq\xi_1\geq\dots\geq\lambda_n\geq\xi_n\)。
同时总是有 \(\sum\xi_i-\lambda_i=a\)。
考虑一个具体的问题:矩阵 \(\b A\) 在扰动 \(\b A+\eps\b E\) 下,特征对 \((\lambda,\b u)\) 的变动是多少?
假设有一阶近似 \(\lambda(\eps)=\lambda+\eps\dot\lambda+O(\eps^2),\b u(\eps)=\b u+\eps\dot{\b u}+O(\eps^2)\),则有
考虑 \(\lambda\) 的任一左特征向量 \(\b v\),左乘得到
于是我们发现,特征值变化率与左右特征向量夹角 \(\theta(\b u,\b v)\) 相关:夹角如果很小的话,在特定的扰动 \(\b E\) 下就会有很大的变动。所以定义 条件数 \(\t{cond}(\lambda)=\max1/\cos\theta(\b u,\b v)\)(在重数为 \(1\) 时,不需要取 \(\max\);在重数非 \(1\) 时,我们在意最劣情况),则它衡量了该特征值的稳定性。
定义:所有特征值合称谱,记作 \(\lambda(\b A)\)。特征值的最大模长称为谱半径,记作 \(\lambda(\b A)\)。
定义:实对称矩阵的惯性为三元组 \(\t{In}(\b A)=(i_+(\b A),i_-(\b A),i_0(\b A))\),即正、负零特征值个数(计算重数)。\(i_+(\b A)-i_-(\b A)\) 称作矩阵的符号差。Sylvester 惯性定理 指出,对于实对称的 \(\b A\) 和任意可逆的 \(\b C\),都有 \(\t{In}(\b A)=\t{In}(\b C^\top\b A\b C)\)。
谱分解:考虑 \(\b A\) 的特征对 \((\lambda_i,\b p_i)\) 和 \(\b A^\H\) 的特征对 \((\lambda_j^*,\b q_j)\)。
- 因为 \(\b q_i^\H\b A\b p_j=\lambda_i\b q_i^\H\b p_j=\lambda_j\b q_i^\H\b p_j\),所以若 \(\lambda_i\neq\lambda _j\) 则必有 \(\b q_i^\H\b p_j=0\)。
- 反之,若 \(\lambda_i=\lambda_j\),则若 \(\b p_i\) 确定,则可以唯一推出相应的 \(\b q_j\) 使得 \(\b q_j^\top\b p_i=1\)。
[!NOTE]
从另一个角度,\(\b A^\H\) 的特征向量与 \(\b A\) 的左特征向量之间存在共轭关系,因此其与条件数也有联系:如果条件数很大(夹角很大),那么为了保证 \(\b q_j^\top\b p_i=1\),两个向量之一就必须很大。
于是:
- 对于可对角化的 \(\b A\),令 \(\b P\) 为其特征向量矩阵,则可以唯一确定 \(\b Q\) 满足 \(\b Q^\H\b P=\b I\) 且 \(\b Q\) 是 \(\b A^\H\) 的特征向量。
- 谱分解指出,\(\b A=\sum\lambda_i\b p_i\b q_i^\H\)。
Hermitian 矩阵:
- 有实特征值。
- 可逆时,令 \((\lambda,\b u)\) 是特征对,则 \((\lambda^{-1},\b u)\) 是 \(\b A^{-1}\) 的特征对。
Hermitian 矩阵是正定的,当且仅当:
- 二次型函数 \(\b x^\H\b A\b x>0\)。
- 所有特征值为正。
- 所有主子矩阵 \(\b A_{1:k,1:k}\) 行列式为正。
- 存在可逆矩阵 \(\b R\) 使得 \(\b A=\b R^\H\b R\)。
- 任一合同变换 \(\b P^\H\b A\b P\) 后仍然正定。
求特征值/特征向量。
- 最大特征值:power method。
- 最小特征值:\(\lambda\b I-\b A\) 使用 power method。
- 最小模长特征值:对 \(\b A^{-1}\) 使用 power method。
- 中间特征值:每次求出一个特征向量后用 Householder 变换把它干掉;也可以对 \((\b A-\sigma\b I)^{-1}\) 求出在 \(\sigma\) 附近的特征值。
Gerschgorin 定理:
- 定义 Gerschgorin 圆是 \(|\lambda-a_{i,i}|=\sum_{j\neq i}|a_{i,j}|\),则每个特征值都位于某个 Gerschgorin 圆中。(证明直接对特征值方程 \(\b A\b x=\lambda\b x\) 中的某一行展开分析即可!)
- Gerschgorin 圆构成的所有连通块中,每个包含 \(k\) 个圆的连通块中恰包含 \(k\) 个计算重数的特征值。
- Gerschgorin 圆是行求和,对应右特征向量;列求和对应左特征向量。
推论:孤立的 Gerschgorin 圆中恰有一个特征值;实矩阵的孤立 Gerschgorin 圆中恰有一个实特征值(因为实矩阵的复特征值成对,而实矩阵的 Gerschgorin 圆心总是在实轴上);相似变换不改变特征值但却显著改变 Gerschgorin 圆的分布。
定义:\(R_i(\b A)=\sum_{j\neq i}|a_{i,j}|\),则:
- 若全体 \(|a_{i,i}|>R_i\) 称作 行严格对角占优。
- 若全体 \(|a_{i,i}|\geq R_i\) 且至少一个严格则称作 行弱对角占优。
则行/列严格对角占优意味着可逆。
引理:单位向量 \(\b x\) 满足 \(|\b x^\H\b A\b x|\leq\|\b A\|_{m_\infty}=n\max|a_{i,j}|\)。
定理:特征值 \(\lambda\) 满足 \(|\lambda|\leq\|\b A\|_{m_\infty}\)。同时,\(|\t{Re}(\lambda)|\leq\dfrac12\|\b A+\b A^\H\|_\infty,|\t{Im}(\lambda)|\leq\dfrac12\|\b A-\b A^\H\|_\infty\);
推论:Hermitian 矩阵的特征值都在实轴上;反 Hermitian 矩阵的特征值都在虚轴上。
Schur 引理:可对角化的矩阵可以被酉变换为上三角矩阵。
Schur 不等式:\(\sum|\lambda_i|^2\leq\sum|a_{i,j}|^2=\|\b A\|_\t F^2\);当且仅当是正规矩阵时取等。
Cayley-Hamilton 定理:特征多项式 \(\det(\b A-x\b I)\) 是最小零化多项式。
用于求逆:令特征多项式是 \(\sum p_ix^i\),则有 \(\b A^{-1}=-\dfrac1{p_0}\sum p_i\b A^{i-1}\)。
Decell 定理:对于 \(m\times n\) 矩阵 \(\b A\),令 \(\b A\b A^\H\) 的特征多项式为 \(f(\lambda)=(-1)^m\sum a_i\lambda^{m-i}\) 其中 \(a_0=1\),则令 \(k\) 为最大的满足 \(a_k\neq0\) 的整数,则 \(k=\rank(\b A)\) 且 M-P 逆满足
于是可以由此计算 M-P 逆。

浙公网安备 33010602011771号