《黑客帝国》拉片

\[\newcommand{\b}{\boldsymbol} \newcommand{\t}{\text} \newcommand{\d}{\mathrm d} \newcommand{\p}{\partial} \newcommand{\cur}[1]{\left\{#1\right\}} \newcommand{\c}{\mathcal} \newcommand{\R}{\mathbb R} \newcommand{\eps}{\epsilon} \newcommand{\E}{\mathop{\mathbb E}\limits} \newcommand{\ip}[1]{\left<#1\right>} \newcommand{\H}{\mathrm H} \newcommand{\tr}{\operatorname{tr}} \newcommand{\rank}{\operatorname{rank}} \newcommand{\bmat}[1]{\begin{bmatrix}#1\end{bmatrix}} \newcommand{\D}{\mathrm D} \newcommand{\i}{\mathtt i} \newcommand{\j}{\mathtt j} \]

I.

矩阵由一个乘法和一个加法构成。显然,任何环上都可以定义矩阵。

\(\top\) 表示转置,\(\H\) 表示复共轭转置(Hermitian 转置)。

内积条件:

  • \(\ip{\b x,\b x}\geq0\),当且仅当 \(\b x=\b0\) 时取等。
  • \(\ip{\b x+\b z,\b y}=\ip{\b x,\b y}+\ip{\b z,\b y}\)
  • \(\ip{c\b x,\b y}=c^*\ip{\b x,\b y}\)
  • \(\ip{\b x,\b y}=\ip{\b y,\b x}^*\)

范数条件:

  • \(\|\b x\|\geq0\),当且仅当 \(\b x=\b0\) 时取等。
  • \(\|c\b x\|=|c|\|\b x\|\)
  • \(\|\b x+\b y\|\leq\|\b x\|+\|\b y\|\)

常见的内积:

  • 复常数向量的内积:\(\ip{\b x,\b y}=\b x^\H\b y\)
  • 复函数向量的内积:\(\ip{\b x(t),\b y(t)}=\int_a^b\b x^\H(t)\b y(t)\d t\)
  • 复随机向量的内积:\(\ip{\b x(\xi),\b y(\xi)}=\E[\b x^\t H(\xi)\b y(\xi)]\)

常见的范数:

  • \(\ell_0\),不是范数,只是「准范数」。
  • \(\ell_1\)
  • \(\ell_2\),称作 Euclidean 范数或 Frobenius 范数。
  • \(\ell_\infty\)
  • \(\ell_p\),称作 Hölder 范数,需要 \(p\geq1\)
  • 加权范数/椭圆范数/RKHF 范数 \(\|\b x\|_A=\sqrt{\b x^\H A\b x}\),其中 \(A\) 正定。

相似性度量方法:

  • Euclidean 距离。
  • 夹角余弦值(通过 Cauchy 不等式定义)。
  • (一般仅对非负向量考虑)Tanimoto 测度 \(T(\b x,\b y)=\dfrac{\ip{\b x,\b y}}{\|\b x\|^2_2+\|\b y\|^2_2-\ip{\b x,\b y}}\)。特别地,在 Boolean 向量的场合其变为 Jaccard 相似性 \(J(A,B)=\dfrac{|A\cap B|}{|A\cup B|}\)。对于 \(D(\b x,\b y)=1-T(\b x,\b y)\),其是距离,称作 Tanimoto 距离。

[!TIP]

此处的「测度」与测度论中的测度不同。更好的称呼或许是 Tanimoto 相似性。

可以参考 LLM 获取其在 hash 中的作用。

  • Mahalanobis 距离。对于模式向量 \(\b s_{1\sim n}\),其 Gaussian 回归出均值 \(\b m\) 和协方差 \(\b C\),则定义 \(D(\b x,\b y)=\sqrt{(\b x-\b y)^\top\b C^{-1}(\b x-\b y)}\)。它是对数据做白化变换,把特征值全都设为 \(1\) 后的结果,因而无法区分椭圆的长轴与短轴。另一方面,在 Muon 中使用的 msign 则是把特征值保留符号。

线性相关:线性相关的向量列只保证存在一者可以被他者线性表出,不意味着所有向量都可以。

线性变换:对于两个不同向量空间间的映射,考虑两个空间各自的基变换,可以得到 \(\tilde{\b A}=\b Q^{-1}\b A\b P\) 的关系,于是满足该条件的矩阵 等价。而对于向量空间到自身的映射,对于基变换有 \(\tilde{\b A}=\b S^{-1}\b A\b S\) 的关系,满足该条件的矩阵 相似

[!TIP]

没错,「等价」弱于「相似」:相似矩阵必然等价,反之不亦然。因为不同向量空间之间映射的性质不好,所以等价在此时是一个强概念;而向量空间到自身的映射性质更好,对它的期望更高,此时相似反倒是一个弱概念。

矩阵内积:就是拍扁后向量内积。

[!TIP]

为什么内积无区别?因为内积定义的是空间的结构,只要能定义内积就是合法的 Hilbert 空间。

矩阵范数:除了向量的三条以外,还有第四条:

  • \(\|\b X\b Z\|_\alpha\leq\|\b X\|\|\b Z\|_\beta\)。其中 \(\|\cdot\|_\alpha,\|\cdot\|_\beta\) 分别是某个指定空间下的某种已知范数。这样定义的范数是「与 \(\alpha,\beta\) 相容的范数」。当然,也可以直接定义一族范数,这样的范数是自相容(子乘性)的。

这一条是「矩阵范数」区分于「矩阵上定义的向量范数」的根本:矩阵是一个线性算子,而范数则量化了其拉伸作用。

常见的矩阵范数:

  • 首先是三种 \(p\) 范数。

    • 诱导 \(p\)-范数/从属 \(p\)-范数 \(\|\b A\|_p=\max_{\|\b x\|_p=1}\|\b A\b x\|_p=\max\dfrac{\|\b A\b x\|_p}{\|\b x\|_p}\)
      其例子为:

      • 列和范数 \(\|\b A\|_1=\max_j\sum_i|a_{i,j}|\)
      • 谱范数 \(\|\b A\|_2=\sqrt{\lambda_\max(\b A^\H\b A)}=\sigma_\max(\b A)\)
      • 行和范数 \(\|\b A\|_\infty=\max_i\sum_j|a_{i,j}|\)

      一方面,按照定义它们与向量 \(\ell_p\) 范数相容。另一方面,

      \[\|\b A\b B\b x\|_p\leq\|\b A\|_p\|\b B\b x\|_p\leq\|\b A\|_p\|\b B\|_p\|\b x\|_p \]

      其对于一切 \(\|\b x\|_p=1\) 均成立,于是直接有 \(\|\b A\b B\|_p\leq\|\b A\|_p\|\b B\|_p\),也即有自相容性。

    • 元素 \(p\)-范数 \(\|\b A\|_{m_p}=n^{1-1/p}(\sum|a_{i,j}|^p)^{1/p}\)。一般只考虑方阵场合。
      其例子为:

      • \(\|\b A\|_{m_1}=\sum|a_{i,j}|\)
      • \(\|\b A\|_{m_p}=n\max|a_{i,j}|\)

      前面带上的神秘幂次是不可省的,用以补偿矩阵的求和效应:只有这样才能保证自相容性。因此元素 \(p\)-范数没有诱导 \(p\)-范数紧。

      其与对应的向量 \(\ell_p\) 范数相容,同时自相容。

    • Schatten \(p\)-范数 \(\|\b A\|_{S_p}=(\sum\sigma_i^p)^{1/p}\),其中 \(1\leq p\leq\infty\)
      其例子为:

      • \(p=1\) 时的核范数 \(\|\b A\|_*=\sum\sigma_i\)
      • \(p=2\) 时的 Frobenius 范数 \(\|\b A\|_\t F=\sqrt{\sum|a_{i,j}|^2}=\sqrt{\tr(\b A^\H\b A)}=\sqrt{\sum\sigma_i^2}\)
      • \(p=\infty\) 时就是谱范数。

      不论 \(p\) 为何值,它们统一与向量的 \(\ell_2\) 范数相容;同时它们自相容。
      其优势在于旋转不变性。
      因为 Schatten \(p\)-范数可以被看做对奇异值向量的 \(\ell_p\) 范数,所以其能更好继承向量范数的不等式。例如矩阵 Hölder 不等式:\(|\tr(\b A^\H\b B)|=|\ip{\b A,\b B}_\t F|\leq\|\b A\|_{S_p}\|\b B\|_{S_q}\),其中 \(1/p+1/q\)

    这三种 \(p\) 范数的 notation 有时会被混用,注意区分。

  • 与 Mahalanobis 距离类似的 Mahalanobis 范数 \(\|\b A\|_\Omega=\sqrt{\tr(\b A^\top\Omega\b A)}\),一般与向量的 Mahalanobis 范数 \(\|\b x\|_\Omega=\sqrt{\b x^\top\Omega\b x}\) 配合。但是要满足相容性和自相容性,需要对 \(\Omega\) 的谱加以限制,具体地要求 \(\lambda_\min(\Omega)\geq1\)

行列式。

  • 分块矩阵行列式:\(\det\bmat{\b A&\b B\\\b C&\b D}=\det\b A\det(\b D-\b C\b A^{-1}\b B)\),需求 \(\b A\) 可逆。
  • Hadamard 不等式:对于正定或半正定的 \(\b A\),有 \(\det(\b A)\leq\prod a_{i,i}\)

迹。

  • 相似不变性。
  • 对角线元素之和,同时也是特征值之和。

II.

四种特殊矩阵:形状特殊;结构特殊;性质特殊;功能特殊。

  • 形状特殊:

    • 对角矩阵/反对角矩阵。
    • 上三角/下三角。对角元素为 \(1\) 时称作单位上/下三角矩阵。
    • 带状矩阵:只在 \(|i-j|\leq k\) 的区域有值。
    • Hessenberg 矩阵:比上三角/下三角多一条对角线。
    • 基本矩阵:\(\b E_{i,j}^{(m\times n)}\) 为只有 \((i,j)\)\(1\) 其它都为 \(0\) 的矩阵。有分解 \(\b A=\sum\sum a_{i,j}\b E_{i,j}^{(m\times n)}\)
  • 性质特殊:

    • 正交矩阵 \(\b Q\b Q^\top=\b Q^\top\b Q=\b I\)
    • 半正交矩阵(适用于非方阵)。
    • 酉矩阵 \(\b U\b U^\H=\b U^\H\b U=\b I\)
    • 仿酉矩阵(非方阵)
    • 正规阵 \(\b A^\H\b A=\b A\b A^\H\)。必须是方阵。
    • Hadamard 矩阵:所有元素取 \(\pm1\),满足 \(\b H_n\b H_n^\top=\b H_n^\top\b H_n=n\b I_n\)。可以用 \(-1\) 乘以某一行或某一列保证 Hadamard 性,于是可以造出第一行第一列全为 \(1\) 的标准 Hadamard 性。可以把 \(4\) 个小 Hadamard 阵拼成一个边长翻倍的 Hadamard 阵,因此 Hadamard 阵只对 \(2\) 幂次边长有效。

正交矩阵信息熵密度高,对信息丢失很敏感。

  • 功能特殊。

    • 初等矩阵。

    • 置换矩阵。

    • 交换矩阵。

    • 互换矩阵:就是反对角单位阵。

    • 移位矩阵:描述 \(i\to i+1\) 的 shift。

    • 广义置换矩阵:每行每列仅有一个非零元素的方阵。当且仅当其能被分解为置换阵和对角阵之积。

    • 选择矩阵:描述选取某几行/某几列的矩阵。

    • Fourier 矩阵即单位根的 Vandermonde 矩阵。有 \(\b F^\H\b F=n\b I\),因此对于 DFT \(\hat{\b x}=\b F\b x\),其逆为 \(\b x=\dfrac1n\b F^\H\hat{\b x}\)

    • 这样的变换不对称,所以也可以用改造的 Fourier 矩阵 \(\hat{\b F}=\dfrac1{\sqrt n}\b F\)

    • 对称:\(\b A=\b A^\top\)

    • 反对称:\(\b A=-\b A^\top\)

    • 斜对称:关于副对角线对称。

    • 中心对称。

    • 复共轭对称(Hermitian)矩阵:\(\b A=\b A^\H\)

    • 反 Hermitian:\(\b A=-\b A^\H\)

    • Vandermonde:\([x_i^j]\)\([x_j^i]\)

    • Toeplitz 矩阵:沿每一条对角线均相同的矩阵。描述了一个 stationary kernel。

    • 对称 Toeplitz 矩阵。可以只由第一行描述,因此可记作 \(\b A=\t{Toep}[a_1,\dots,a_n]\)

    • 实 Toeplitz 矩阵引导的线性方程组有高效算法可以 \(O(n^2)\) 求解。

    • 循环 Toeplitz 矩阵可以被 DFT 矩阵对角化;但因其不完全循环,DCT 矩阵则可将其转成一个高度对角化(但不完全对角)的矩阵,便于压缩或滤波。JPEG 就使用了相似的逻辑。

    • Hankel 矩阵:沿反对角线相同矩阵。无穷阶的 Hankel 矩阵有有限秩 \(r\),当且仅当其反对角线元素 \(s_0,s_1,\dots\) 满足常系数齐次线性递推关系 \(s_i=\sum_{j=1}^r\alpha_js_{i-j}\)。令 \(Q(x)=1-\alpha_1x-\dots-\alpha_rx^r\),则 \(S(x)Q(x)=P(x)\),其中 \(P\) 是度数小于 \(r\) 的多项式。故,以下三条件等价:

      • 矩阵 \(\b S\) 有有限秩 \(r\)
      • 生成数列满足 \(r\) 阶常系数齐次线性递推关系。
      • 生成函数是 \(r\) 阶有理函数。
    • 离散 LTI 的冲激响应序列为 \(h\)、激励为自 \(0\) 时刻通入的 \(e\) 时,零状态响应 \(r\) 由卷积

      \[r[n]=\sum_{k=0}^\infty e[k]h[n-k] \]

      描述。写成矩阵形式就是

      \[\bmat{r[0]\\r[1]\\r[2]\\\vdots}=\bmat{h[0]&h[-1]&h[-2]&\dots\\h[1]&h[0]&h[-1]&\dots\\h[2]&h[1]&h[0]&\dots\\\vdots&\vdots&\vdots&\ddots}\bmat{e[0]\\e[1]\\e[2]\\\vdots} \]

      得到了一个 Toeplitz 矩阵。

      另一方面,考虑零输入响应,即所有 \(n\geq0\)\(e[n]=0\) 的场景,此时历史的 \(e\) 为系统提供了记忆,则有

      \[\bmat{r[0]\\r[1]\\r[2]\\\vdots}=\bmat{h[1]&h[2]&h[3]&\dots\\h[2]&h[3]&h[4]&\dots\\h[3]&h[4]&h[5]&\dots\\\vdots&\vdots&\vdots&\ddots}\bmat{e[-1]\\e[-2]\\e[-3]\\\vdots} \]

      得到了一个 Hankel 矩阵。

    • 循环矩阵。

III.

矩阵变换。

  • 列向量化 \(\t{vec}\):按列拉直为列向量。

  • 行向量化 \(\t{rvec}\):按行拉直为行向量。

  • 矩阵化 \(\t{unvec}\):把向量一列列拼成矩阵(逆列向量化)。

  • (右)Kronecker 积:

    \[\b A\otimes\b B=[a_{i,j}\b B]=\bmat{a_{1,1}\b B&\dots&a_{1,m}\b B\\\vdots&\ddots&\vdots\\a_{n,1}\b B&\dots&a_{n,m}\b B}_{np\times mq} \]

  • 左 Kronecker 积:\([\b A\otimes\b B]_\t{left}=[\b Ab_{i,j}]\)

  • Kronecker 积满足:非交换性;\((\b A\b B)\otimes(\b C\b D)=(\b A\otimes\b C)(\b B\otimes\b D)\);关于加减的分配律;\((\b A\otimes\b B)^\dagger=\b A^\dagger\otimes\b B^\dagger\) 其中 \(\dagger\) 是伪逆。\(\tr(\b A\otimes\b B)=\tr(\b A)\tr(\b B),\rank(\b A\otimes\b B)=\rank(\b A)\rank(\b B)\)

    定理:\(\t{vec}(\b{ABC})=(\b C^\top\otimes\b A)\t{vec}(\b B)\)。对形如 \(\b A\b X\b B=\b D\)\(\b A\b X+\b X\b B=\b C\) 的方程求解格外有用。

  • 广义 Kronecker 积:对于多个形状相同的矩阵组 \(\cur{\b A_i}\),和行数与矩阵组长度相同的矩阵 \(\b B\) 的广义 Kronecker 积是

    \[\cur{\b A}_n\otimes\b B=\bmat{\b A_1\otimes\b b_1\\\vdots\\\b A_n\otimes\b b_n} \]

    其中 \(\b b_i\) 是第 \(i\) 个行向量。

  • Khatri-Rao 积:对于 \(m\times n\)\(\b A\)\(p\times n\)\(\b B\),有

    \[\b A*\b B=\bmat{\b a_1\otimes\b b_1&\dots&\b a_n\otimes\b b_n}_{mp\times n} \]

    其中 \(\b a_i,\b b_i\) 是第 \(i\) 列。

  • Hadamard 积,也称 Schur 积。

  • 直和:\(\b A\oplus\b B=\bmat{\b A&\b O\\\b O&\b B}\)

矩阵分解。

  • LU 分解 \(\b A=\b L\b U\),其中 \(\b A\) 是方阵、\(\b L\) 是下三角、\(\b U\) 是上三角。其不唯一,因此需要人为添加条件,即规定对角线元素值。
    • Doolittle 分解:让 \(\b L\) 的主对角线为 \(1\),就是裸的 Gauss 消元的结果。
    • Crout 分解:让 \(\b U\) 的主对角线为 \(1\)
    • LDR 分解:把主对角线单独抽离,有 \(\b A=\b{LDU}\),其中 \(\b L,\b D\) 的主对角线都为 \(1\)
    • 如果前 \(n-1\) 阶主子式 \(\Delta_k\neq0\),则三种分解都有唯一性,且 \(d_k=\Delta_k/\Delta_{k-1}\),其中 \(d_k\)\(\b U/\b L/\b D\) 主对角线元素。

Givens 变换:对于标准正交基 \(\b e_1,\dots,\b e_n\),沿 \([\b e_i,\b e_j]\) 平面的顺时针旋转变换,对应的矩阵是 Givens 矩阵

\[\b G_{i,j}(\theta)=\bmat{1\\&\ddots\\&&\cos\theta&&\sin\theta\\&&&\ddots\\&&-\sin\theta&&\cos\theta\\&&&&&\ddots\\&&&&&&1} \]

Givens 矩阵可以选取适当的 \(\theta\)\(i,j\) 两维的能量 \(x_i,x_j\) 集中到某一维上,变成 \(\sqrt{x_i^2+x_j^2},0\)。因此存在有限个 Givens 矩阵的乘积 \(\b G\),对非零的 \(\b x\)

\[\b G\b x=\|\b x\|_2\b e_1 \]

进一步,\(\b e_1\) 可以换成任何单位向量。

Householder 矩阵:\(\b H=\b I-2\b u\b u^\top\),其中 \(\b u\) 是单位向量,对应的线性变换是 Householder 变换,即 \(\b H\b x=\b x-2\b u(\b u^\top\b x)\)。可以发现,它是关于 \(\b u\) 的反射变换。

则对于任何单位向量 \(\b z\),都存在 Householder 矩阵使得 \(\b H\b x=\|\b x\|_2\b z\),同时 Givens 矩阵总是可以表示为两个 Householder 矩阵的乘积。

Cholesky 分解:任何实对称正定矩阵都存在下三角矩阵 \(\b L\) 使得 \(\b A=\b L\b L^\top\),且若限定对角元素为正则分解唯一。

Schur 分解:任何复方阵 \(\b A\) 都存在酉矩阵 \(\b P\) 使得 \(\b P^{-1}\b A\b P=\b P^\H\b A\b P=\b R\),其中 \(\b R\) 是对角线元素为全体特征值的上三角阵。于是 \(\b A=\b P\b R\b P^\H\)

QR 分解:若 \(\b A_{m\times n}\) 矩阵满足 \(n\leq m\) 且满列秩,则存在仿酉的 \(\b Q_{m\times n}\) 和上三角的 \(\b R_{n\times n}\) 使得 \(\b A=\b Q\b R\),且除了一个对角线元素的模长均为 \(1\) 的对角矩阵因子外分解唯一。

  • Householder 法:用 Householder 矩阵可以依次把主对角线下方元素全部消成零,且如果从左往右消的话,新矩阵不会破坏已消掉的部分(因为第 \(i\) 次选取的 \(\b u\)\(\b e_1,\dots,\b e_{i-1}\) 全部正交)。
  • Givens 法:一次只动一个元素,对稀疏矩阵和 Hessenberg 矩阵友好。

满秩分解:\(\b A_{m\times n}=\b F_{m\times r}\b G_{r\times n}\)

特征值分解。奇异值分解。

总结:

  • 相抵变换(等价关系):\(\b B=\b P\b A\b Q\),其中 \(\b P,\b Q\) 均可逆。相抵变换不改变秩;任意矩阵都可以被相抵变换为左上角为 \(\b I_r\)、此外全零的矩阵。
  • 相似变换:\(\b B=\b P^{-1}\b A\b P\)。相似变换不改变谱;可对角化时可以被相似变换为对角阵,否则变换为 Jordan 标准型。
  • 合同变换:\(\b B=\b P^\H\b A\b P\),主要用于研究二次型(Hermitian 阵)。不改变对称性和惯性(Sylvester 惯性定律)。标准型是 msign。
  • 正交相似变换/酉变换:\(\b B=\b Q^\top\b A\b Q\)\(\b Q\) 正交)或 \(\b B=\b U^\H\b A\b U\)\(\b U\) 酉)。标准型是谱分解或 Schur 分解。

IV.

矩阵求逆。有很多神奇的求逆公式。

  • Sherman-Morrison 处理低秩修正:\(\b A+\b x\b y^\t H\)
  • Woodbury 进一步扩展:\(\b A+\b U\b B\b V\)
  • Duncan-Guttman:\(\b A-\b U\b D^{-1}\b V\)
  • 分块矩阵 \(\bmat{\b A&\b U\\\b V&\b D}\):在 \(\b A\) 可逆、\(\b A,\b D\) 均可逆时,各自有公式。
  • Hermitian 矩阵 \(\b R_{m+1}=\bmat{\b R_m&\b r_m\\\b r_m^\H&\rho_m}\),则它们的逆存在递推公式。

非方阵的场合,可以对 \(m\times n\) 矩阵 \(\b A\) 与另一个 \(n\times m\) 矩阵 \(\b G\) 提出以下性质:

  • \(\b{AGA}=\b A\)
  • \(\b{GAG}=\b G\)
  • \(\b{AG}^\H=\b{AG}\),即 \(\b{AG}\) 是 Hermite 矩阵。
  • \(\b{GA}^\H=\b{GA}\),同上。

满足以上性质的称作 Moore-Penrose 广义逆,可以证明其存在且唯一,记作 \(\b A^\dagger\)。特别地,只满足某几条的矩阵可以使用编号来命名,例如 \(\b A^{(1,2,4)}\),某些特殊的方案也有专有名称:

  • (1) 称作 基本广义逆,记作 \(\b A^-\)。它的意义在于对线性方程 \(\b{Ax}=\b b\) 求解:当 \(\b b\neq\b0\),且方程一致(存在解)时,解 \(\b x_0\) 和广义逆乘积 \(\b{Gb}\) 存在一一对应关系。
  • (1,2) 称作 自反广义逆 (reflextive generalized inverse)。
  • (1,2,3) 称作 正规广义逆 (normalized generalized inverse)。
  • (1,2,4) 称作 弱广义逆 (weak generalized inverse)。

满足 \(\b{LA}=\b I\) 的矩阵 \(\b L\) 被称作 左逆矩阵。左乘不改变行秩,因此只有行数 \(m\) 大于等于列数 \(n\) 时,得到的 \(n\times n\) 矩阵才可能为单位阵,左逆才能存在。进一步,左逆存在当且仅当满列秩,但在 \(m>n\) 时其不唯一。

同理,满足 \(\b{AR}=\b I\) 即是 右逆矩阵。右乘不变列秩,因此只有 \(m\leq n\) 时右逆可能存在。同理,右逆存在当且仅当满行秩

容易验证,左逆和右逆都是基本广义逆;另一方面,满列秩时基本广义逆都是左逆,满行秩时都是右逆:因为 \(\rank(\b A^-\b A)=\rank(\b A\b A^-)=\rank(\b A)\)

虽然左/右逆不唯一,但是 \(\b L=(\b A^\H\b A)^{-1}\b A^\H\) 可以显式确定一个特定的左逆阵,称作 左伪逆矩阵。同理,\(\b R=\b A^\H(\b A^\H\b A)^{-1}\) 是对应的 右伪逆矩阵。这两个东西在 最小二乘法 中见过类似的结构:事实上,\(\b L\b b\) 给出了超定方程组 \(\b A\b x=\b b\) 的最小误差近似。

普通逆的若干性质对广义逆并不成立。具体地:

基本广义逆满足:

  • \((\b A^-)^\H=(\b A^\H)^-\)
  • \((\lambda\b A)^-=\lambda^\dagger\b A^-\),其中 \(\lambda^\dagger\)\(\lambda\neq0\) 时为 \(\lambda^{-1}\),否则为 \(0\)
  • \(\rank(\b A^-)\geq\rank(\b A)\)。【与普通逆不同!】
  • \((\b A\b B)^-\)\(\b A^-,\b B^-\) 没有明确关系;\((\b A^-)^-\)\(\b A\) 也没有明确关系。

Moore-Penrose 逆满足:

  • 矩阵可逆时,\(\b A^{-1}=\b A^\dagger\)
  • 满列秩/行秩时,左/右伪逆就是 M-P 逆。
  • 左逆是 (1,2,4) 逆,右逆是 (1,2,3) 逆。
  • 一般地,\((\b{AB})^\dagger\neq\b A^\dagger\b B^\dagger\);但是,如果 \(\rank(\b A\b B)=\rank(\b A)=\rank(\b B)\),换言之 \(\b A,\b B\)\(\b A\b B\) 的满秩分解,则此时成立。
  • \(\b A^\dagger=\b A^{(1,4)}\b A\b A^{(1,3)}\)
  • \(\b A^\dagger=(\b A^\H\b A)^\dagger\b A^\H=\b A^\H(\b A\b A^\H)^\dagger\)
  • \((\b A^\dagger)^\dagger=\b A\)
  • 对角阵的 M-P 逆是把全体非零元求逆、零元保持。
  • \(\rank(\b A^\dagger)=\rank(\b A)\)

在线性映射 \(\b x\mapsto\b A\b x\) 的角度审视 M-P 四条件。

  • \(\b{AGA}=\b A\)。这是一切的基础,即基本广义逆;常用的逆的定义都保证这一点。它要求,「至少在 \(\b A\) 的列空间中,\(\b G\) 像是一个逆,把 \(\b A\b x=\b b\) 中的 \(\b b\) 通过 \(\b x=\b G\b b\) 拉回到 \(\b x\) 上」。
  • \(\b{GAG}=\b G\)。与第一条结合,保证了 \(\rank(\b A)=\rank(\b B)\)
  • \(\b{AG}^\H=\b{AG}\)。(1,2,3) 是左伪逆,因此保证超定方程组的误差 \(\|\b A\b x-\b b\|_2\) 最小。
  • \(\b{GA}^\H=\b{GA}\)。用来保证本身范数 \(\|\b x\|_2\) 最小。

假设在 SVD 视角下是 \(\b A=\b{U\Sigma\b V}^\H\),其中 \(\b\Sigma=\bmat{\b\Sigma_r&\b0\\\b0&\b0}\)。则全体广义逆都可以写成

\[\b G=\b V\bmat{\b X_{1,1}&\b X_{1,2}\\\b X_{2,1}&\b X_{2,2}}\b U^\H \]

则四个条件分别对应着:

  • \(\b{AGA}=\b A\iff\b X_{1,1}=\b\Sigma_r^{-1}\),对另外三个矩阵没有限制。
  • \(\b{GAG}=\b A\iff\b X_{2,2}=\b X_{2,1}\b\Sigma_r\b X_{1,2}\)
  • \(\b{AG}^\H=\b{AG}\iff\b X_{1,2}=\b0\)
  • \(\b{GA}^\H=\b{GA}\iff\b X_{2,1}=\b0\)

如何算 M-P 逆?

  • 直接嗯解方程。具体地,从 \(\b A\b A^\H\b X^\H=\b A\) 解出 \(\b X\),从 \(\b A^\H\b A\b Y=\b A^\H\) 解出 \(\b Y\),然后有 \(\b A^\dagger=\b X\b A\b Y\)
  • 递推算。
  • 迹方法。
  • SVD。
  • 满秩分解。

V.

定理:矩阵方程组 \(\b{AXB}=\b D\) 相容(有解)的充要条件是 \(\b A\b A^{(1)}\b D\b B^{(1)}\b B=\b D\),通解为 \(\b X=\b A^{(1)}\b D\b B^{(1)}+\b Y-\b A^{(1)}\b A\b Y\b B\b B^{(1)}\),其中 \(\b Y\) 任意。

推论:线性方程组 \(\b{Ax}=\b b\) 相容的充要条件是 \(\b A\b A^{(1)}\b b=\b b\),通解为 \(\b x=\b A^{(1)}\b b+(\b I-\b A^{(1)}\b A)\b z\)

另一方面,基本广义逆集合 \(\b A\cur{1}\) 与特解 \(\b A^{(1)}\) 的关系是 \(\b A\cur{1}=\cur{\b A^{(1)}+\b Z-\b A^{(1)}\b A\b Z\b A\b A^{(1)}\mid\b Z\in\C^{n\times m}}\)

定理:线性方程组 \(\b{Ax}=\b b\) 的极小 \(2\)-范数解唯一,它位于 \(\b A^\H\) 的列空间中。

定理:\(\b A\cur{1,4}\) 由方程 \(\b X\b A=\b A^{(1,4)}\b A\) 的所有解 \(\b X\) 组成,其中 \(\b A^{(1,4)}\) 是特解。于是 \(\b A\cur{1,4}=\cur{\b A^{(1,4)}+\b Z-\b Z\b A\b A^{(1,4)}\mid\b Z\in\C^{n\times m}}\)。则极小范数解可以且仅可以写成 \(\b x=\b A^{(1,4)}\b b\) 的形式。

同理,\(\b A\cur{1,3}\)\(\b A\b X=\b A\b A^{(1,3)}\) 的解,\(\b A\cur{1,4}=\cur{\b A^{(1,4)}+\b Z-\b A^{(1,3)}\b A\b Z\mid\b Z\in\C^{n\times m}}\),对应最小二乘解。

最新版的 JPEG 压缩流程是:先小波变换 \(\b x=\b\Psi^\top\b s\),然后扔掉 \(\b 0\) 得到 \(M\ll N\)\(\hat{\b x}\),传输,然后补零并重建 \(\hat{\b s}=\b\Psi\hat{\b x}\)

这个流程涉及到弃零-补零的流程。

已知小波变换后的 \(\b x\) 是稀疏的,换言之 \(\|\b x\|_0\ll N\)。现在用一个 \(M\times N\) 的压缩阵 \(\b\Phi\) 压缩 \(\b s\) 得到 \(\b y\),则有

\[\b\Phi\b s=\b y\implies\b\Phi\b\Psi\b x=\b y\implies\hat{\b x}=\arg\min_{\b\Phi\b\Psi\b x=\b y}\|\b x\|_0 \]

压缩感知表明,在 \(\b\Phi\) 是 RIP 阵时,最小化 \(\ell_0\) 范数等效于最小化 \(\ell_1\) 范数,于是求 \(\b{\Phi\b\Psi\b x}=\b y\) 的最小范数解,此时的矩阵 \(\b\Phi\b\Psi\)\(M\times N\) 的扁矩阵。

VI.

参数是实数、值是实矩阵 \(\b A(t)\) 的导数就是每一项分别求导。

参数是实矩阵、值是实 \(f(\b X)\) 的导数是 \(\left(\dfrac{\p f}{\p x_{i,j}}\right)_{m\times n}\) 的梯度矩阵;如果矩阵是行/列向量,则就是梯度/梯度转置。

参数和值都是实矩阵时,\(\b F(\b X)\) 的导数有类似 Kronecker 积的形式 \(\left(\dfrac{\p\b F(\b X)}{\p x_{i,j}}\right)_{m\times n}\)

定义:

  • \(f(\b x)\) 的梯度 \(\nabla_\b x f(\b x)\)\(\b x\) 同形状,而协梯度 \(\D_\b xf(\b x)\) 是梯度的转置。
  • \(f(\b X)\) 的梯度 \(\nabla_\b Xf(\b X)\)\(\b X\) 同形状,协梯度 \(\D_\b Xf(\b X)\) 是其转置,可以向量化展平为 \(\t{vec}(\nabla_\b Xf(\b X))\)
  • \(\b f(\b x)\) 的 Jacobian 就是协梯度矩阵 \(\D_\b x\b f(\b x)\):若 \(\b f\)\(p\) 维、\(\b x\)\(n\) 维,其形状为 \(p\times n\)
  • \(\b F(\b X)\) 的行向量偏导 \(\D_{\t{vec}(\b X)}\b F(\b X)=\dfrac{\d\t{vec}{\b F(\b X)}}{\d\t{vec}^\top(\b X)}\)
  • Hessian \(\dfrac{\d^2f(\b x)}{\d\b x\d\b x^\top}\)\(\nabla^2_\b xf(\b x)=\D_\b x(\nabla_\b xf(\b x))=\nabla_{\b x^\top}(\nabla_\b xf(\b x))\)\(\nabla^2_\b Xf(\b X)=\D_\b X(\nabla_\b Xf(\b X))\)

全微分

\[\d f(\b x)=\dfrac{\p f(\b x)}{\p\b x^\top}\d\b x \\\d f(\b X)=\t{rvec}(\D_\b Xf(\b X))\t{vec}(\d\b X) \\=\tr((\D_\b Xf(\b X))\d\b X) \]

(为什么要把它向量化?因为本质上是张量积,只有向量化后才能定义合适的向量积)

因此,实值标量函数可微分,则其对应的梯度 \(\nabla_\b Xf(\b X)\) 有定义,即为协梯度转置。形式化地,

\[\d f(\b X)=\tr(\b A\d\b X)\iff\nabla_\b Xf(\b X)=\b A^\top \]


复矩阵的微分更倾向于使用形式导数或称 Wirtinger 导数 的方式描述。具体地,复变量 \(z=x+\j y\) 的实部和虚部彼此独立

\[\dfrac{\p x}{\p y}=\dfrac{\p y}{\p x}=0 \]

于是

\[\dfrac{\p z}{\p z^*}=\dfrac{\p z^*}{\p z}=0 \\\dfrac{\p}{\p z}=\dfrac12(\dfrac{\p}{\p x}-\j\dfrac{\p}{\p y}) \\\dfrac{\p}{\p z^*}=\dfrac12(\dfrac{\p}{\p x}+\j\dfrac{\p}{\p y}) \]

而在向量的场合,可以定义梯度算子和共轭梯度算子

\[\nabla_\b z=\dfrac12(\dfrac{\p}{\p\b x}-\j\dfrac{\p}{\p\b y}) \\\nabla_{\b z^*}=\dfrac12(\dfrac{\p}{\p\b x}+\j\dfrac{\p}{\p\b y}) \]

以及协梯度算子、共轭协梯度算子

\[\D_\b z=\dfrac12(\dfrac{\p}{\p\b x^\top}-\j\dfrac{\p}{\p\b y^\top}) \\\D_{\b z^*}=\dfrac12(\dfrac{\p}{\p\b x^\top}+\j\dfrac{\p}{\p\b y^\top}) \]

(区分 \(\b z^*\)\(\b z^\top\)\(\b z^\H\)

复向量函数微分:

\[\d f(\b z,\b z^*)=\dfrac{\p f}{\p\b z^\top}\d\b z+\dfrac{\p f}{\p\b z^\H}\d\b z^* \\=\D_\b zf\d\b z+\D_{\b z^*}f\d\b z^* \]

复矩阵函数微分:

\[\d f(\b Z,\b Z^*)=\tr(\b A\d\b Z+\b B\d\b Z^*) \\\iff \\\nabla_\b Zf(\b Z,\b Z^*)=\b A^\top\land\nabla_{\b Z^*}f(\b Z,\b Z^*)=\b B^\top \]

复 Hessian:

\[\d^2 f=\bmat{\d\b z^\H&\d\b z^\top}\bmat{\b H_{\b z^*,\b z}&\b H_{\b z^*,\b z^*}\\\b H_{\b z,\b z}&\b H_{\b z,\b z^*}}\bmat{\d\b z\\\d\b z^*} \\=\tilde{\b z}^\H\b H\tilde{\b z} \]

这个 \(\b H\) 是 Hermitian 的:有 \(\b H=\b H^\H\),被称作全 Hessian 矩阵。

VII.

考虑等式约束的优化问题

\[\min_{\b A\b x=\b b}f(\b x) \]

其中 \(\b A\in\R^{m\times n}(m\leq n)\),即约束是欠定方程。

  • 可以直接使用 Lagrange 乘子法。
  • \(\b A\) 满行秩时,可以对 \(\b A\) 消元变成无约束优化问题。

梯度下降

\[\b w(n)=\b w(n-1)-\mu(n)\nabla_{\b w^*}J(\b w(n-1)) \]

Newton 迭代

\[\b w(n)=\b w(n-1)-\mu(n)[\nabla^2\b J(\b w(n-1))]^{-1}\nabla_{\b w^*}J(\b w(n-1)) \]

  • 缺点:需要对 Hessian 求逆(而它一般不可逆)。

Levenberg-Marquardt 法

\[\b w(n)=\b w(n-1)-\mu(n)[\nabla^2\b J(\b w(n-1))+\delta\b I]^{-1}\nabla_{\b w^*}J(\b w(n-1)) \]

加上 \(\delta\b I\) 把 Hessian 强制改造为正定进而可逆。

共轭梯度法:一种用于求解线性方程组 \(\b A\b x=\b b\) 的方法。

引理:对于 Hermitian 正定矩阵 \(\b B\),称非零向量组 \(\cur{\b p}\) 关于 \(\b B\) 相互共轭,若对于 \(i\neq j\)\(\b p_i^\H\b B\b p_j=0\)。因为 \(\b B\) 是 Hermitian 正定的,易推知 \(\cur{\b p}\) 是在原始空间下也是正交的。

现在考虑把 \(\b A\b x=\b b\) 的解 \(\b x\) 在相互共轭基上分解。

  • 如果 \(\b A\) 本身就是 Hermitian 正定矩阵,那么没有问题。
  • 否则,只要 \(\b A\) 满行秩,方程 \(\b A^\H\b A\b x=\b A^\H\b b\) 就与原方程同解,因此可以转而对 \(\b A^\H\b A\) 考虑。因此,一般地,我们认为 \(\b A\) 是正定的。

假设已经有相互共轭基,则可以直接通过

\[\b x=\sum\alpha_i\b p_i \\\b p_j^\H\b A\b x=\b p_j^\H\b A\sum\alpha_i\b p_i=\alpha_j\b p_j^\H\b A\b p_j \\\alpha_i=\dfrac{\b p_i^\H\b A\b x}{\b p_i^\H\b A\b p_i}=\dfrac{\b p_i^\H\b b}{\b p_i^\H\b A\b p_i} \]

求出系数 \(\cur{\alpha}\) 进而还原出 \(\b x\)。问题是这个相互共轭基怎么造?

一个朴素的想法类似 Gram-Schmidt 正交化。具体地,令当前迭代解是 \(\b x_k\)\(\b g_k=\b A\b x_k-\b b\) 是残差,我们希望从中剔除所有与历史 \(\b p_i\) 正交的部分得到当前的 \(\b p_k\)。具体地,有

\[\b p_i^\H\b A\b g_k=\b p_i^\H\beta_i\b A\b p_i \\\beta_i=\dfrac{\b p_i^\H\b A\b g_k}{\b p_i^\H\b A\b p_i} \]

理论上,只要取 \(\b p_k=\sum\beta_i\b p_i-\b g_k\) 就能得到下一个相互共轭向量。但是,由正交性可以发现对所有 \(i<k-1\) 系数 \(\beta_i=0\)。于是算法可以直接表述为:

  • 计算残差 \(\b g_k=\b A\b x_k-\b b\)。特别地,令二次泛函 \(J(\b x)=\dfrac12\b x^\H\b A\b x-\b b^\H\b x\),则残差就是共轭梯度 \(\nabla_{\b x^*}J(\b x)\),因此这个算法也得名为共轭梯度法。
  • 计算基向量 \(\b p_k=-\b g_k+\beta_{k-1}\b p_{k-1}\),其中 \(\beta_{k-1}=\dfrac{\b p_{k-1}^\H\b A\b g_k}{\b p_{k-1}^\H\b A\b p_{k-1}}\)。可以发现,这样做只用存储前一个基向量 \(\b p_{k-1}\),而不用存储所有历史基向量。
  • 修正 \(\b x_{k+1}=\b x_k+\alpha_k\b p_k\),其中 \(\alpha_k=\dfrac{\b p_k^\H\b b}{\b p_k^\H\b A\b p_k}=-\dfrac{\b p_k^\H\b g_k}{\b p_k^\H\b A\b p_k}\)

其性质概括如下:

  • 相互共轭性:\(\b p_i^\H\b A\b p_k=0\)
  • 正交性:\(\b g_k^\H\b g_i=0\)
  • 下降性:\(\b p_k^\H\b g_k\leq0\)

VIII.

\(\b A\b u=\lambda\b u\),则 \(\lambda\) 是特征值、\(\b u\) 是特征向量、\((\lambda,\b u)\) 是特征对。

  • 特征的代数重数是 \(\det(\b A-\lambda\b I)\) 的重根次数。
  • 而几何重数是能找到的线性无关特征向量数目。
  • 简单特征值 (simple eigenvalue) 是有 \(1\) 的代数重数的特征值。非简单特征值即为多重特征值。半单特征值 (semi-simple) 是代数重数等于几何重数的特征值,否则即为亏损特征值 (defective eigenvalue)。

性质报菜名:

  • \(\lambda\)\(\b A\) 特征值,则:
    • \(\lambda\)\(\b A^\top\) 特征值。
    • \(\lambda^*\)\(\b A^\H\) 特征值。
    • \(\lambda+\sigma^2\)\(\b A+\sigma^2\b I\) 特征值。
    • 可逆时,\(1/\lambda\)\(\b A^{-1}\) 特征值。
    • \(\lambda^k\)\(\b A^k\) 特征值。
  • 幂等矩阵 \(\b A^2=\b A\) 的特征值为 \(0\)\(1\)
  • 特征值的积是行列式,和是迹;相似矩阵保特征值。
  • \((\lambda,\b u)\)\(\b A\) 的特征对,则对于多项式 \(f(\cdot)\)\((f(\lambda),\b u)\)\(f(\b A)\) 的特征对;\((e^\lambda,\b u)\)\(e^\b A\) 的特征对。
  • \((\lambda_A\lambda_B,\b u_A\otimes\b u_B)\) 是 Kronecker 积 \(\b A\otimes\b B\) 的特征对。
  • \((\lambda_A,\b u_A\oplus\b 0),(\lambda_B,\b0\oplus\b u_B)\) 是直和 \(\b A\oplus\b B\) 的特征对。
  • \(\b{AB}\)\(\b{BA}\) 特征值相同。

可对角化当且仅当存在 \(n\) 个线性无关特征向量,当且仅当所有特征值都半单。若存在 \(n\) 个不同特征值则必然可对角化。


好玩的小定理之 Wilkinson 交织定理,描述了低秩修改矩阵的谱变化量。具体地,令 \(\cur\lambda\) 是对称矩阵 \(\b A\) 的降序排列特征值,\(\b z\) 是单位向量,\(\cur\xi\)\(\b A+a\b z\b z^\top\) 的降序排列特征值,则:

  • \(a>0\) 时,有 \(\xi_1\geq\lambda_1\geq\dots\geq\xi_n\geq\lambda_n\)
  • \(a<0\) 时,有 \(\lambda_1\geq\xi_1\geq\dots\geq\lambda_n\geq\xi_n\)

同时总是有 \(\sum\xi_i-\lambda_i=a\)


考虑一个具体的问题:矩阵 \(\b A\) 在扰动 \(\b A+\eps\b E\) 下,特征对 \((\lambda,\b u)\) 的变动是多少?

假设有一阶近似 \(\lambda(\eps)=\lambda+\eps\dot\lambda+O(\eps^2),\b u(\eps)=\b u+\eps\dot{\b u}+O(\eps^2)\),则有

\[(\b A+\eps\b E)\b u(\eps)=\lambda(\eps)\b u(\eps) \\\b A\b u+\eps(\b E\b u+\b A\b u)\approx\lambda\b u+\eps(\dot\lambda\b u+\lambda\dot{\b u}) \\\b E\b u+\b A\b u\approx\dot\lambda\b u+\lambda\dot{\b u} \]

考虑 \(\lambda\) 的任一左特征向量 \(\b v\),左乘得到

\[\b v^\H\b E\b u+\b v^\H\b A\b u\approx\dot\lambda\b v^\H\b u+\lambda\b v^\H\dot{\b u} \\\b v^\H\b E\b u\approx\dot\lambda\b v^\H\b u \\\dot\lambda\approx\dfrac{\b v^\H\b E\b u}{\b v^\H\b u} \]

于是我们发现,特征值变化率与左右特征向量夹角 \(\theta(\b u,\b v)\) 相关:夹角如果很小的话,在特定的扰动 \(\b E\) 下就会有很大的变动。所以定义 条件数 \(\t{cond}(\lambda)=\max1/\cos\theta(\b u,\b v)\)(在重数为 \(1\) 时,不需要取 \(\max\);在重数非 \(1\) 时,我们在意最劣情况),则它衡量了该特征值的稳定性。


定义:所有特征值合称谱,记作 \(\lambda(\b A)\)。特征值的最大模长称为谱半径,记作 \(\lambda(\b A)\)

定义:实对称矩阵的惯性为三元组 \(\t{In}(\b A)=(i_+(\b A),i_-(\b A),i_0(\b A))\),即正、负零特征值个数(计算重数)。\(i_+(\b A)-i_-(\b A)\) 称作矩阵的符号差。Sylvester 惯性定理 指出,对于实对称的 \(\b A\) 和任意可逆的 \(\b C\),都有 \(\t{In}(\b A)=\t{In}(\b C^\top\b A\b C)\)

谱分解:考虑 \(\b A\) 的特征对 \((\lambda_i,\b p_i)\)\(\b A^\H\) 的特征对 \((\lambda_j^*,\b q_j)\)

  • 因为 \(\b q_i^\H\b A\b p_j=\lambda_i\b q_i^\H\b p_j=\lambda_j\b q_i^\H\b p_j\),所以若 \(\lambda_i\neq\lambda _j\) 则必有 \(\b q_i^\H\b p_j=0\)
  • 反之,若 \(\lambda_i=\lambda_j\),则若 \(\b p_i\) 确定,则可以唯一推出相应的 \(\b q_j\) 使得 \(\b q_j^\top\b p_i=1\)

[!NOTE]

从另一个角度,\(\b A^\H\) 的特征向量与 \(\b A\) 的左特征向量之间存在共轭关系,因此其与条件数也有联系:如果条件数很大(夹角很大),那么为了保证 \(\b q_j^\top\b p_i=1\),两个向量之一就必须很大。

于是:

  • 对于可对角化的 \(\b A\),令 \(\b P\) 为其特征向量矩阵,则可以唯一确定 \(\b Q\) 满足 \(\b Q^\H\b P=\b I\)\(\b Q\)\(\b A^\H\) 的特征向量。
  • 谱分解指出,\(\b A=\sum\lambda_i\b p_i\b q_i^\H\)

Hermitian 矩阵:

  • 有实特征值。
  • 可逆时,令 \((\lambda,\b u)\) 是特征对,则 \((\lambda^{-1},\b u)\)\(\b A^{-1}\) 的特征对。

Hermitian 矩阵是正定的,当且仅当:

  • 二次型函数 \(\b x^\H\b A\b x>0\)
  • 所有特征值为正。
  • 所有主子矩阵 \(\b A_{1:k,1:k}\) 行列式为正。
  • 存在可逆矩阵 \(\b R\) 使得 \(\b A=\b R^\H\b R\)
  • 任一合同变换 \(\b P^\H\b A\b P\) 后仍然正定。

求特征值/特征向量。

  • 最大特征值:power method。
  • 最小特征值:\(\lambda\b I-\b A\) 使用 power method。
  • 最小模长特征值:对 \(\b A^{-1}\) 使用 power method。
  • 中间特征值:每次求出一个特征向量后用 Householder 变换把它干掉;也可以对 \((\b A-\sigma\b I)^{-1}\) 求出在 \(\sigma\) 附近的特征值。

Gerschgorin 定理:

  • 定义 Gerschgorin 圆是 \(|\lambda-a_{i,i}|=\sum_{j\neq i}|a_{i,j}|\),则每个特征值都位于某个 Gerschgorin 圆中。(证明直接对特征值方程 \(\b A\b x=\lambda\b x\) 中的某一行展开分析即可!)
  • Gerschgorin 圆构成的所有连通块中,每个包含 \(k\) 个圆的连通块中恰包含 \(k\) 个计算重数的特征值。
  • Gerschgorin 圆是行求和,对应右特征向量;列求和对应左特征向量。

推论:孤立的 Gerschgorin 圆中恰有一个特征值;实矩阵的孤立 Gerschgorin 圆中恰有一个实特征值(因为实矩阵的复特征值成对,而实矩阵的 Gerschgorin 圆心总是在实轴上);相似变换不改变特征值但却显著改变 Gerschgorin 圆的分布。

定义:\(R_i(\b A)=\sum_{j\neq i}|a_{i,j}|\),则:

  • 若全体 \(|a_{i,i}|>R_i\) 称作 行严格对角占优
  • 若全体 \(|a_{i,i}|\geq R_i\) 且至少一个严格则称作 行弱对角占优

则行/列严格对角占优意味着可逆。

引理:单位向量 \(\b x\) 满足 \(|\b x^\H\b A\b x|\leq\|\b A\|_{m_\infty}=n\max|a_{i,j}|\)

定理:特征值 \(\lambda\) 满足 \(|\lambda|\leq\|\b A\|_{m_\infty}\)。同时,\(|\t{Re}(\lambda)|\leq\dfrac12\|\b A+\b A^\H\|_\infty,|\t{Im}(\lambda)|\leq\dfrac12\|\b A-\b A^\H\|_\infty\)

推论:Hermitian 矩阵的特征值都在实轴上;反 Hermitian 矩阵的特征值都在虚轴上。

Schur 引理:可对角化的矩阵可以被酉变换为上三角矩阵。

Schur 不等式:\(\sum|\lambda_i|^2\leq\sum|a_{i,j}|^2=\|\b A\|_\t F^2\);当且仅当是正规矩阵时取等。


Cayley-Hamilton 定理:特征多项式 \(\det(\b A-x\b I)\) 是最小零化多项式。

用于求逆:令特征多项式是 \(\sum p_ix^i\),则有 \(\b A^{-1}=-\dfrac1{p_0}\sum p_i\b A^{i-1}\)

Decell 定理:对于 \(m\times n\) 矩阵 \(\b A\),令 \(\b A\b A^\H\) 的特征多项式为 \(f(\lambda)=(-1)^m\sum a_i\lambda^{m-i}\) 其中 \(a_0=1\),则令 \(k\) 为最大的满足 \(a_k\neq0\) 的整数,则 \(k=\rank(\b A)\) 且 M-P 逆满足

\[\b A^\dagger=-a_k^{-1}\b A^\H=[\sum a_i(\b A\b A^\H)^{k-i-1}] \]

于是可以由此计算 M-P 逆。

posted @ 2026-04-18 16:17  Troverld  阅读(82)  评论(0)    收藏  举报