Quant Research · Finance · CS — General Interview Preparation

Linear Algebra
Complete Guide

面试线性代数完全手册,覆盖所有核心考点:秩、特征值、Jordan form、SVD、幂等/幂零矩阵、OLS、Rayleigh 商、Matrix Calculus。适用于所有量化/算法岗位面试。

Rank & Nullity Eigenvalues Diagonalization Jordan Form SVD Idempotent Nilpotent Positive Definite OLS Rayleigh Quotient Matrix Calculus Monte Carlo
01

秩与零空间 (Rank & Nullity)

核心定理

Rank–Nullity Theorem

对 $A \in \mathbb{R}^{m \times n}$:

$$\operatorname{rank}(A) + \operatorname{nullity}(A) = n$$

$\operatorname{null}(A) = \{x : Ax = 0\}$,维度即为 nullity。

秩不等式全集
上界
$\operatorname{rank}(A) \le \min\{m, n\}$
乘积
$\operatorname{rank}(AB) \le \min\{\operatorname{rank}(A), \operatorname{rank}(B)\}$
加法
$|\operatorname{rank}(A) - \operatorname{rank}(B)| \le \operatorname{rank}(A+B)$ $\le \operatorname{rank}(A) + \operatorname{rank}(B)$
Sylvester 不等式
$\operatorname{rank}(A) + \operatorname{rank}(B) \le \operatorname{rank}(AB) + n$
$A \in \mathbb{R}^{m\times n},\ B \in \mathbb{R}^{n\times p}$
转置不变
$\operatorname{rank}(A) = \operatorname{rank}(A^T) = \operatorname{rank}(A^TA) = \operatorname{rank}(AA^T)$
Frobenius 不等式
$\operatorname{rank}(AB) + \operatorname{rank}(BC) \le \operatorname{rank}(B) + \operatorname{rank}(ABC)$

四个基本子空间

子空间定义维度正交补
列空间 $\mathcal{C}(A)$ $\{Ax : x \in \mathbb{R}^n\}$ $\operatorname{rank}(A)$ $\mathcal{N}(A^T)$
行空间 $\mathcal{C}(A^T)$ $\{A^Ty : y \in \mathbb{R}^m\}$ $\operatorname{rank}(A)$ $\mathcal{N}(A)$
零空间 $\mathcal{N}(A)$ $\{x : Ax = 0\}$ $n - \operatorname{rank}(A)$ $\mathcal{C}(A^T)$
左零空间 $\mathcal{N}(A^T)$ $\{y : A^Ty = 0\}$ $m - \operatorname{rank}(A)$ $\mathcal{C}(A)$

矩阵可逆等价条件

Invertibility Checklist — $A \in \mathbb{R}^{n\times n}$

以下条件互相等价:

  1. $\operatorname{rank}(A) = n$(满秩)
  2. $\det(A) \ne 0$
  3. 所有特征值 $\lambda_i \ne 0$
  4. $\operatorname{nullity}(A) = 0$(零空间仅含零向量)
  5. $Ax = 0$ 仅有零解
  6. $A$ 的列(行)向量线性无关
HARD · SIG频考 $A^2$ has rank 0,$A$ 的 rank 范围?构造最大秩的矩阵。
$A$ 是 $n \times n$ 矩阵,$A^2 = 0$(即 $A$ 是幂零矩阵,$k=2$)。问 $\operatorname{rank}(A)$ 的最大值是多少?请构造一个达到最大秩的例子。
解答

利用 Sylvester 不等式:$\operatorname{rank}(A) + \operatorname{rank}(A) \le \operatorname{rank}(A^2) + n = 0 + n = n$

故 $\operatorname{rank}(A) \le \lfloor n/2 \rfloor$。

验证可达到:取 $r = \lfloor n/2 \rfloor$,构造

$$A = \begin{pmatrix} 0 & I_r & 0 \\ 0 & 0 & 0 \\ 0 & 0 & 0 \end{pmatrix}$$

其中 $I_r$ 是 $r\times r$ 单位矩阵,易验证 $A^2 = 0$ 且 $\operatorname{rank}(A) = r = \lfloor n/2 \rfloor$。

HARD $A^3 = 0$,$\operatorname{rank}(A)$ 最大值?
$A$ 是 $n \times n$ 矩阵,$A^3 = 0$ 但 $A \ne 0$。求 $\operatorname{rank}(A)$ 的最大值。
解答

设 $\operatorname{rank}(A) = r$,对 $A \cdot A$ 用 Sylvester:$2r \le \operatorname{rank}(A^2) + n$,故 $\operatorname{rank}(A^2) \ge 2r - n$。

对 $A^2 \cdot A$ 用 Sylvester:$\operatorname{rank}(A^2) + r \le \operatorname{rank}(A^3) + n = n$,故 $\operatorname{rank}(A^2) \le n - r$。

联立:$2r - n \le n - r \Rightarrow 3r \le 2n \Rightarrow r \le \lfloor 2n/3 \rfloor$。

最大值为 $\lfloor 2n/3 \rfloor$,可用 Jordan 块构造验证。

HARD · Image原题 $n \times n$ 矩阵 $A$(元素 i.i.d. $N(0,1)$),$AB = BA$,$B$ 的空间维度?
$A$ 是 $n \times n$ 矩阵,每个元素独立同分布自 $N(0,1)$。已知 $AB = BA$($B$ 与 $A$ 可交换)。问所有可能的 $B$ 张成的空间维度是多少?
关键分析

核心结论:从 $N(0,1)$ 随机采样的矩阵几乎必然(almost surely)有 $n$ 个不同的实特征值,从而 $A$ 几乎必然可对角化,且特征值两两不同。

定理:若 $A$ 有 $n$ 个不同特征值,则与 $A$ 可交换的矩阵恰好是 $A$ 的多项式,即

$$\{B : AB = BA\} = \operatorname{span}\{I, A, A^2, \ldots, A^{n-1}\}$$

这是因为:设 $A = PDP^{-1}$,$D$ 的对角元两两不同。$AB = BA \Rightarrow D(P^{-1}BP) = (P^{-1}BP)D$,对角矩阵只与对角矩阵可交换(对角元不同时),故 $P^{-1}BP$ 是对角矩阵,$B$ 被 $P$ 的列(特征向量)完全决定,只有 $n$ 个自由度。

维度 = $n$。基:$\{I, A, A^2, \ldots, A^{n-1}\}$(Cayley–Hamilton 保证 $A^n$ 线性相关)。

面试口诀:几乎必然可对角化 → 换到对角化基下 → 只有对角矩阵与之可交换 → $n$ 维自由度。可以直接说标量倍、零矩阵、单位阵、$A$ 本身、$A^{-1}$ 都满足,但这些线性相关,完整的基恰好有 $n$ 个。

MEDIUM $\operatorname{rank}(A) < n/2$ 的矩阵有什么性质?
$n \times n$ 矩阵 $A$,若 $\operatorname{rank}(A) < n/2$,有哪些重要性质?
解答

设 $r = \operatorname{rank}(A) < n/2$:

  • $\operatorname{nullity}(A) = n - r > n/2$,零空间维度超过一半。
  • $A$ 不可逆($\det(A) = 0$)。
  • $A^2$:由 Sylvester,$\operatorname{rank}(A^2) \ge 2r - n < 0$,故 $\operatorname{rank}(A^2)$ 可以为 0(即 $A^2$ 可以是零矩阵)。
  • 至少有 $n - r > n/2$ 个特征值为 0。
  • 行(列)空间与零空间"几乎不相交",但在 $r < n/2$ 时列空间维度严格小于零空间维度。
01+

秩不等式:推导与记忆

核心思路:每条不等式都有一个几何直觉。记住直觉,推导自然出来。下面逐一拆解。

① 上界:$\operatorname{rank}(A) \le \min\{m,n\}$

推导

rank = 列空间维度,列空间 $\subseteq \mathbb{R}^m$,故 $\le m$;同时 rank = 行空间维度,行空间 $\subseteq \mathbb{R}^n$,故 $\le n$。两个约束同时成立取小的。

记忆:桶有多小,水就装多少。

② 乘积:$\operatorname{rank}(AB) \le \min\{\operatorname{rank}(A), \operatorname{rank}(B)\}$

两个方向,完全对称
≤ rank(A):看列

$AB$ 的第 $j$ 列 $= A \cdot b_j$,是 $A$ 的列的线性组合。

$\therefore \mathcal{C}(AB) \subseteq \mathcal{C}(A)$,维度只能更小。

这个方向与 $B$ 的结构无关,$B$ 只是在给 $A$ 的列"提供系数"。

≤ rank(B):看行

$AB$ 的第 $i$ 行 $= a_i^T \cdot B$,是 $B$ 的行的线性组合。

$\therefore \mathcal{R}(AB) \subseteq \mathcal{R}(B)$,维度只能更小。

这个方向与 $A$ 的结构无关,$A$ 只是在给 $B$ 的行"提供系数"。

记忆:列空间由左矩阵控制,行空间由右矩阵控制。信息经过最窄的门。

③ 加法:$|\operatorname{rank}(A)-\operatorname{rank}(B)| \le \operatorname{rank}(A+B) \le \operatorname{rank}(A)+\operatorname{rank}(B)$

推导(两侧)

右侧上界:$(A+B)$ 的列空间 $\subseteq \mathcal{C}(A) + \mathcal{C}(B)$(子空间和),

$$\dim(\mathcal{C}(A)+\mathcal{C}(B)) \le \dim\mathcal{C}(A)+\dim\mathcal{C}(B)$$

左侧下界:用上界反向推:

$$\operatorname{rank}(A) = \operatorname{rank}((A+B)-B) \le \operatorname{rank}(A+B)+\operatorname{rank}(B)$$ $$\Rightarrow \operatorname{rank}(A+B) \ge \operatorname{rank}(A)-\operatorname{rank}(B)$$

对称地得到另一侧,合并取绝对值。

记忆:类比实数三角不等式 $|a-b| \le |a+b| \le |a|+|b|$,rank 满足同样结构。

④ Sylvester 不等式:$\operatorname{rank}(A)+\operatorname{rank}(B) \le \operatorname{rank}(AB)+n$

最核心的不等式——做幂次题的关键工具

证明(分块矩阵法):构造

$$M = \begin{pmatrix} AB & 0 \\ B & -I_n \end{pmatrix}$$

对 $M$ 做列变换(第一列组加上 $A$ 倍的第二列组),rank 不变:

$$M \to \begin{pmatrix} 0 & A \\ B & -I_n \end{pmatrix}$$

右边矩阵:$-I_n$ 满秩贡献 $n$,再加上 $A$ 和 $B$ 带来的信息,rank $= n + \operatorname{rank}(A)$(因为 $-I_n$ 列和 $A$ 列线性无关)。

同时次加性给出:$\operatorname{rank}(M) \le \operatorname{rank}(AB) + \operatorname{rank}(-I_n) = \operatorname{rank}(AB)+n$。

又 $\operatorname{rank}(M) \ge \operatorname{rank}(B)$(分块下三角),联立得

$$\operatorname{rank}(A)+\operatorname{rank}(B) \le \operatorname{rank}(AB)+n$$
几何直觉 + 记忆

$B$ 把 $\mathbb{R}^p$ 映到 $\mathbb{R}^n$,损失 $n-\operatorname{rank}(B)$ 维;$A$ 再映,损失 $n-\operatorname{rank}(A)$ 维。两次损失都发生在 $n$ 维中间空间,总损失 $\le n$:

$$\operatorname{rank}(AB) \ge \operatorname{rank}(A)+\operatorname{rank}(B)-n$$

做题常用形式:$\operatorname{rank}(AB) \ge \operatorname{rank}(A)+\operatorname{rank}(B)-n$,记为"扣掉中间维度 $n$ 的下界"。

典型应用:$A^2=0 \Rightarrow 2\operatorname{rank}(A) \le n \Rightarrow \operatorname{rank}(A) \le \lfloor n/2\rfloor$

⑤ 转置不变:$\operatorname{rank}(A)=\operatorname{rank}(A^T)=\operatorname{rank}(A^TA)=\operatorname{rank}(AA^T)$

推导核心:零空间相同

证明 $\mathcal{N}(A) = \mathcal{N}(A^TA)$:

  • $Ax=0 \Rightarrow A^TAx=0$(显然)
  • $A^TAx=0 \Rightarrow x^TA^TAx=0 \Rightarrow \|Ax\|^2=0 \Rightarrow Ax=0$

零空间相同 $\Rightarrow$ 由 rank-nullity,rank 相同。

应用:OLS 中 $X^TX$ 和 $X$ 共享零空间,$X$ 有共线性 $\Leftrightarrow$ $X^TX$ 不可逆。

⑥ Frobenius 不等式:$\operatorname{rank}(AB)+\operatorname{rank}(BC) \le \operatorname{rank}(B)+\operatorname{rank}(ABC)$

Sylvester 的三矩阵升级版

Sylvester 是 $C=I$(或 $A=I$)时的特例:令 $C=I$,左侧 $= \operatorname{rank}(AB)+\operatorname{rank}(B)$,右侧 $= \operatorname{rank}(B)+\operatorname{rank}(AB)$——退化为平凡等式,故 Frobenius 是更强的结论。

记忆:Sylvester(两矩阵,中间维度 $n$)→ Frobenius(三矩阵,中间矩阵 $B$ 的 rank)。

整体记忆框架
不等式直觉关键词做题用途
上界 $\le \min\{m,n\}$最小维度约束基础估计
乘积 $\le \min\{r_A,r_B\}$最窄的门判断 rank 上界
加法三角类比实数绝对值秩之间的夹逼
Sylvester $\ge r_A+r_B-n$两次损失共享 $n$ 维幂次/幂零题核心
转置不变零空间相同OLS / 共线性分析
FrobeniusSylvester 三矩阵版连乘 rank 估计
02

特征值与对角化

基本性质

Eigenvalue Facts
特征方程
$\det(A - \lambda I) = 0$
迹与行列式
$\operatorname{tr}(A) = \sum_i \lambda_i$,$\det(A) = \prod_i \lambda_i$
幂次
$A^k v = \lambda^k v$($v$ 是特征向量)
多项式
若 $f(A) = 0$,则 $f(\lambda) = 0$(Cayley–Hamilton)

对角化条件

对角化充要条件

代数重数 = 几何重数(对所有特征值成立)。

等价:存在 $n$ 个线性无关的特征向量,使得 $A = PDP^{-1}$,其中 $D = \operatorname{diag}(\lambda_1, \ldots, \lambda_n)$。

实对称矩阵(最重要!)

实对称矩阵 $A = A^T$ 一定可对角化,且:

  • 所有特征值为实数
  • 不同特征值对应的特征向量两两正交
  • $A = Q\Lambda Q^T$,$Q$ 为正交矩阵(谱定理)

协方差矩阵 $\rho$ 的范围(经典题)

Covariance Matrix — Range of ρ

设 $n \times n$ 等相关矩阵

$$A = (1-\rho)I + \rho M, \quad M_{ij} = 1 \ \forall i,j$$

$M$ 的特征值:$\lambda = n$(重数 1,特征向量 $\mathbf{1}/\sqrt{n}$)和 $\lambda = 0$(重数 $n-1$)。

故 $A$ 的特征值为 $1 + (n-1)\rho$(重数 1)和 $1 - \rho$(重数 $n-1$)。

半正定要求特征值 $\ge 0$:

$$\boxed{-\frac{1}{n-1} \le \rho \le 1}$$
HARD $A^2 = A$(幂等矩阵)是否可对角化?
若 $A$ 满足 $A^2 = A$,证明 $A$ 一定可对角化,并确定其特征值。
解答

设 $Av = \lambda v$,则 $A^2 v = A(\lambda v) = \lambda^2 v$。又 $A^2 = A$,故 $\lambda^2 v = \lambda v$,即 $\lambda(\lambda-1) = 0$。

特征值只能是 $0$ 或 $1$。

对 $\lambda = 0$:几何重数 = $\dim \mathcal{N}(A) = n - \operatorname{rank}(A)$。

对 $\lambda = 1$:几何重数 = $\dim \mathcal{N}(A - I) = n - \operatorname{rank}(A - I)$。

利用 Sylvester:$\operatorname{rank}(A) + \operatorname{rank}(A - I) \le \operatorname{rank}(A^2 - A) + n = n$,故两者几何重数之和 $\ge n$,等于 $n$,从而 $A$ 可对角化。

$$A \sim \begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}, \quad r = \operatorname{rank}(A)$$
MEDIUM $A^n = I$,在复数域上是否可对角化?
$A$ 是 $n \times n$ 矩阵,$A^n = I$,在 $\mathbb{C}$ 上是否可对角化?
解答

$Av = \lambda v \Rightarrow \lambda^n v = I \cdot v = v \Rightarrow \lambda^n = 1$。

$\lambda^n - 1 = 0$ 在 $\mathbb{C}$ 上有 $n$ 个不同的根($n$ 次单位根):$e^{2\pi i k/n},\ k = 0, 1, \ldots, n-1$。

特征多项式整除 $x^n - 1$,而 $x^n - 1$ 在 $\mathbb{C}$ 上无重根,故 $A$ 的最小多项式无重根,$A$ 在 $\mathbb{C}$ 上一定可对角化。

02+

可对角化条件——完整梳理

核心定义

$A \in \mathbb{R}^{n\times n}$ 可对角化 $\Leftrightarrow$ 存在可逆矩阵 $P$ 使得 $A = PDP^{-1}$,$D = \operatorname{diag}(\lambda_1,\ldots,\lambda_n)$。

等价:$A$ 有 $n$ 个线性无关的特征向量。

充要条件

对每个特征值:代数重数 = 几何重数
代数重数

$\lambda_i$ 作为特征多项式 $\det(A-\lambda I)$ 的根的重数。

几何重数

$\dim\mathcal{N}(A-\lambda_i I) = n - \operatorname{rank}(A-\lambda_i I)$,特征空间维数。

始终有:几何重数 $\le$ 代数重数。可对角化要求等号对所有特征值成立。

充分条件(满足任一即可)

三个充分条件
  • $n$ 个不同特征值:不同特征值对应的特征向量线性无关,直接凑够 $n$ 个。最强但不必要。
  • 实对称矩阵 $A=A^T$:谱定理保证 $A=Q\Lambda Q^T$,$Q$ 正交,特征值全实,特征向量两两正交。
  • 最小多项式无重根:最小多项式 $m_A(\lambda)$ 无重根 $\Leftrightarrow$ 可对角化(与充要条件等价的另一种表述)。

各类矩阵速查表

矩阵类型结论原因
实对称 $A=A^T$✅ 一定可谱定理
$n$ 个不同特征值✅ 一定可不同特征值对应向量线性无关
$A^2=A$(幂等)✅ 一定可特征值只有 0/1,几何=代数重数
$A^n=I$✅ 复数域可最小多项式整除 $x^n-1$,无重根
$A^k=0,\ A\ne 0$(幂零)❌ 一定不可特征值全 0,几何重数 $< n$
$A^n=0$ 且 $A\ne 0$❌ 不可同上
一般方阵需验证检验代数=几何重数

不可对角化的典型例子

Jordan 块 — 不可对角化的最简单例子
$$A = \begin{pmatrix}0&1\\0&0\end{pmatrix}$$

特征值 $\lambda=0$,代数重数 2,但 $\mathcal{N}(A) = \operatorname{span}\{e_1\}$,几何重数只有 1。$2 > 1$,不可对角化。需要 Jordan 标准型。

HARD 给定特征多项式和 rank,判断 Jordan 结构
$A$ 是 $4\times4$ 矩阵,特征多项式为 $(\lambda-2)^3(\lambda-5)$。情况1:$\operatorname{rank}(A-2I)=1$;情况2:$\operatorname{rank}(A-2I)=2$。各自是否可对角化?
解答

$\lambda=5$ 代数重数 1,几何重数自动为 1,无问题。关键看 $\lambda=2$(代数重数 3)。

几何重数 $= 4 - \operatorname{rank}(A-2I)$。

  • 情况 1:几何重数 $= 4-1=3$,等于代数重数 3,✅ 可对角化。
  • 情况 2:几何重数 $= 4-2=2 < 3$,❌ 不可对角化,需要 Jordan 块。

情况 2 的 Jordan 形($\lambda=2$ 部分):几何重数 2 说明有 2 个 Jordan 块,代数重数 3 说明大小之和为 3,故一个块大小为 2,一个为 1:

$$J = \begin{pmatrix}2&1&0&0\\0&2&0&0\\0&0&2&0\\0&0&0&5\end{pmatrix}$$
MEDIUM 有 0 特征值的矩阵能可逆吗?
若矩阵 $A$ 有特征值 $\lambda=0$,它有可能可逆吗?
解答

绝对不能。 $\lambda=0$ 是特征值意味着 $\exists v \ne 0$ 使得 $Av = 0v = 0$,即零空间非平凡:

$$\mathcal{N}(A) \ne \{0\} \Rightarrow \operatorname{nullity}(A) \ge 1 \Rightarrow \operatorname{rank}(A) < n$$

同时 $\det(A) = \prod_i \lambda_i$,含因子 0,故 $\det(A) = 0$,不可逆。

这是一个充要条件:$A$ 不可逆 $\Leftrightarrow$ $\lambda=0$ 是特征值 $\Leftrightarrow$ $\det(A)=0$。

03

矩阵分解

分解一览表
分解形式条件主要应用
LU $PA = LU$ 任意方阵(行交换后) 解方程,行列式,矩阵求逆
QR $A = QR$ 任意矩阵 最小二乘,特征值 QR 算法,数值稳定
Cholesky $A = LL^T$ 对称正定 (SPD) 协方差采样,Monte Carlo,快速求解
特征分解 $A = PDP^{-1}$ 可对角化;对称则 $A = Q\Lambda Q^T$ 谱分析,PCA,微分方程
SVD $A = U\Sigma V^T$ 任意矩阵 $m \times n$ PCA,低秩近似,伪逆,多重共线性

SVD 深度解析

Singular Value Decomposition
$$A = U \Sigma V^T, \quad A \in \mathbb{R}^{m \times n}$$
  • $U \in \mathbb{R}^{m\times m}$:正交矩阵,列为 $AA^T$ 的特征向量(左奇异向量),张成 列空间
  • $V \in \mathbb{R}^{n\times n}$:正交矩阵,列为 $A^TA$ 的特征向量(右奇异向量),张成 行空间
  • $\Sigma$:对角矩阵,$\sigma_i = \sqrt{\lambda_i(A^TA)} \ge 0$(奇异值)
  • $\operatorname{rank}(A)$ = 非零奇异值个数
  • 最优低秩近似:$A_k = U_k \Sigma_k V_k^T$(Eckart–Young 定理)
QR 分解 — Gram–Schmidt
$$q_k = a_k - \sum_{j < k} \frac{\langle q_j, a_k \rangle}{\langle q_j, q_j \rangle} q_j, \quad u_k = \frac{q_k}{\|q_k\|}$$

$A = QR$,$Q = [u_1 \cdots u_n]$,$R = Q^T A$(上三角矩阵)。

解方程:$Ax = b \Rightarrow QRx = b \Rightarrow Rx = Q^Tb$(回代求解)。

LU vs QR 面试答法:LU 偏纯代数操作(解方程系统、行列式),QR 偏数值稳定性(最小二乘、迭代特征值算法)。QR 避免了 $A^TA$ 条件数平方的问题,更鲁棒。

04

幂等矩阵 Idempotent ($A^2 = A$)

核心性质
  • 特征值只能是 $0$ 或 $1$
  • 一定可对角化(同上面例题证明)
  • $\operatorname{rank}(A) = \operatorname{tr}(A)$(迹 = 秩!)
  • $A$ 和 $I - A$ 都是幂等矩阵(互补投影)
  • $\operatorname{rank}(A) + \operatorname{rank}(I - A) = n$
  • 若还对称 $A = A^T$:$A$ 是正交投影矩阵

投影矩阵(OLS核心)

Projection Matrix
$$P = A(A^TA)^{-1}A^T$$

$P^2 = P$(幂等),$P^T = P$(对称),投影到 $\mathcal{C}(A)$。

$$\operatorname{rank}(P) = \operatorname{tr}(P) = \operatorname{rank}(A)$$
HARD · Image原题 $MM^T = M$,$M$ 的秩有什么特性?
矩阵 $M$ 满足 $MM^T = M$(注意:这不是标准幂等 $M^2 = M$)。问 $M$ 的秩有什么特性?能推断什么?
解答

Step 1:取转置:$(MM^T)^T = M^T \Rightarrow M(M^T)^T = (MM^T)^T = M^T$,即 $MM = M^T$,即 $M^2 = M^T$。

Step 2:再利用 $MM^T = M$,对 $M^2 = M^T$ 取转置:$(M^2)^T = M$,即 $(M^T)^2 = M$。

Step 3:$\operatorname{rank}(M) = \operatorname{rank}(MM^T) \le \operatorname{rank}(M^T) = \operatorname{rank}(M)$,等号成立。

Step 4:$M^3 = M \cdot M^2 = M \cdot M^T = MM^T = M$,所以 $M^3 = M$,即 $M(M^2 - I) = 0$。这意味着 $M$ 的特征值满足 $\lambda^3 = \lambda$,即 $\lambda \in \{0, 1, -1\}$。

结论:$\operatorname{rank}(M) = \operatorname{rank}(M^T)$(显然),特征值 $\in \{0, 1, -1\}$,$M$ 在 $\mathbb{R}$ 上可对角化。

05

幂零矩阵 Nilpotent ($\exists k: A^k = 0$)

核心性质
  • 所有特征值均为 $0$($\det(A) = 0$,$\operatorname{tr}(A) = 0$)
  • 若 $A \ne 0$,则 $A$ 不可对角化(几何重数 $< n$)
  • 可分解为若干 Jordan 块(对角元全为 0)
  • $\operatorname{rank}(A) = n - \text{\#Jordan blocks}$
  • $\operatorname{tr}(A^j) = 0$,$\forall j \ge 1$
  • $\operatorname{rank}(A^m) \le \operatorname{rank}(A^{m-1})$(单调不增)
  • 若 $A \ne 0$,则 $A$ 不可逆
幂零矩阵与幂等矩阵的关系

若 $A$ 幂零,$B = I - A$ 是可逆的(因为 $B^{-1} = I + A + A^2 + \cdots + A^{k-1}$,有限项)。

若 $A$ 幂等,$A$ 和 $I - A$ 都幂等,秩互补。

06

正定 / 半正定矩阵

Positive (Semi)Definite — 判定条件
条件正定 (PD)半正定 (PSD)
二次型 $x^TAx > 0,\ \forall x \ne 0$ $x^TAx \ge 0,\ \forall x$
特征值 所有 $\lambda_i > 0$ 所有 $\lambda_i \ge 0$
Sylvester 判别 所有顺序主子式 $> 0$ 所有主子式 $\ge 0$
分解 $A = LL^T$(Cholesky) $A = BB^T$(某个 $B$)
协方差矩阵必为半正定

对任意 $x$:$x^T \Sigma x = x^T \mathbb{E}[(Z-\mu)(Z-\mu)^T] x = \mathbb{E}[\|x^T(Z-\mu)\|^2] \ge 0$

若数据无完全共线性,则协方差矩阵是正定的($X^TX$ 可逆)。

MEDIUM $x, y, z$ 三变量相关系数 $\rho_{xy} = \rho_{yz} = 0.9$,$\rho_{xz}$ 的范围?
三个随机变量的相关系数满足 $\rho_{xy} = \rho_{yz} = 0.9$,求 $\rho_{xz}$ 的范围。
解答

相关矩阵

$$\text{Corr} = \begin{pmatrix} 1 & 0.9 & x \\ 0.9 & 1 & 0.9 \\ x & 0.9 & 1 \end{pmatrix}$$

半正定要求所有主子式 $\ge 0$。行列式展开:

$$\det = 1 - 0.81 - 0.9(0.9 - 0.9x) + x(0.81 - x) = -x^2 + 1.62x - 0.62 \ge 0$$ $$-(x-1)(x-0.62) \ge 0 \Rightarrow x \in [0.62, 1]$$

故 $\rho_{xz} \in [0.62, 1]$。

07

Jordan 标准型

Jordan Form

每个方阵 $A$ 在复数域上相似于 Jordan 标准形:

$$A \sim J = \begin{pmatrix} J_1 & & \\ & J_2 & \\ & & \ddots \end{pmatrix}, \quad J_k = \begin{pmatrix} \lambda_k & 1 & & \\ & \lambda_k & 1 & \\ & & \ddots & 1 \\ & & & \lambda_k \end{pmatrix}$$
关键计数关系
  • 特征值 $\lambda_i$ 对应的 Jordan 块总数 = $\dim \mathcal{N}(A - \lambda_i I)$(几何重数)
  • 最大 Jordan 块大小 = $\lambda_i$ 在最小多项式中的幂次
  • 代数重数 = $\lambda_i$ 对应所有 Jordan 块大小之和
  • 可对角化 $\Leftrightarrow$ 所有 Jordan 块大小为 1 $\Leftrightarrow$ 最小多项式无重根
  • 幂零矩阵:$\lambda = 0$,Jordan 块形如 $J_k(0)$

SIG 常问:给定 $\operatorname{rank}$ 和特征多项式,确定 Jordan 标准形的结构。关键:$\operatorname{rank}(A - \lambda I)$ 决定几何重数(Jordan 块数量),$\operatorname{rank}(A - \lambda I)^k$ 的变化决定块的大小分布。

07+

Jordan 标准型——深度解析

为什么需要 Jordan 标准型?

动机

对角化失败时(几何重数 < 代数重数),矩阵无法写成 $PDP^{-1}$。但任何方阵在 $\mathbb{C}$ 上都相似于"几乎对角"的 Jordan 标准型。

$$\text{对角阵} \subset \text{Jordan 标准型} \subset \text{任意方阵(相似意义下)}$$

Jordan 块

$k\times k$ Jordan 块
$$J_k(\lambda) = \begin{pmatrix}\lambda&1&&\\&\lambda&1&\\&&\ddots&1\\&&&\lambda\end{pmatrix}_{k\times k}$$
  • $k=1$:退化为标量 $(\lambda)$,即普通对角元
  • $k=2$:$\begin{pmatrix}\lambda&1\\0&\lambda\end{pmatrix}$,最简单的不可对角化情形
  • $(J_k(\lambda) - \lambda I)^k = 0$,即每个 Jordan 块减去对角后是幂零矩阵

从 rank 序列精确确定 Jordan 结构

系统方法:逐层分析

定义 $r_j = \operatorname{rank}(A-\lambda I)^j$,$r_0 = n$。

大小恰好为 $k$ 的 Jordan 块个数:

$$n_k = (r_{k-1} - r_k) - (r_k - r_{k+1}) = r_{k-1} - 2r_k + r_{k+1}$$

直觉:$r_{k-1}-r_k$ 是"第 $k$ 层新增的维度",二阶差分提取恰好大小为 $k$ 的块。

例题:$6\times6$ 矩阵,唯一特征值 $\lambda=3$

已知 $r_0=6,\ r_1=4,\ r_2=2,\ r_3=1,\ r_4=0$,求 Jordan 结构。

大小 $k$$n_k = r_{k-1}-2r_k+r_{k+1}$结果
$k=1$$6-2(4)+2=0$0 个 $1\times1$ 块
$k=2$$4-2(2)+1=1$1 个 $2\times2$ 块
$k=3$$2-2(1)+0=0$0 个 $3\times3$ 块
$k=4$$1-2(0)+0=1$1 个 $4\times4$ 块

验证:$0\cdot1+1\cdot2+0\cdot3+1\cdot4=6$ ✓

$$J = \begin{pmatrix}3&1&&&&&\\&3&&&&& \\&&3&1&&&\\&&&3&1&&\\&&&&3&1&\\&&&&&3&1\\&&&&&&3\end{pmatrix}$$

广义特征向量与 Jordan 链

Jordan 链

对一个 $k\times k$ Jordan 块,对应一条广义特征向量链:

$$v_1 \xleftarrow{(A-\lambda I)} v_2 \xleftarrow{(A-\lambda I)} \cdots \xleftarrow{(A-\lambda I)} v_k$$

即 $(A-\lambda I)v_j = v_{j-1}$。$v_1$ 是真正的特征向量($(A-\lambda I)v_1=0$),$v_2,\ldots,v_k$ 是广义特征向量。$P = [v_1,\ldots,v_k]$ 使得 $P^{-1}AP = J_k(\lambda)$。

Jordan 块的幂次公式

$J_k(\lambda)^m$ 的显式公式
$$J_k(\lambda)^m = \begin{pmatrix}\lambda^m & \binom{m}{1}\lambda^{m-1} & \binom{m}{2}\lambda^{m-2} & \cdots \\ & \lambda^m & \binom{m}{1}\lambda^{m-1} & \cdots \\ & & \ddots & \vdots \\ & & & \lambda^m\end{pmatrix}$$

本质:$J_k(\lambda) = \lambda I + N$($N$ 是严格上三角幂零矩阵),二项式定理展开:

$$(\lambda I + N)^m = \sum_{j=0}^{k-1}\binom{m}{j}\lambda^{m-j}N^j$$

推论:$|\lambda|<1 \Rightarrow J_k(\lambda)^m \to 0$;$\lambda=0$(幂零块)$\Rightarrow J_k(0)^k=0$。

与最小多项式的精确对应

最小多项式 = 最大 Jordan 块之积
$$m_A(\lambda) = \prod_i (\lambda-\lambda_i)^{s_i}$$

$s_i$ = 特征值 $\lambda_i$ 对应的最大 Jordan 块的大小(不是代数重数!)。

因此:可对角化 $\Leftrightarrow$ $m_A$ 无重根 $\Leftrightarrow$ 所有 $s_i=1$。

面试快速判断总结

计算含义
Jordan 块总个数($\lambda_i$)$n-\operatorname{rank}(A-\lambda_i I)$= 几何重数
最大块大小最小的 $k$ 使 $(A-\lambda_i I)^k$ 降 rank 停止= 最小多项式中的幂次
大小恰为 $k$ 的块数$r_{k-1}-2r_k+r_{k+1}$二阶差分
所有块大小之和= 代数重数必须凑到这个数
HARD $A, B$ 均可对角化,$\operatorname{rank}(A)+\operatorname{rank}(B)=5$($4\times4$),$AB$ 是幂零矩阵吗?
$A, B$ 均为 $4\times4$ 可对角化矩阵,$\operatorname{rank}(A)+\operatorname{rank}(B)=5$,问 $AB$ 是否一定是幂零矩阵?
解答

Step 1:$AB \ne 0$。 由 Sylvester:

$$\operatorname{rank}(AB) \ge \operatorname{rank}(A)+\operatorname{rank}(B)-n = 5-4 = 1$$

反例($AB$ 不是幂零):

$$A = \operatorname{diag}(1,1,0,0),\quad B = \operatorname{diag}(1,1,1,0)$$

两者均可对角化,rank 和 $= 2+3=5$,$AB = \operatorname{diag}(1,1,0,0)$,特征值含 1,不是幂零。

构造($AB$ 是幂零):取 $A=e_1e_2^T$(rank 1),$B$ 使 $ABe_1 = 0$,则 $(AB)^2=0$。

关键观察:若 $A, B$ 同时可对角化(存在同一个 $P$),则 $AB$ 也可对角化。非零的可对角化矩阵特征值不全为零,故不是幂零矩阵。但题目没说同时可对角化,所以答案是不一定

08

不等式与常用技巧

Cauchy–Schwarz
$|x^Ty| \le \|x\|_2 \|y\|_2$

等号成立 $\Leftrightarrow$ $x = cy$

AM–GM
$\frac{a+b}{2} \ge \sqrt{ab},\ a,b \ge 0$
谱范数 vs Frobenius
$\|A\|_2 = \sigma_{\max}$,$\|A\|_F = \sqrt{\sum \sigma_i^2}$ $\|A\|_2 \le \|A\|_F \le \sqrt{r}\|A\|_2$
条件数
$\kappa(A) = \sigma_{\max}/\sigma_{\min}$

$\kappa(A^TA) = \kappa(A)^2$,正则化相当于人为增大 $\sigma_{\min}$

MEDIUM 为什么 $X$ 有多重共线性时 $X^TX$ 不可逆?
解释为什么当设计矩阵 $X$ 的列存在多重共线性时,$X^TX$ 不可逆,并给出 Ridge 回归解决思路。
解答

$\operatorname{rank}(X^TX) = \operatorname{rank}(X)$(因为 $X^TX$ 和 $X$ 有相同的零空间)。

若 $X$ 的列线性相关,$\operatorname{rank}(X) < n$($n$ 是特征数),故 $X^TX$ 降秩不可逆。

SVD 视角:$X = U\Sigma V^T$,$X^TX = V\Sigma^2 V^T$,某些奇异值 $\sigma_i = 0$,对应 $X^TX$ 有零特征值。

Ridge 修复:$(X^TX + \lambda I)^{-1}$ 永远可逆,因为 $(X^TX + \lambda I)$ 的特征值为 $\sigma_i^2 + \lambda > 0$。

09

OLS 与投影几何

Ordinary Least Squares
$$\min_\beta \|X\beta - y\|_2^2$$

正规方程:$X^TX\hat\beta = X^Ty$

$$\hat\beta = (X^TX)^{-1}X^Ty, \quad \hat y = X\hat\beta = Py$$

$P = X(X^TX)^{-1}X^T$:投影矩阵,$P^2 = P$,$P^T = P$。

残差:$e = y - \hat y = (I - P)y$,且 $X^Te = 0$(残差与列空间正交)。

用 QR 求解 OLS(数值稳定)

$X = QR$,则 $X^TX = R^TQ^TQR = R^TR$,正规方程化为

$$R\hat\beta = Q^Ty$$

上三角方程组,直接回代,避免 $X^TX$ 条件数平方问题。

10

矩阵求导 (Matrix Calculus)

常用公式速查
函数 $f$$\partial f / \partial x$类型
$f = a^T x$ $a$ 标量对向量
$f = x^T x$ $2x$ 标量对向量
$f = x^T A x$ $(A + A^T)x$(若 $A$ 对称则为 $2Ax$) 标量对向量
$y = Ax$ $\partial y / \partial x = A$ 向量对向量
$f = a^T X b$ $\partial f / \partial X = ab^T$ 标量对矩阵
$f = \operatorname{tr}(AX)$ $\partial f / \partial X = A^T$ 标量对矩阵
$f = \operatorname{tr}(AXB)$ $\partial f / \partial X = A^TB^T$ 标量对矩阵
$f = \log\det(X)$ $\partial f / \partial X = (X^{-1})^T$ 标量对矩阵
MEDIUM 推导 OLS 正规方程
利用矩阵求导,推导 $\min_\beta \|X\beta - y\|^2$ 的闭式解。
解答

展开目标函数:

$$f(\beta) = (X\beta - y)^T(X\beta - y) = \beta^TX^TX\beta - 2y^TX\beta + y^Ty$$

对 $\beta$ 求导(利用 $\partial(\beta^T A\beta)/\partial\beta = 2A\beta$ for symmetric $A$):

$$\frac{\partial f}{\partial \beta} = 2X^TX\beta - 2X^Ty = 0$$ $$\Rightarrow \hat\beta = (X^TX)^{-1}X^Ty$$
11

Monte Carlo — 相关资产模拟

生成 $X \sim N(0, \Sigma)$ 的方法对比
方法步骤条件效率
Cholesky $\Sigma = LL^T$,令 $X = LZ$ 正定 最快 $O(n^3/3)$
特征分解 $\Sigma = Q\Lambda Q^T$,令 $X = Q\Lambda^{1/2}Z$ 半正定 中等,可截断负特征值
SVD $\Sigma = U\Sigma V^T$,令 $X = U\Sigma^{1/2}Z$ 任意 最通用但最慢
因子模型 $\Sigma \approx BB^T + D$,$X = Bf + \epsilon$ 高维近似 高维首选

面试标准答法(Cholesky):给定协方差矩阵 $\Sigma$,做 Cholesky 分解 $\Sigma = LL^T$,令 $X = LZ,\ Z \sim N(0, I)$。验证:$\operatorname{Cov}(X) = L \operatorname{Cov}(Z) L^T = LIL^T = \Sigma$。若 $\Sigma$ 不正定(如数值误差),加 $\varepsilon I$ 扰动或用特征分解截断非正特征值。

高频面试例题库

HARD $A$ 是秩为 1 的矩阵,$A = uv^T$,求其特征值与幂次。
$A = uv^T$($u, v \in \mathbb{R}^n$,$u, v \ne 0$),求所有特征值,并计算 $A^k$。
解答

$\operatorname{rank}(A) = 1$(除非 $u \perp v$),故特征值 $\lambda = 0$ 代数重数为 $n-1$,还有 $1$ 个非零特征值。

$A^2 = (uv^T)(uv^T) = u(v^Tu)v^T = (v^Tu)A$,所以 $A^2 = \alpha A$,其中 $\alpha = v^Tu$。

非零特征值:取 $x = u$,$Ax = uv^Tu = \alpha u$,故 $\lambda_1 = \alpha = v^Tu$(即 $u$ 是特征向量)。

故特征值:$\lambda_1 = v^Tu$(重数 1),$\lambda_2 = 0$(重数 $n-1$)。

幂次:$A^k = \alpha^{k-1} A = (v^Tu)^{k-1} uv^T$($k \ge 1$)。

HARD 行秩 = 列秩的证明思路
证明矩阵 $A \in \mathbb{R}^{m \times n}$ 的行秩等于列秩。
解答

设列秩为 $r$,取列空间的一组基 $c_1, \ldots, c_r$,令 $C = [c_1 \cdots c_r]$($m \times r$ 矩阵)。

则 $A$ 的每一列都是 $c_i$ 的线性组合:$A = CR$($R$ 是 $r \times n$ 矩阵)。

则 $A$ 的每一行是 $R$ 的行的线性组合,故行空间 $\subseteq$ Row$(R)$,行秩 $\le r$(列秩)。

同理对 $A^T$ 用以上论证:行秩 $\ge$ 列秩。故行秩 = 列秩。

MEDIUM Schur 补与分块矩阵行列式
设分块矩阵 $M = \begin{pmatrix} A & B \\ C & D \end{pmatrix}$,其中 $A$ 可逆,$S = D - CA^{-1}B$ 是 $A$ 的 Schur 补。证明 $\det(M) = \det(A)\det(S)$,并说明其与 OLS 的联系。
解答

分块 LU 分解:

$$M = \begin{pmatrix} I & 0 \\ CA^{-1} & I \end{pmatrix} \begin{pmatrix} A & B \\ 0 & S \end{pmatrix}$$

第一个矩阵行列式为 1,第二个为 $\det(A)\det(S)$,故 $\det(M) = \det(A)\det(S)$。

OLS 联系:在贝叶斯线性回归或条件高斯分布中,Schur 补给出条件方差:$\Sigma_{y|x} = \Sigma_{yy} - \Sigma_{yx}\Sigma_{xx}^{-1}\Sigma_{xy}$,即回归残差的方差。

MEDIUM 实对称矩阵不同特征值的特征向量必正交
证明:实对称矩阵 $A = A^T$ 对应不同特征值 $\lambda_1 \ne \lambda_2$ 的特征向量 $v_1, v_2$ 必正交。
解答

$v_1^T A v_2 = v_1^T (\lambda_2 v_2) = \lambda_2 v_1^T v_2$

又因 $A = A^T$:$v_1^T A v_2 = (Av_1)^T v_2 = (\lambda_1 v_1)^T v_2 = \lambda_1 v_1^T v_2$

故 $(\lambda_1 - \lambda_2) v_1^T v_2 = 0$,因 $\lambda_1 \ne \lambda_2$,所以 $v_1^T v_2 = 0$。$\square$

EASY → HARD $\operatorname{tr}(AB) = \operatorname{tr}(BA)$ 的证明及推广
证明 $\operatorname{tr}(AB) = \operatorname{tr}(BA)$,并推广到 $\operatorname{tr}(ABC)$。
解答

$\operatorname{tr}(AB) = \sum_i (AB)_{ii} = \sum_i \sum_k A_{ik}B_{ki} = \sum_k \sum_i B_{ki}A_{ik} = \sum_k (BA)_{kk} = \operatorname{tr}(BA)$。

推广:$\operatorname{tr}(ABC) = \operatorname{tr}(BCA) = \operatorname{tr}(CAB)$(循环轮换,但 不是任意置换!

应用:$\operatorname{tr}(x^TAx) = x^TAx$(标量),$\operatorname{tr}(Q^TAQ) = \operatorname{tr}(A)$(正交相似变换不改变迹)。

HARD · Quant Finance PCA 与 SVD 的关系,低秩近似在风险模型中的应用
解释 PCA 与 SVD 的数学关系。在量化金融中,如何利用低秩近似处理高维协方差矩阵?
解答

PCA = 协方差矩阵的特征分解 = 数据矩阵的 SVD。

设数据矩阵 $X \in \mathbb{R}^{T \times n}$(中心化后),协方差矩阵 $\hat\Sigma = \frac{1}{T-1}X^TX$。

SVD:$X = U\Sigma V^T$,则 $X^TX = V\Sigma^2 V^T$,$V$ 的列即为 PCA 主成分方向(loadings),$\Sigma^2/(T-1)$ 的对角元为各主成分方差。

低秩近似在风险模型中的作用:

  • 取前 $k$ 个最大奇异值:$\hat\Sigma_k = \sum_{i=1}^k \lambda_i v_i v_i^T + D$(因子模型结构)
  • 减少估计误差(高维时协方差估计噪声大)
  • 提升矩阵条件数,加速 Cholesky 分解
  • 降低 Monte Carlo 模拟成本:只需模拟 $k$ 个因子
MEDIUM Cayley–Hamilton 定理的应用
利用 Cayley–Hamilton 定理计算 $A^{10}$,其中 $A = \begin{pmatrix} 1 & 2 \\ 0 & 3 \end{pmatrix}$。
解答

特征多项式:$p(\lambda) = \det(A - \lambda I) = (1-\lambda)(3-\lambda) = \lambda^2 - 4\lambda + 3$

Cayley–Hamilton:$A^2 - 4A + 3I = 0 \Rightarrow A^2 = 4A - 3I$

递推:$A^3 = A \cdot A^2 = A(4A - 3I) = 4A^2 - 3A = 4(4A-3I) - 3A = 13A - 12I$

一般地,$A^n = \alpha_n A + \beta_n I$,利用特征值 $\lambda_1=1, \lambda_2=3$:

$$\alpha_n = \frac{3^n - 1^n}{3-1} = \frac{3^n-1}{2}, \quad \beta_n = \frac{3 \cdot 1^n - 1 \cdot 3^n}{3-1} = \frac{3 - 3^n}{2}$$ $$A^{10} = \frac{3^{10}-1}{2}A + \frac{3-3^{10}}{2}I$$
01+

秩不等式六条:完整推导与记忆

核心口诀:乘积"最窄的门",加法"三角不等式",Sylvester"两次经过 $n$ 维损失 $\le n$",转置"null space 相同",Frobenius 是 Sylvester 的三矩阵版。

① 上界

$\operatorname{rank}(A) \le \min\{m,n\}$

推导:rank = 列空间维度,列空间 $\subseteq \mathbb{R}^m$,所以 $\le m$;rank 也等于行空间维度,行空间 $\subseteq \mathbb{R}^n$,所以 $\le n$。两个约束取小的。

记忆:桶有多小,水就装多少。

② 乘积(两个视角对称)

$\operatorname{rank}(AB) \le \min\{\operatorname{rank}(A),\operatorname{rank}(B)\}$
看列 → 约束来自 A

$AB$ 的第 $j$ 列 $= A \cdot b_j$($A$ 的列的线性组合),故

$$\mathcal{C}(AB) \subseteq \mathcal{C}(A) \Rightarrow \operatorname{rank}(AB) \le \operatorname{rank}(A)$$
看行 → 约束来自 B

$AB$ 的第 $i$ 行 $= a_i^T \cdot B$($B$ 的行的线性组合),故

$$\mathcal{R}(AB) \subseteq \mathcal{R}(B) \Rightarrow \operatorname{rank}(AB) \le \operatorname{rank}(B)$$
视角谁的空间被包含结论
列空间$\mathcal{C}(AB) \subseteq \mathcal{C}(A)$,由左矩阵 $A$ 控制$\le \operatorname{rank}(A)$
行空间$\mathcal{R}(AB) \subseteq \mathcal{R}(B)$,由右矩阵 $B$ 控制$\le \operatorname{rank}(B)$

注意:$B$ 的对乘积不等式没有直接作用——真正起作用的是 $B$ 的(它们是 $AB$ 行向量的"原材料")。

③ 加法(三角不等式)

$|\operatorname{rank}(A)-\operatorname{rank}(B)| \le \operatorname{rank}(A+B) \le \operatorname{rank}(A)+\operatorname{rank}(B)$

右侧上界:$\mathcal{C}(A+B) \subseteq \mathcal{C}(A)+\mathcal{C}(B)$(子空间和),维度 $\le \dim\mathcal{C}(A)+\dim\mathcal{C}(B)$。

左侧下界:用上界两次:

$$\operatorname{rank}(A) = \operatorname{rank}((A+B)-B) \le \operatorname{rank}(A+B)+\operatorname{rank}(B)$$ $$\Rightarrow \operatorname{rank}(A+B) \ge \operatorname{rank}(A)-\operatorname{rank}(B)$$

对称地得另一侧,取绝对值合并。类比实数 $|a-b|\le|a+b|\le|a|+|b|$。

④ Sylvester 不等式(最核心!)

$\operatorname{rank}(A)+\operatorname{rank}(B) \le \operatorname{rank}(AB)+n$,$A\in\mathbb{R}^{m\times n},B\in\mathbb{R}^{n\times p}$

等价形式(做题时更常用):

$$\operatorname{rank}(AB) \ge \operatorname{rank}(A)+\operatorname{rank}(B)-n$$

推导(分块矩阵法):构造

$$M = \begin{pmatrix} AB & 0 \\ B & -I_n \end{pmatrix}$$

对列做变换(第一列加 $A$ 倍的第二列),rank 不变:

$$M \to \begin{pmatrix} 0 & A \\ B & -I_n \end{pmatrix}$$

右边矩阵:$-I_n$ 贡献满秩 $n$,$A$ 额外贡献 $\operatorname{rank}(A)$,故右边 rank $= n+\operatorname{rank}(A)$。左边 rank $\le \operatorname{rank}(AB)+n$(次加性),且 $\ge \operatorname{rank}(B)$(看右下角块)。联立得 $\operatorname{rank}(A)+\operatorname{rank}(B)\le\operatorname{rank}(AB)+n$。

直觉:$B$ 映射 $\mathbb{R}^p\to\mathbb{R}^n$ 损失 $n-\operatorname{rank}(B)$ 维;$A$ 再映射损失 $n-\operatorname{rank}(A)$ 维。两次损失共用同一个 $n$ 维中间空间,合并损失不超过 $n$,即 $(n-\operatorname{rank}(B))+(n-\operatorname{rank}(A))\le n$。

典型应用:$A^2=0 \Rightarrow 2\operatorname{rank}(A)\le 0+n \Rightarrow \operatorname{rank}(A)\le n/2$

⑤ 转置不变

$\operatorname{rank}(A)=\operatorname{rank}(A^T)=\operatorname{rank}(A^TA)=\operatorname{rank}(AA^T)$

关键证明($\operatorname{rank}(A)=\operatorname{rank}(A^TA)$):证明零空间相同。

若 $Ax=0$,则 $A^TAx=0$(显然)。若 $A^TAx=0$,则 $x^TA^TAx=0 \Rightarrow \|Ax\|^2=0 \Rightarrow Ax=0$。

$$\mathcal{N}(A) = \mathcal{N}(A^TA) \Rightarrow \text{nullity 相同} \Rightarrow \operatorname{rank}(A)=\operatorname{rank}(A^TA)$$

OLS 意义:$X^TX$ 和 $X$ 共享零空间,$X$ 有多重共线性时 $X^TX$ 不可逆。

⑥ Frobenius 不等式

$\operatorname{rank}(AB)+\operatorname{rank}(BC)\le\operatorname{rank}(B)+\operatorname{rank}(ABC)$

对 $\begin{pmatrix}AB&0\\B&BC\end{pmatrix}$ 做列变换后 rank 不变,次加性给出上界,分块对角结构给出下界,联立得结论。

与 Sylvester 的关系:取 $C=I$,得 Sylvester:$\operatorname{rank}(AB)+\operatorname{rank}(B)\le\operatorname{rank}(B)+\operatorname{rank}(AB) \cdot n$。Frobenius 是 Sylvester 的三矩阵推广。

02+

可对角化条件:完整版

核心充要条件
$$\boxed{\text{对每个特征值 } \lambda_i:\ \underbrace{\dim\mathcal{N}(A-\lambda_i I)}_{\text{几何重数}} = \underbrace{\text{特征多项式中 } \lambda_i \text{ 的重数}}_{\text{代数重数}}}$$

始终有:几何重数 $\le$ 代数重数。等号成立 $\Leftrightarrow$ 可对角化。

各充分条件(满足任一即可)

$n$ 个不同特征值(最强充分)

不同特征值的特征向量线性无关,直接凑够 $n$ 个。不是必要条件(有重特征值也可对角化)。

实对称矩阵 $A=A^T$

谱定理保证,且 $A=Q\Lambda Q^T$,$Q$ 正交,特征值全为实数,向量两两正交。

最小多项式无重根

可对角化 $\Leftrightarrow$ 最小多项式无重根 $\Leftrightarrow$ 所有 Jordan 块大小为 1。

$A^2=A$(幂等),$A^n=I$

幂等:特征值 $\in\{0,1\}$,几何=代数重数。$A^n=I$:特征值为 $n$ 次单位根(复数域上不同),均可对角化。

不可对角化的典型情况

几何重数 < 代数重数 → Jordan 块出现
$$A = \begin{pmatrix}0&1\\0&0\end{pmatrix}$$

$\lambda=0$ 代数重数 2,$\mathcal{N}(A)=\operatorname{span}\{e_1\}$,几何重数仅 1。不可对角化,需 Jordan 标准型。

速查表

矩阵类型结论原因
实对称 $A=A^T$✓ 一定可谱定理
$n$ 个不同特征值✓ 一定可不同特征向量线性无关
$A^2=A$(幂等)✓ 一定可特征值 $\in\{0,1\}$,几何=代数
$A^n=I$✓ $\mathbb{C}$ 上可最小多项式整除 $x^n-1$,无重根
幂零 $A^k=0$,$A\ne0$✗ 一定不可特征值全 0,几何重数 $< n$
一般方阵? 不确定需验证几何=代数重数
MEDIUM 有 0 特征值的矩阵可能可逆吗?
如果矩阵 $A$ 有特征值 $\lambda=0$,它可能可逆吗?
解答

不可能。$\lambda=0$ 是特征值 $\Rightarrow \exists v\ne0$ 使 $Av=0$,即零空间非平凡,$\operatorname{nullity}(A)>0$,$\operatorname{rank}(A)<n$。

同时 $\det(A)=\prod_i\lambda_i=0$(连乘中含 0 项),故 $A$ 不可逆。

这是绝对充要关系:$\lambda=0$ 是特征值 $\Leftrightarrow$ $A$ 不可逆 $\Leftrightarrow$ $\det(A)=0$ $\Leftrightarrow$ $\operatorname{rank}(A)<n$

HARD 特征多项式 $(\lambda-2)^3(\lambda-5)$,rank$(A-2I)=1$ vs $2$,哪种可对角化?
$4\times4$ 矩阵特征多项式为 $(\lambda-2)^3(\lambda-5)$。情况一:$\operatorname{rank}(A-2I)=1$;情况二:$\operatorname{rank}(A-2I)=2$。分别判断可否对角化。
解答

$\lambda=5$ 代数重数 1,几何重数自动为 1。关键看 $\lambda=2$(代数重数 3)。

几何重数 $=\dim\mathcal{N}(A-2I)=4-\operatorname{rank}(A-2I)$

  • 情况一:几何重数 $=4-1=3=$ 代数重数 $\Rightarrow$ 可对角化
  • 情况二:几何重数 $=4-2=2<3 \Rightarrow$ 不可对角化,需 Jordan 块
HARD · 上下文题 $A,B$ 均可对角化,rank 和为 5($4\times4$),$AB$ 是幂零矩阵吗?
$A,B$ 均为 $4\times4$ 且均可对角化,$\operatorname{rank}(A)+\operatorname{rank}(B)=5$。$AB$ 是幂零矩阵吗?
解答

第一步:$AB\ne0$

由 Sylvester:$\operatorname{rank}(AB)\ge\operatorname{rank}(A)+\operatorname{rank}(B)-n=5-4=1>0$,故 $AB$ 不是零矩阵。

第二步:$AB$ 不一定是幂零的

反例(不幂零):$A=\operatorname{diag}(1,1,0,0),\ B=\operatorname{diag}(1,1,1,0)$,$AB=\operatorname{diag}(1,1,0,0)$,含特征值 1,不幂零。

构造(幂零):$A=e_1e_1^T$(rank 1),$B$ 为置换矩阵且第一列是 $e_2$,则 $AB$ 是秩 1 的严格上三角,$(AB)^2=0$。

关键判断:若两者同时可对角化(存在共同的 $P$),则 $AB$ 也可对角化。非零可对角化矩阵特征值含非零项,不可能是幂零矩阵。故此情况下 $AB$ 一定不是幂零矩阵。

MEDIUM · 上下文题 $[1,2,3,\ldots]$,$[1,4,9,\ldots]$,$[1,8,27,\ldots]$ 构成的矩阵是 full rank 吗?
将三个无穷向量 $v_1=[1,2,3,\ldots]$,$v_2=[1,4,9,\ldots]=\{j^2\}$,$v_3=[1,8,27,\ldots]=\{j^3\}$ 的前 $m$ 个分量构成 $m\times3$ 矩阵,问该矩阵是否 full rank(rank=3)?
解答

多项式论证:设 $\alpha j+\beta j^2+\gamma j^3=0$ 对所有正整数 $j$ 成立,即多项式 $p(x)=x(\alpha+\beta x+\gamma x^2)=0$ 有无穷多个零点。次数 $\le3$ 的多项式若有无穷多零点则恒为零,故 $\alpha=\beta=\gamma=0$。三向量线性无关。

Vandermonde 验证($m=3$ 子矩阵):

$$M = \begin{pmatrix}1&2&3\\1&4&9\\1&8&27\end{pmatrix}$$

分解为 $M = V \cdot D$,其中 $D=\operatorname{diag}(1,2,3)$,$V$ 是 Vandermonde 矩阵(行为 $x^1,x^2,x^3$ 在 $x=1,2,3$):

$$\det(M)=\det(V)\cdot\det(D)=(2-1)(3-1)(3-2)\cdot6=1\cdot2\cdot1\cdot6=12\ne0$$

结论:Full rank,rank = 3。

07+

Jordan 标准型深度解析

为什么需要 Jordan 标准型?

动机

对角化失败时(几何重数 < 代数重数),矩阵无法写成 $PDP^{-1}$。但任何方阵在复数域上都相似于一个"几乎对角"的矩阵:

$$\text{对角化} \subset \text{Jordan 标准型} \supset \text{任意方阵}$$

Jordan 块

$k\times k$ Jordan 块定义
$$J_k(\lambda) = \begin{pmatrix}\lambda&1&&\\&\lambda&1&\\&&\ddots&1\\&&&\lambda\end{pmatrix}$$

对角是 $\lambda$,上对角线全是 1,其余为 0。$k=1$ 时退化为普通对角元(可对角化情形)。

关键计数关系(做题核心)

计算方式含义
Jordan 块总个数 $n-\operatorname{rank}(A-\lambda I)$ = 几何重数
最大块大小 $\lambda$ 在最小多项式中的幂次 最顽固的"缺陷"
大小 $\ge k$ 的块个数 $\operatorname{rank}(A-\lambda I)^{k-1}-\operatorname{rank}(A-\lambda I)^k$ 逐层分析
大小恰好为 $k$ 的块个数 $r_{k-1}-2r_k+r_{k+1}$,$r_j=\operatorname{rank}(A-\lambda I)^j$ 差分公式
所有块大小之和 = 代数重数 必须凑到代数重数
HARD 从 rank 序列确定 $6\times6$ 矩阵的 Jordan 结构
$6\times6$ 矩阵,$\lambda=3$ 是唯一特征值(代数重数 6),已知 $r_0=6,\ r_1=4,\ r_2=2,\ r_3=1,\ r_4=0$($r_k=\operatorname{rank}(A-3I)^k$)。确定 Jordan 标准型。
解答(差分公式)

大小恰为 $k$ 的块数 $n_k = r_{k-1}-2r_k+r_{k+1}$:

  • $n_1 = r_0-2r_1+r_2 = 6-8+2 = 0$ 个 $1\times1$ 块
  • $n_2 = r_1-2r_2+r_3 = 4-4+1 = 1$ 个 $2\times2$ 块
  • $n_3 = r_2-2r_3+r_4 = 2-2+0 = 0$ 个 $3\times3$ 块
  • $n_4 = r_3-2r_4+0 = 1-0+0 = 1$ 个 $4\times4$ 块

验证:$0\cdot1+1\cdot2+0\cdot3+1\cdot4=6$ ✓

$$J = \begin{pmatrix}3&1&&&&&\\&3&&&&& \\ &&3&1&&&\\&&&3&1&&\\&&&&3&1&\\&&&&&3\end{pmatrix} \quad (J_2(3) \oplus J_4(3))$$

广义特征向量(Jordan 链)

Jordan 链结构

一个 $k\times k$ Jordan 块对应一条链:

$$v_1 \xleftarrow{(A-\lambda I)} v_2 \xleftarrow{(A-\lambda I)} \cdots \xleftarrow{(A-\lambda I)} v_k$$

即 $(A-\lambda I)v_j = v_{j-1}$,$v_1$ 是真正的特征向量,$v_2,\ldots,v_k$ 是广义特征向量。

满足:$(A-\lambda I)^j v_k = v_{k-j}$,$(A-\lambda I)^k v_k = 0$。

MEDIUM 计算 $J_k(\lambda)^m$:Jordan 块的幂次公式
证明 Jordan 块 $J_k(\lambda)^m$ 的表达式,并说明其与幂零矩阵的联系。
解答

分解 $J_k(\lambda) = \lambda I + N$,其中 $N$ 是严格上三角幂零矩阵($N^k=0$)。

因 $\lambda I$ 和 $N$ 可交换,二项式定理:

$$J_k(\lambda)^m = (\lambda I+N)^m = \sum_{j=0}^{k-1}\binom{m}{j}\lambda^{m-j}N^j$$ $$= \begin{pmatrix}\lambda^m & \binom{m}{1}\lambda^{m-1} & \binom{m}{2}\lambda^{m-2} & \cdots \\ & \lambda^m & \binom{m}{1}\lambda^{m-1} & \cdots \\ & & \ddots & \vdots \\ & & & \lambda^m\end{pmatrix}$$

关键推论:

  • 若 $|\lambda|<1$:$J_k(\lambda)^m\to0$($m\to\infty$),系统稳定
  • 若 $\lambda=0$(幂零块):$J_k(0)^k=0$,验证幂零性
  • 若 $|\lambda|=1,\lambda\ne1$:振荡不收敛

与其他概念的关系总结

概念在 Jordan 形中的表现
可对角化所有 Jordan 块大小为 1,即 $J=D$(对角矩阵)
幂零矩阵所有特征值为 0,Jordan 块对角全 0,$J^k=0$
幂等矩阵特征值 $\in\{0,1\}$,Jordan 块全为 $1\times1$(可对角化)
最小多项式$m_A(\lambda)=\prod_i(\lambda-\lambda_i)^{s_i}$,$s_i$=最大 Jordan 块大小
特征多项式$p_A(\lambda)=\prod_i(\lambda-\lambda_i)^{m_i}$,$m_i$=代数重数=块大小之和
HARD · 上下文题 协方差矩阵的逆是协方差矩阵吗?Principal minor 是协方差则本身也是吗?
(1)若 $\Sigma$ 是可逆协方差矩阵,$\Sigma^{-1}$ 是协方差矩阵吗?(2)若 $3\times3$ 矩阵所有 $2\times2$ 主子式都是协方差矩阵,本身一定是协方差矩阵吗?
解答

(1)是的。协方差矩阵 = 对称半正定;可逆时为对称正定 (SPD)。

设 $\Sigma=Q\Lambda Q^T$(特征值 $\lambda_i>0$),则 $\Sigma^{-1}=Q\Lambda^{-1}Q^T$,特征值 $1/\lambda_i>0$。

  • 对称性:$(\Sigma^{-1})^T=(\Sigma^T)^{-1}=\Sigma^{-1}$ ✓
  • 正定性:特征值 $1/\lambda_i>0$ ✓

$\Sigma^{-1}$ 在统计上称精度矩阵(Precision Matrix),高斯图模型中的条件独立结构由它决定。

(2)不一定。反例:

$$A = \begin{pmatrix}1&0.9&0.9\\0.9&1&-0.9\\0.9&-0.9&1\end{pmatrix}$$

所有 $2\times2$ 主子式行列式 $=1-0.81=0.19>0$,均为合法协方差矩阵 ✓。但

$$\det(A) = 1\cdot(1-0.81) - 0.9\cdot(0.9+0.81) + 0.9\cdot(-0.81-0.9) < 0$$

$A$ 不是半正定,不是协方差矩阵。低维主子式 PSD 无法控制高维方向的曲率。

★+

新增高频题目

HARD · SIG原题 可逆协方差矩阵的逆还是协方差矩阵吗?
设 $\Sigma$ 是一个可逆的协方差矩阵(对称正定,SPD),$\Sigma^{-1}$ 也是协方差矩阵吗?
解答

是的。 验证 $\Sigma^{-1}$ 也是 SPD:

对称性: $(\Sigma^{-1})^T = (\Sigma^T)^{-1} = \Sigma^{-1}$ ✓

正定性: $\Sigma = Q\Lambda Q^T$(特征值 $\lambda_i > 0$),则

$$\Sigma^{-1} = Q\Lambda^{-1}Q^T,\quad \Lambda^{-1} = \operatorname{diag}(1/\lambda_1,\ldots,1/\lambda_n)$$

$1/\lambda_i > 0$,故 $\Sigma^{-1}$ 也是正定的。 ✓

$\Sigma^{-1}$ 在统计中称为精度矩阵(Precision Matrix),在高斯图模型中,其非零元素对应条件独立结构。

HARD · SIG原题 $3\times3$ 矩阵所有 principal minor 是协方差矩阵,本身是吗?
若一个 $3\times3$ 矩阵的所有主子矩阵(principle minors)都是协方差矩阵,它本身一定是协方差矩阵吗?
解答

不一定。 反例:

$$A = \begin{pmatrix}1&0.9&0.9\\0.9&1&-0.9\\0.9&-0.9&1\end{pmatrix}$$

所有 $1\times1$ 主子式 $= 1 > 0$ ✓,所有 $2\times2$ 主子式 $\det = 1-0.81 = 0.19 > 0$ ✓,每个子矩阵都是合法协方差矩阵。

但 $\det(A) = 1(0.19) - 0.9(0.9+0.81) + 0.9(-0.81-0.9) < 0$,$A$ 不是半正定,不是协方差矩阵

本质原因:PSD 要求所有主子式行列式 $\ge 0$,但低维子矩阵 PSD 不能控制高维方向的曲率——三个变量两两正相关时,第三对相关系数必须受到约束(如上一节三变量相关系数例题)。

HARD · SIG原题 $[1,2,3,\ldots]$,$[1,4,9,\ldots]$,$[1,8,27,\ldots]$ 三向量 full rank 吗?
三个无穷向量 $v_1 = (1,2,3,\ldots)$,$v_2 = (1,4,9,\ldots) = (1^2,2^2,3^2,\ldots)$,$v_3 = (1,8,27,\ldots) = (1^3,2^3,3^3,\ldots)$,它们线性无关(full rank)吗?
解答

是的,线性无关,full rank。

证明(多项式论证):设 $\alpha \cdot j + \beta \cdot j^2 + \gamma \cdot j^3 = 0$ 对所有 $j = 1,2,3,\ldots$ 成立。

即多项式 $p(x) = \alpha x + \beta x^2 + \gamma x^3 = x(\alpha + \beta x + \gamma x^2)$ 在无穷多个点 $x = 1,2,3,\ldots$ 取零值。

次数 $\le 3$ 的多项式若有无穷多零点,则恒为零,故 $\alpha = \beta = \gamma = 0$,线性无关。

验证(Vandermonde 行列式):取 $j=1,2,3$ 构成 $3\times3$ 子矩阵:

$$M = \begin{pmatrix}1&2&3\\1&4&9\\1&8&27\end{pmatrix}$$

分解:$M = \begin{pmatrix}1^1&2^1&3^1\\1^2&2^2&3^2\\1^3&2^3&3^3\end{pmatrix}$,这是 Vandermonde 矩阵的转置乘以 $\operatorname{diag}(1,2,3)$。

$$\det(M) = (2-1)(3-1)(3-2) \cdot 1\cdot2\cdot3 = 1\cdot2\cdot1\cdot6 = 12 \ne 0 \checkmark$$
HARD 不同特征值的特征向量线性无关(证明)
证明:$n$ 个不同特征值 $\lambda_1,\ldots,\lambda_n$ 对应的特征向量 $x_1,\ldots,x_n$ 线性无关。
解答(归纳法 + 消去法)

假设 $c_1x_1+\cdots+c_nx_n = 0$,且 $c_i$ 不全为零。两边左乘 $A$:

$$c_1\lambda_1 x_1 + \cdots + c_n\lambda_n x_n = 0 \quad \cdots (2)$$

$(2) - \lambda_n \times (1)$:$c_1(\lambda_1-\lambda_n)x_1 + \cdots + c_{n-1}(\lambda_{n-1}-\lambda_n)x_{n-1} = 0$

不断重复这个操作,最终得到 $c_1(\lambda_1-\lambda_2)\cdots(\lambda_1-\lambda_n)x_1 = 0$。

因为 $x_1 \ne 0$ 且所有 $\lambda_i$ 不同,所以 $c_1 = 0$。类似地推出所有 $c_i = 0$,矛盾。故线性无关。$\square$

MEDIUM 实对称矩阵特征值全为实数(证明)
证明实对称矩阵 $A = A^T$ 的所有特征值为实数。
解答

设 $\lambda$ 是复特征值,$x$ 是对应的复特征向量(可能是复数)。$\lambda^*$ 是 $\lambda$ 的共轭。

因 $A$ 是实矩阵,$A\bar{x} = \overline{Ax} = \overline{\lambda x} = \lambda^* \bar{x}$。

计算 $\bar{x}^T A x$:

$$\bar{x}^T A x = \bar{x}^T (\lambda x) = \lambda \bar{x}^T x = \lambda \|x\|^2$$ $$\bar{x}^T A x = (A\bar{x})^T x = (\lambda^* \bar{x})^T x = \lambda^* \bar{x}^T x = \lambda^* \|x\|^2$$

故 $(\lambda - \lambda^*)\|x\|^2 = 0$。因 $x \ne 0$,$\|x\|^2 > 0$,所以 $\lambda = \lambda^*$,即 $\lambda$ 为实数。$\square$

12

$\max\ x^TAx$ 与 Rayleigh 商

Step 0:为什么可以先假设 $A$ 对称?

对称 / 反对称分解

任意方阵 $A$ 都可以唯一分解为对称部分与反对称部分之和:

$$A = \underbrace{\frac{A+A^T}{2}}_{A_s\ (\text{对称})} + \underbrace{\frac{A-A^T}{2}}_{A_k\ (\text{反对称},\ A_k^T=-A_k)}$$

代入二次型:

$$x^TAx = x^TA_s x + x^TA_k x$$

关键:$x^TA_k x = 0$ 恒成立。

因此 $x^TAx = x^TA_s x$,优化问题完全等价于对称矩阵版本。

为什么 $x^TA_k x = 0$?

反对称矩阵的二次型恒为零

设 $S = A - A^T$(反对称,$S^T = -S$)。$x^TSx$ 是标量,故

$$x^TSx = (x^TSx)^T = x^TS^T x = x^T(-S)x = -x^TSx$$ $$\Rightarrow\quad 2\,x^TSx = 0 \quad\Rightarrow\quad x^TSx = 0$$

与 $x$ 无关,对所有向量恒成立。

一句话总结:$A$ 的反对称部分对二次型没有任何贡献,所以 $\max x^TAx$ 只取决于 $\frac{A+A^T}{2}$。面试时先写出这一步分解,立刻展示深度。

Step 1:无约束情况 → 问题无界

无约束时无意义

若 $A_s$ 有正特征值 $\lambda > 0$,取对应特征向量 $v$,令 $x = tv$:

$$x^TA_s x = t^2 v^TA_s v = t^2\lambda\|v\|^2 \xrightarrow{t\to\infty} +\infty$$

故必须加约束,最自然的是 $\|x\|_2 = 1$(单位球面)或等价的 Rayleigh 商形式。

Step 2:约束 $\|x\|=1$ → 答案是最大特征值

主定理
$$\max_{\|x\|=1}\ x^TAx = \lambda_{\max}(A_s) = \lambda_{\max}\!\left(\frac{A+A^T}{2}\right)$$

证明:谱定理给出 $A_s = Q\Lambda Q^T$,令 $y = Q^Tx$(正交换基,$\|y\|=\|x\|=1$):

$$x^TA_s x = y^T\Lambda y = \sum_i \lambda_i y_i^2$$

在 $\sum_i y_i^2 = 1$ 约束下,这是特征值的加权平均(权重 $y_i^2 \ge 0$,和为 1):

$$\sum_i \lambda_i y_i^2 \le \lambda_{\max}\sum_i y_i^2 = \lambda_{\max}$$

当 $y = e_k$($\lambda_{\max}$ 对应分量的标准基),即 $x = q_k$(最大特征值的特征向量)时等号成立。$\square$

Rayleigh 商(去掉 $\|x\|=1$ 的限制)

Rayleigh Quotient
$$R(x) = \frac{x^TAx}{x^Tx}, \quad x \ne 0$$ $$\max_{x\ne0} R(x) = \lambda_{\max}(A_s), \qquad \min_{x\ne0} R(x) = \lambda_{\min}(A_s)$$

将 $x = \|x\| \cdot \hat x$ 代入即化为 $\|x\|=1$ 情形,结论不变。Rayleigh 商是尺度不变的。

Courant–Fischer 定理(所有特征值的 min-max 刻画)

Courant–Fischer Min-Max Theorem

设 $A_s$ 的特征值 $\lambda_1 \ge \lambda_2 \ge \cdots \ge \lambda_n$,则

$$\lambda_k = \max_{\dim V = k}\ \min_{x \in V,\, \|x\|=1} x^TA_s x = \min_{\dim V = n-k+1}\ \max_{x \in V,\, \|x\|=1} x^TA_s x$$

等价的简洁形式:

$$\lambda_k = \max_{\substack{x \perp q_1,\ldots,q_{k-1}\\\|x\|=1}} x^TA_s x$$

在前 $k-1$ 个特征向量的正交补中找最大值,得第 $k$ 大特征值。PCA 逐步提取主成分正是这个过程。

极值总览
优化问题最优值最优 $x$
$\max_{\|x\|=1} x^TAx$ $\lambda_{\max}(A_s)$ $\lambda_{\max}$ 的特征向量 $q_1$
$\min_{\|x\|=1} x^TAx$ $\lambda_{\min}(A_s)$ $\lambda_{\min}$ 的特征向量 $q_n$
$\max_{\|x\|=1,\, x\perp q_1} x^TAx$ $\lambda_2$(第二大特征值) $q_2$(第二特征向量)
$\max_{x\ne0} \frac{x^TAx}{x^Tx}$ $\lambda_{\max}(A_s)$ 同上,尺度不变
$\max_{\|x\|=1} \|Ax\|^2 = \max x^TA^TAx$ $\sigma_{\max}^2$(最大奇异值平方) $A^TA$ 的最大特征向量(右奇异向量)

完整推导链

流程图
max xTAx
    │ A = A_s + A_k(对称 + 反对称分解)
    │ xTA_k x = 0(反对称二次型恒为零)
    ▼
max xTA_s x,A_s = (A+AT)/2
    │ 加约束 ‖x‖ = 1
    │ 谱定理:A_s = QΛQT,换基 y = QTx
    ▼
max Σ λᵢ yᵢ²,subject to Σ yᵢ² = 1
    │ 加权平均,权重非负和为 1
    ▼
最大值 = λ_max(A_s),在 x = 对应特征向量时取到

量化金融中的应用

Why This Matters in Quant Finance

协方差矩阵 $\Sigma$ 已经是对称正半定的,所以 $\Sigma_s = \Sigma$,Rayleigh 商直接给出:

  • 最大化组合方差的方向 = $\lambda_{\max}(\Sigma)$ 对应的特征向量 = 第一主成分
  • PCA 降维 = 逐步用 Courant–Fischer 提取各主成分方向
  • 风险最大的因子暴露 = $\lambda_{\max}$ 方向,风险预算时需重点控制
  • 条件数 $\kappa = \lambda_{\max}/\lambda_{\min}$ = Rayleigh 商最大值与最小值之比,决定矩阵病态程度
HARD $A$ 不对称时,$\max_{\|x\|=1} x^TAx$ 的解是什么?完整求解。
设 $A = \begin{pmatrix}2 & 3 \\ 1 & 2\end{pmatrix}$,求 $\max_{\|x\|=1} x^TAx$。
解答

Step 1:计算对称部分

$$A_s = \frac{A+A^T}{2} = \frac{1}{2}\begin{pmatrix}4&4\\4&4\end{pmatrix} = \begin{pmatrix}2&2\\2&2\end{pmatrix}$$

Step 2:求 $A_s$ 的特征值

$$\det(A_s - \lambda I) = (2-\lambda)^2 - 4 = \lambda^2 - 4\lambda = \lambda(\lambda-4) = 0$$

特征值:$\lambda_1 = 4,\ \lambda_2 = 0$。

Step 3:结论

$$\max_{\|x\|=1} x^TAx = \lambda_{\max}(A_s) = 4$$

最优 $x$:$\lambda_1=4$ 的特征向量,$(A_s - 4I)v = 0 \Rightarrow v = \frac{1}{\sqrt{2}}\begin{pmatrix}1\\1\end{pmatrix}$。

验证:$x^TAx = \frac{1}{2}(1,1)\begin{pmatrix}2&3\\1&2\end{pmatrix}\begin{pmatrix}1\\1\end{pmatrix} = \frac{1}{2}(1,1)\begin{pmatrix}5\\3\end{pmatrix} = \frac{8}{2} = 4$ ✓

MEDIUM 证明 Rayleigh 商的极值恰好是特征值,且无"间隙"
设 $A$ 是 $n\times n$ 对称矩阵,特征值 $\lambda_1\ge\cdots\ge\lambda_n$。证明 $\{R(x) : x\ne0\} = [\lambda_n, \lambda_1]$,即 Rayleigh 商能取到最小特征值和最大特征值之间的所有值。
解答

上下界:已由换基证明 $R(x)\in[\lambda_n,\lambda_1]$。

连续性:$R(x) = \frac{x^TAx}{x^Tx}$ 是 $\mathbb{R}^n\setminus\{0\}$ 上的连续函数,其定义域(去掉原点的连通集)在 $R$ 下的像是连通集,即区间。

端点可达:$R(q_1)=\lambda_1$,$R(q_n)=\lambda_n$。

由介值定理,$R$ 能取到 $[\lambda_n, \lambda_1]$ 中所有值。$\square$

推论:$A$ 正定 $\Leftrightarrow$ $\lambda_n>0$ $\Leftrightarrow$ $R(x)>0,\ \forall x\ne0$,即 $x^TAx>0$ 恒成立。

HARD · 综合题 $\max\|Ax\|^2$ subject to $\|x\|=1$:与 SVD 的关系
设 $A\in\mathbb{R}^{m\times n}$(一般矩形矩阵),求 $\max_{\|x\|=1}\|Ax\|^2$,并说明与 SVD 的关系。
解答

$\|Ax\|^2 = x^TA^TAx$,这是以 $A^TA$($n\times n$ 对称半正定矩阵)为参数的二次型。

$A^TA$ 的特征值 = $A$ 的奇异值的平方:$A^TA = V\Sigma^T\Sigma V^T$,故

$$\max_{\|x\|=1} x^TA^TAx = \lambda_{\max}(A^TA) = \sigma_{\max}^2(A)$$

最优 $x = v_1$(最大奇异值对应的右奇异向量),此时 $\|Av_1\| = \sigma_1$。

谱范数:$\|A\|_2 = \max_{\|x\|=1}\|Ax\| = \sigma_{\max}(A)$,这正是矩阵谱范数的定义。

几何意义:$A$ 把单位球映射成一个椭球,半轴长度是各奇异值 $\sigma_1\ge\cdots\ge\sigma_r>0$,方向是右奇异向量。$\sigma_1$ 是最长半轴,即 $A$ 最大拉伸方向。

Linear Algebra — Complete Interview Guide · Princeton MFin · 2025–2026
覆盖考点:Rank / Nullity / Eigenvalues / Diagonalization / Jordan Form / SVD / Idempotent / Nilpotent / PSD / OLS / Rayleigh Quotient / Courant–Fischer / Matrix Calculus / Monte Carlo / Rank Inequalities / Covariance