Linear Algebra
Complete Guide
面试线性代数完全手册,覆盖所有核心考点:秩、特征值、Jordan form、SVD、幂等/幂零矩阵、OLS、Rayleigh 商、Matrix Calculus。适用于所有量化/算法岗位面试。
秩与零空间 (Rank & Nullity)
核心定理
对 $A \in \mathbb{R}^{m \times n}$:
$$\operatorname{rank}(A) + \operatorname{nullity}(A) = n$$$\operatorname{null}(A) = \{x : Ax = 0\}$,维度即为 nullity。
$A \in \mathbb{R}^{m\times n},\ B \in \mathbb{R}^{n\times p}$
四个基本子空间
| 子空间 | 定义 | 维度 | 正交补 |
|---|---|---|---|
| 列空间 $\mathcal{C}(A)$ | $\{Ax : x \in \mathbb{R}^n\}$ | $\operatorname{rank}(A)$ | $\mathcal{N}(A^T)$ |
| 行空间 $\mathcal{C}(A^T)$ | $\{A^Ty : y \in \mathbb{R}^m\}$ | $\operatorname{rank}(A)$ | $\mathcal{N}(A)$ |
| 零空间 $\mathcal{N}(A)$ | $\{x : Ax = 0\}$ | $n - \operatorname{rank}(A)$ | $\mathcal{C}(A^T)$ |
| 左零空间 $\mathcal{N}(A^T)$ | $\{y : A^Ty = 0\}$ | $m - \operatorname{rank}(A)$ | $\mathcal{C}(A)$ |
矩阵可逆等价条件
以下条件互相等价:
- $\operatorname{rank}(A) = n$(满秩)
- $\det(A) \ne 0$
- 所有特征值 $\lambda_i \ne 0$
- $\operatorname{nullity}(A) = 0$(零空间仅含零向量)
- $Ax = 0$ 仅有零解
- $A$ 的列(行)向量线性无关
利用 Sylvester 不等式:$\operatorname{rank}(A) + \operatorname{rank}(A) \le \operatorname{rank}(A^2) + n = 0 + n = n$
故 $\operatorname{rank}(A) \le \lfloor n/2 \rfloor$。
验证可达到:取 $r = \lfloor n/2 \rfloor$,构造
$$A = \begin{pmatrix} 0 & I_r & 0 \\ 0 & 0 & 0 \\ 0 & 0 & 0 \end{pmatrix}$$其中 $I_r$ 是 $r\times r$ 单位矩阵,易验证 $A^2 = 0$ 且 $\operatorname{rank}(A) = r = \lfloor n/2 \rfloor$。
设 $\operatorname{rank}(A) = r$,对 $A \cdot A$ 用 Sylvester:$2r \le \operatorname{rank}(A^2) + n$,故 $\operatorname{rank}(A^2) \ge 2r - n$。
对 $A^2 \cdot A$ 用 Sylvester:$\operatorname{rank}(A^2) + r \le \operatorname{rank}(A^3) + n = n$,故 $\operatorname{rank}(A^2) \le n - r$。
联立:$2r - n \le n - r \Rightarrow 3r \le 2n \Rightarrow r \le \lfloor 2n/3 \rfloor$。
最大值为 $\lfloor 2n/3 \rfloor$,可用 Jordan 块构造验证。
核心结论:从 $N(0,1)$ 随机采样的矩阵几乎必然(almost surely)有 $n$ 个不同的实特征值,从而 $A$ 几乎必然可对角化,且特征值两两不同。
定理:若 $A$ 有 $n$ 个不同特征值,则与 $A$ 可交换的矩阵恰好是 $A$ 的多项式,即
$$\{B : AB = BA\} = \operatorname{span}\{I, A, A^2, \ldots, A^{n-1}\}$$这是因为:设 $A = PDP^{-1}$,$D$ 的对角元两两不同。$AB = BA \Rightarrow D(P^{-1}BP) = (P^{-1}BP)D$,对角矩阵只与对角矩阵可交换(对角元不同时),故 $P^{-1}BP$ 是对角矩阵,$B$ 被 $P$ 的列(特征向量)完全决定,只有 $n$ 个自由度。
维度 = $n$。基:$\{I, A, A^2, \ldots, A^{n-1}\}$(Cayley–Hamilton 保证 $A^n$ 线性相关)。
面试口诀:几乎必然可对角化 → 换到对角化基下 → 只有对角矩阵与之可交换 → $n$ 维自由度。可以直接说标量倍、零矩阵、单位阵、$A$ 本身、$A^{-1}$ 都满足,但这些线性相关,完整的基恰好有 $n$ 个。
设 $r = \operatorname{rank}(A) < n/2$:
- $\operatorname{nullity}(A) = n - r > n/2$,零空间维度超过一半。
- $A$ 不可逆($\det(A) = 0$)。
- $A^2$:由 Sylvester,$\operatorname{rank}(A^2) \ge 2r - n < 0$,故 $\operatorname{rank}(A^2)$ 可以为 0(即 $A^2$ 可以是零矩阵)。
- 至少有 $n - r > n/2$ 个特征值为 0。
- 行(列)空间与零空间"几乎不相交",但在 $r < n/2$ 时列空间维度严格小于零空间维度。
秩不等式:推导与记忆
核心思路:每条不等式都有一个几何直觉。记住直觉,推导自然出来。下面逐一拆解。
① 上界:$\operatorname{rank}(A) \le \min\{m,n\}$
rank = 列空间维度,列空间 $\subseteq \mathbb{R}^m$,故 $\le m$;同时 rank = 行空间维度,行空间 $\subseteq \mathbb{R}^n$,故 $\le n$。两个约束同时成立取小的。
记忆:桶有多小,水就装多少。
② 乘积:$\operatorname{rank}(AB) \le \min\{\operatorname{rank}(A), \operatorname{rank}(B)\}$
$AB$ 的第 $j$ 列 $= A \cdot b_j$,是 $A$ 的列的线性组合。
$\therefore \mathcal{C}(AB) \subseteq \mathcal{C}(A)$,维度只能更小。
这个方向与 $B$ 的结构无关,$B$ 只是在给 $A$ 的列"提供系数"。
$AB$ 的第 $i$ 行 $= a_i^T \cdot B$,是 $B$ 的行的线性组合。
$\therefore \mathcal{R}(AB) \subseteq \mathcal{R}(B)$,维度只能更小。
这个方向与 $A$ 的结构无关,$A$ 只是在给 $B$ 的行"提供系数"。
记忆:列空间由左矩阵控制,行空间由右矩阵控制。信息经过最窄的门。
③ 加法:$|\operatorname{rank}(A)-\operatorname{rank}(B)| \le \operatorname{rank}(A+B) \le \operatorname{rank}(A)+\operatorname{rank}(B)$
右侧上界:$(A+B)$ 的列空间 $\subseteq \mathcal{C}(A) + \mathcal{C}(B)$(子空间和),
$$\dim(\mathcal{C}(A)+\mathcal{C}(B)) \le \dim\mathcal{C}(A)+\dim\mathcal{C}(B)$$左侧下界:用上界反向推:
$$\operatorname{rank}(A) = \operatorname{rank}((A+B)-B) \le \operatorname{rank}(A+B)+\operatorname{rank}(B)$$ $$\Rightarrow \operatorname{rank}(A+B) \ge \operatorname{rank}(A)-\operatorname{rank}(B)$$对称地得到另一侧,合并取绝对值。
记忆:类比实数三角不等式 $|a-b| \le |a+b| \le |a|+|b|$,rank 满足同样结构。
④ Sylvester 不等式:$\operatorname{rank}(A)+\operatorname{rank}(B) \le \operatorname{rank}(AB)+n$
证明(分块矩阵法):构造
$$M = \begin{pmatrix} AB & 0 \\ B & -I_n \end{pmatrix}$$对 $M$ 做列变换(第一列组加上 $A$ 倍的第二列组),rank 不变:
$$M \to \begin{pmatrix} 0 & A \\ B & -I_n \end{pmatrix}$$右边矩阵:$-I_n$ 满秩贡献 $n$,再加上 $A$ 和 $B$ 带来的信息,rank $= n + \operatorname{rank}(A)$(因为 $-I_n$ 列和 $A$ 列线性无关)。
同时次加性给出:$\operatorname{rank}(M) \le \operatorname{rank}(AB) + \operatorname{rank}(-I_n) = \operatorname{rank}(AB)+n$。
又 $\operatorname{rank}(M) \ge \operatorname{rank}(B)$(分块下三角),联立得
$$\operatorname{rank}(A)+\operatorname{rank}(B) \le \operatorname{rank}(AB)+n$$$B$ 把 $\mathbb{R}^p$ 映到 $\mathbb{R}^n$,损失 $n-\operatorname{rank}(B)$ 维;$A$ 再映,损失 $n-\operatorname{rank}(A)$ 维。两次损失都发生在 $n$ 维中间空间,总损失 $\le n$:
$$\operatorname{rank}(AB) \ge \operatorname{rank}(A)+\operatorname{rank}(B)-n$$做题常用形式:$\operatorname{rank}(AB) \ge \operatorname{rank}(A)+\operatorname{rank}(B)-n$,记为"扣掉中间维度 $n$ 的下界"。
典型应用:$A^2=0 \Rightarrow 2\operatorname{rank}(A) \le n \Rightarrow \operatorname{rank}(A) \le \lfloor n/2\rfloor$
⑤ 转置不变:$\operatorname{rank}(A)=\operatorname{rank}(A^T)=\operatorname{rank}(A^TA)=\operatorname{rank}(AA^T)$
证明 $\mathcal{N}(A) = \mathcal{N}(A^TA)$:
- $Ax=0 \Rightarrow A^TAx=0$(显然)
- $A^TAx=0 \Rightarrow x^TA^TAx=0 \Rightarrow \|Ax\|^2=0 \Rightarrow Ax=0$
零空间相同 $\Rightarrow$ 由 rank-nullity,rank 相同。
应用:OLS 中 $X^TX$ 和 $X$ 共享零空间,$X$ 有共线性 $\Leftrightarrow$ $X^TX$ 不可逆。
⑥ Frobenius 不等式:$\operatorname{rank}(AB)+\operatorname{rank}(BC) \le \operatorname{rank}(B)+\operatorname{rank}(ABC)$
Sylvester 是 $C=I$(或 $A=I$)时的特例:令 $C=I$,左侧 $= \operatorname{rank}(AB)+\operatorname{rank}(B)$,右侧 $= \operatorname{rank}(B)+\operatorname{rank}(AB)$——退化为平凡等式,故 Frobenius 是更强的结论。
记忆:Sylvester(两矩阵,中间维度 $n$)→ Frobenius(三矩阵,中间矩阵 $B$ 的 rank)。
| 不等式 | 直觉关键词 | 做题用途 |
|---|---|---|
| 上界 $\le \min\{m,n\}$ | 最小维度约束 | 基础估计 |
| 乘积 $\le \min\{r_A,r_B\}$ | 最窄的门 | 判断 rank 上界 |
| 加法三角 | 类比实数绝对值 | 秩之间的夹逼 |
| Sylvester $\ge r_A+r_B-n$ | 两次损失共享 $n$ 维 | 幂次/幂零题核心 |
| 转置不变 | 零空间相同 | OLS / 共线性分析 |
| Frobenius | Sylvester 三矩阵版 | 连乘 rank 估计 |
特征值与对角化
基本性质
对角化条件
代数重数 = 几何重数(对所有特征值成立)。
等价:存在 $n$ 个线性无关的特征向量,使得 $A = PDP^{-1}$,其中 $D = \operatorname{diag}(\lambda_1, \ldots, \lambda_n)$。
实对称矩阵 $A = A^T$ 一定可对角化,且:
- 所有特征值为实数
- 不同特征值对应的特征向量两两正交
- $A = Q\Lambda Q^T$,$Q$ 为正交矩阵(谱定理)
协方差矩阵 $\rho$ 的范围(经典题)
设 $n \times n$ 等相关矩阵
$$A = (1-\rho)I + \rho M, \quad M_{ij} = 1 \ \forall i,j$$$M$ 的特征值:$\lambda = n$(重数 1,特征向量 $\mathbf{1}/\sqrt{n}$)和 $\lambda = 0$(重数 $n-1$)。
故 $A$ 的特征值为 $1 + (n-1)\rho$(重数 1)和 $1 - \rho$(重数 $n-1$)。
半正定要求特征值 $\ge 0$:
$$\boxed{-\frac{1}{n-1} \le \rho \le 1}$$设 $Av = \lambda v$,则 $A^2 v = A(\lambda v) = \lambda^2 v$。又 $A^2 = A$,故 $\lambda^2 v = \lambda v$,即 $\lambda(\lambda-1) = 0$。
特征值只能是 $0$ 或 $1$。
对 $\lambda = 0$:几何重数 = $\dim \mathcal{N}(A) = n - \operatorname{rank}(A)$。
对 $\lambda = 1$:几何重数 = $\dim \mathcal{N}(A - I) = n - \operatorname{rank}(A - I)$。
利用 Sylvester:$\operatorname{rank}(A) + \operatorname{rank}(A - I) \le \operatorname{rank}(A^2 - A) + n = n$,故两者几何重数之和 $\ge n$,等于 $n$,从而 $A$ 可对角化。
$$A \sim \begin{pmatrix} I_r & 0 \\ 0 & 0 \end{pmatrix}, \quad r = \operatorname{rank}(A)$$$Av = \lambda v \Rightarrow \lambda^n v = I \cdot v = v \Rightarrow \lambda^n = 1$。
$\lambda^n - 1 = 0$ 在 $\mathbb{C}$ 上有 $n$ 个不同的根($n$ 次单位根):$e^{2\pi i k/n},\ k = 0, 1, \ldots, n-1$。
特征多项式整除 $x^n - 1$,而 $x^n - 1$ 在 $\mathbb{C}$ 上无重根,故 $A$ 的最小多项式无重根,$A$ 在 $\mathbb{C}$ 上一定可对角化。
可对角化条件——完整梳理
$A \in \mathbb{R}^{n\times n}$ 可对角化 $\Leftrightarrow$ 存在可逆矩阵 $P$ 使得 $A = PDP^{-1}$,$D = \operatorname{diag}(\lambda_1,\ldots,\lambda_n)$。
等价:$A$ 有 $n$ 个线性无关的特征向量。
充要条件
$\lambda_i$ 作为特征多项式 $\det(A-\lambda I)$ 的根的重数。
$\dim\mathcal{N}(A-\lambda_i I) = n - \operatorname{rank}(A-\lambda_i I)$,特征空间维数。
始终有:几何重数 $\le$ 代数重数。可对角化要求等号对所有特征值成立。
充分条件(满足任一即可)
- $n$ 个不同特征值:不同特征值对应的特征向量线性无关,直接凑够 $n$ 个。最强但不必要。
- 实对称矩阵 $A=A^T$:谱定理保证 $A=Q\Lambda Q^T$,$Q$ 正交,特征值全实,特征向量两两正交。
- 最小多项式无重根:最小多项式 $m_A(\lambda)$ 无重根 $\Leftrightarrow$ 可对角化(与充要条件等价的另一种表述)。
各类矩阵速查表
| 矩阵类型 | 结论 | 原因 |
|---|---|---|
| 实对称 $A=A^T$ | ✅ 一定可 | 谱定理 |
| $n$ 个不同特征值 | ✅ 一定可 | 不同特征值对应向量线性无关 |
| $A^2=A$(幂等) | ✅ 一定可 | 特征值只有 0/1,几何=代数重数 |
| $A^n=I$ | ✅ 复数域可 | 最小多项式整除 $x^n-1$,无重根 |
| $A^k=0,\ A\ne 0$(幂零) | ❌ 一定不可 | 特征值全 0,几何重数 $< n$ |
| $A^n=0$ 且 $A\ne 0$ | ❌ 不可 | 同上 |
| 一般方阵 | 需验证 | 检验代数=几何重数 |
不可对角化的典型例子
特征值 $\lambda=0$,代数重数 2,但 $\mathcal{N}(A) = \operatorname{span}\{e_1\}$,几何重数只有 1。$2 > 1$,不可对角化。需要 Jordan 标准型。
$\lambda=5$ 代数重数 1,几何重数自动为 1,无问题。关键看 $\lambda=2$(代数重数 3)。
几何重数 $= 4 - \operatorname{rank}(A-2I)$。
- 情况 1:几何重数 $= 4-1=3$,等于代数重数 3,✅ 可对角化。
- 情况 2:几何重数 $= 4-2=2 < 3$,❌ 不可对角化,需要 Jordan 块。
情况 2 的 Jordan 形($\lambda=2$ 部分):几何重数 2 说明有 2 个 Jordan 块,代数重数 3 说明大小之和为 3,故一个块大小为 2,一个为 1:
$$J = \begin{pmatrix}2&1&0&0\\0&2&0&0\\0&0&2&0\\0&0&0&5\end{pmatrix}$$绝对不能。 $\lambda=0$ 是特征值意味着 $\exists v \ne 0$ 使得 $Av = 0v = 0$,即零空间非平凡:
$$\mathcal{N}(A) \ne \{0\} \Rightarrow \operatorname{nullity}(A) \ge 1 \Rightarrow \operatorname{rank}(A) < n$$同时 $\det(A) = \prod_i \lambda_i$,含因子 0,故 $\det(A) = 0$,不可逆。
这是一个充要条件:$A$ 不可逆 $\Leftrightarrow$ $\lambda=0$ 是特征值 $\Leftrightarrow$ $\det(A)=0$。
矩阵分解
| 分解 | 形式 | 条件 | 主要应用 |
|---|---|---|---|
| LU | $PA = LU$ | 任意方阵(行交换后) | 解方程,行列式,矩阵求逆 |
| QR | $A = QR$ | 任意矩阵 | 最小二乘,特征值 QR 算法,数值稳定 |
| Cholesky | $A = LL^T$ | 对称正定 (SPD) | 协方差采样,Monte Carlo,快速求解 |
| 特征分解 | $A = PDP^{-1}$ | 可对角化;对称则 $A = Q\Lambda Q^T$ | 谱分析,PCA,微分方程 |
| SVD | $A = U\Sigma V^T$ | 任意矩阵 $m \times n$ | PCA,低秩近似,伪逆,多重共线性 |
SVD 深度解析
- $U \in \mathbb{R}^{m\times m}$:正交矩阵,列为 $AA^T$ 的特征向量(左奇异向量),张成 列空间
- $V \in \mathbb{R}^{n\times n}$:正交矩阵,列为 $A^TA$ 的特征向量(右奇异向量),张成 行空间
- $\Sigma$:对角矩阵,$\sigma_i = \sqrt{\lambda_i(A^TA)} \ge 0$(奇异值)
- $\operatorname{rank}(A)$ = 非零奇异值个数
- 最优低秩近似:$A_k = U_k \Sigma_k V_k^T$(Eckart–Young 定理)
$A = QR$,$Q = [u_1 \cdots u_n]$,$R = Q^T A$(上三角矩阵)。
解方程:$Ax = b \Rightarrow QRx = b \Rightarrow Rx = Q^Tb$(回代求解)。
LU vs QR 面试答法:LU 偏纯代数操作(解方程系统、行列式),QR 偏数值稳定性(最小二乘、迭代特征值算法)。QR 避免了 $A^TA$ 条件数平方的问题,更鲁棒。
幂等矩阵 Idempotent ($A^2 = A$)
- 特征值只能是 $0$ 或 $1$
- 一定可对角化(同上面例题证明)
- $\operatorname{rank}(A) = \operatorname{tr}(A)$(迹 = 秩!)
- $A$ 和 $I - A$ 都是幂等矩阵(互补投影)
- $\operatorname{rank}(A) + \operatorname{rank}(I - A) = n$
- 若还对称 $A = A^T$:$A$ 是正交投影矩阵
投影矩阵(OLS核心)
$P^2 = P$(幂等),$P^T = P$(对称),投影到 $\mathcal{C}(A)$。
$$\operatorname{rank}(P) = \operatorname{tr}(P) = \operatorname{rank}(A)$$Step 1:取转置:$(MM^T)^T = M^T \Rightarrow M(M^T)^T = (MM^T)^T = M^T$,即 $MM = M^T$,即 $M^2 = M^T$。
Step 2:再利用 $MM^T = M$,对 $M^2 = M^T$ 取转置:$(M^2)^T = M$,即 $(M^T)^2 = M$。
Step 3:$\operatorname{rank}(M) = \operatorname{rank}(MM^T) \le \operatorname{rank}(M^T) = \operatorname{rank}(M)$,等号成立。
Step 4:$M^3 = M \cdot M^2 = M \cdot M^T = MM^T = M$,所以 $M^3 = M$,即 $M(M^2 - I) = 0$。这意味着 $M$ 的特征值满足 $\lambda^3 = \lambda$,即 $\lambda \in \{0, 1, -1\}$。
结论:$\operatorname{rank}(M) = \operatorname{rank}(M^T)$(显然),特征值 $\in \{0, 1, -1\}$,$M$ 在 $\mathbb{R}$ 上可对角化。
幂零矩阵 Nilpotent ($\exists k: A^k = 0$)
- 所有特征值均为 $0$($\det(A) = 0$,$\operatorname{tr}(A) = 0$)
- 若 $A \ne 0$,则 $A$ 不可对角化(几何重数 $< n$)
- 可分解为若干 Jordan 块(对角元全为 0)
- $\operatorname{rank}(A) = n - \text{\#Jordan blocks}$
- $\operatorname{tr}(A^j) = 0$,$\forall j \ge 1$
- $\operatorname{rank}(A^m) \le \operatorname{rank}(A^{m-1})$(单调不增)
- 若 $A \ne 0$,则 $A$ 不可逆
若 $A$ 幂零,$B = I - A$ 是可逆的(因为 $B^{-1} = I + A + A^2 + \cdots + A^{k-1}$,有限项)。
若 $A$ 幂等,$A$ 和 $I - A$ 都幂等,秩互补。
正定 / 半正定矩阵
| 条件 | 正定 (PD) | 半正定 (PSD) |
|---|---|---|
| 二次型 | $x^TAx > 0,\ \forall x \ne 0$ | $x^TAx \ge 0,\ \forall x$ |
| 特征值 | 所有 $\lambda_i > 0$ | 所有 $\lambda_i \ge 0$ |
| Sylvester 判别 | 所有顺序主子式 $> 0$ | 所有主子式 $\ge 0$ |
| 分解 | $A = LL^T$(Cholesky) | $A = BB^T$(某个 $B$) |
对任意 $x$:$x^T \Sigma x = x^T \mathbb{E}[(Z-\mu)(Z-\mu)^T] x = \mathbb{E}[\|x^T(Z-\mu)\|^2] \ge 0$
若数据无完全共线性,则协方差矩阵是正定的($X^TX$ 可逆)。
相关矩阵
$$\text{Corr} = \begin{pmatrix} 1 & 0.9 & x \\ 0.9 & 1 & 0.9 \\ x & 0.9 & 1 \end{pmatrix}$$半正定要求所有主子式 $\ge 0$。行列式展开:
$$\det = 1 - 0.81 - 0.9(0.9 - 0.9x) + x(0.81 - x) = -x^2 + 1.62x - 0.62 \ge 0$$ $$-(x-1)(x-0.62) \ge 0 \Rightarrow x \in [0.62, 1]$$故 $\rho_{xz} \in [0.62, 1]$。
Jordan 标准型
每个方阵 $A$ 在复数域上相似于 Jordan 标准形:
$$A \sim J = \begin{pmatrix} J_1 & & \\ & J_2 & \\ & & \ddots \end{pmatrix}, \quad J_k = \begin{pmatrix} \lambda_k & 1 & & \\ & \lambda_k & 1 & \\ & & \ddots & 1 \\ & & & \lambda_k \end{pmatrix}$$- 特征值 $\lambda_i$ 对应的 Jordan 块总数 = $\dim \mathcal{N}(A - \lambda_i I)$(几何重数)
- 最大 Jordan 块大小 = $\lambda_i$ 在最小多项式中的幂次
- 代数重数 = $\lambda_i$ 对应所有 Jordan 块大小之和
- 可对角化 $\Leftrightarrow$ 所有 Jordan 块大小为 1 $\Leftrightarrow$ 最小多项式无重根
- 幂零矩阵:$\lambda = 0$,Jordan 块形如 $J_k(0)$
SIG 常问:给定 $\operatorname{rank}$ 和特征多项式,确定 Jordan 标准形的结构。关键:$\operatorname{rank}(A - \lambda I)$ 决定几何重数(Jordan 块数量),$\operatorname{rank}(A - \lambda I)^k$ 的变化决定块的大小分布。
Jordan 标准型——深度解析
为什么需要 Jordan 标准型?
对角化失败时(几何重数 < 代数重数),矩阵无法写成 $PDP^{-1}$。但任何方阵在 $\mathbb{C}$ 上都相似于"几乎对角"的 Jordan 标准型。
$$\text{对角阵} \subset \text{Jordan 标准型} \subset \text{任意方阵(相似意义下)}$$Jordan 块
- $k=1$:退化为标量 $(\lambda)$,即普通对角元
- $k=2$:$\begin{pmatrix}\lambda&1\\0&\lambda\end{pmatrix}$,最简单的不可对角化情形
- $(J_k(\lambda) - \lambda I)^k = 0$,即每个 Jordan 块减去对角后是幂零矩阵
从 rank 序列精确确定 Jordan 结构
定义 $r_j = \operatorname{rank}(A-\lambda I)^j$,$r_0 = n$。
大小恰好为 $k$ 的 Jordan 块个数:
$$n_k = (r_{k-1} - r_k) - (r_k - r_{k+1}) = r_{k-1} - 2r_k + r_{k+1}$$直觉:$r_{k-1}-r_k$ 是"第 $k$ 层新增的维度",二阶差分提取恰好大小为 $k$ 的块。
已知 $r_0=6,\ r_1=4,\ r_2=2,\ r_3=1,\ r_4=0$,求 Jordan 结构。
| 大小 $k$ | $n_k = r_{k-1}-2r_k+r_{k+1}$ | 结果 |
|---|---|---|
| $k=1$ | $6-2(4)+2=0$ | 0 个 $1\times1$ 块 |
| $k=2$ | $4-2(2)+1=1$ | 1 个 $2\times2$ 块 |
| $k=3$ | $2-2(1)+0=0$ | 0 个 $3\times3$ 块 |
| $k=4$ | $1-2(0)+0=1$ | 1 个 $4\times4$ 块 |
验证:$0\cdot1+1\cdot2+0\cdot3+1\cdot4=6$ ✓
$$J = \begin{pmatrix}3&1&&&&&\\&3&&&&& \\&&3&1&&&\\&&&3&1&&\\&&&&3&1&\\&&&&&3&1\\&&&&&&3\end{pmatrix}$$广义特征向量与 Jordan 链
对一个 $k\times k$ Jordan 块,对应一条广义特征向量链:
$$v_1 \xleftarrow{(A-\lambda I)} v_2 \xleftarrow{(A-\lambda I)} \cdots \xleftarrow{(A-\lambda I)} v_k$$即 $(A-\lambda I)v_j = v_{j-1}$。$v_1$ 是真正的特征向量($(A-\lambda I)v_1=0$),$v_2,\ldots,v_k$ 是广义特征向量。$P = [v_1,\ldots,v_k]$ 使得 $P^{-1}AP = J_k(\lambda)$。
Jordan 块的幂次公式
本质:$J_k(\lambda) = \lambda I + N$($N$ 是严格上三角幂零矩阵),二项式定理展开:
$$(\lambda I + N)^m = \sum_{j=0}^{k-1}\binom{m}{j}\lambda^{m-j}N^j$$推论:$|\lambda|<1 \Rightarrow J_k(\lambda)^m \to 0$;$\lambda=0$(幂零块)$\Rightarrow J_k(0)^k=0$。
与最小多项式的精确对应
$s_i$ = 特征值 $\lambda_i$ 对应的最大 Jordan 块的大小(不是代数重数!)。
因此:可对角化 $\Leftrightarrow$ $m_A$ 无重根 $\Leftrightarrow$ 所有 $s_i=1$。
面试快速判断总结
| 量 | 计算 | 含义 |
|---|---|---|
| Jordan 块总个数($\lambda_i$) | $n-\operatorname{rank}(A-\lambda_i I)$ | = 几何重数 |
| 最大块大小 | 最小的 $k$ 使 $(A-\lambda_i I)^k$ 降 rank 停止 | = 最小多项式中的幂次 |
| 大小恰为 $k$ 的块数 | $r_{k-1}-2r_k+r_{k+1}$ | 二阶差分 |
| 所有块大小之和 | = 代数重数 | 必须凑到这个数 |
Step 1:$AB \ne 0$。 由 Sylvester:
$$\operatorname{rank}(AB) \ge \operatorname{rank}(A)+\operatorname{rank}(B)-n = 5-4 = 1$$反例($AB$ 不是幂零):
$$A = \operatorname{diag}(1,1,0,0),\quad B = \operatorname{diag}(1,1,1,0)$$两者均可对角化,rank 和 $= 2+3=5$,$AB = \operatorname{diag}(1,1,0,0)$,特征值含 1,不是幂零。
构造($AB$ 是幂零):取 $A=e_1e_2^T$(rank 1),$B$ 使 $ABe_1 = 0$,则 $(AB)^2=0$。
关键观察:若 $A, B$ 同时可对角化(存在同一个 $P$),则 $AB$ 也可对角化。非零的可对角化矩阵特征值不全为零,故不是幂零矩阵。但题目没说同时可对角化,所以答案是不一定。
不等式与常用技巧
等号成立 $\Leftrightarrow$ $x = cy$
$\kappa(A^TA) = \kappa(A)^2$,正则化相当于人为增大 $\sigma_{\min}$
$\operatorname{rank}(X^TX) = \operatorname{rank}(X)$(因为 $X^TX$ 和 $X$ 有相同的零空间)。
若 $X$ 的列线性相关,$\operatorname{rank}(X) < n$($n$ 是特征数),故 $X^TX$ 降秩不可逆。
SVD 视角:$X = U\Sigma V^T$,$X^TX = V\Sigma^2 V^T$,某些奇异值 $\sigma_i = 0$,对应 $X^TX$ 有零特征值。
Ridge 修复:$(X^TX + \lambda I)^{-1}$ 永远可逆,因为 $(X^TX + \lambda I)$ 的特征值为 $\sigma_i^2 + \lambda > 0$。
OLS 与投影几何
正规方程:$X^TX\hat\beta = X^Ty$
$$\hat\beta = (X^TX)^{-1}X^Ty, \quad \hat y = X\hat\beta = Py$$$P = X(X^TX)^{-1}X^T$:投影矩阵,$P^2 = P$,$P^T = P$。
残差:$e = y - \hat y = (I - P)y$,且 $X^Te = 0$(残差与列空间正交)。
$X = QR$,则 $X^TX = R^TQ^TQR = R^TR$,正规方程化为
$$R\hat\beta = Q^Ty$$上三角方程组,直接回代,避免 $X^TX$ 条件数平方问题。
矩阵求导 (Matrix Calculus)
| 函数 $f$ | $\partial f / \partial x$ | 类型 |
|---|---|---|
| $f = a^T x$ | $a$ | 标量对向量 |
| $f = x^T x$ | $2x$ | 标量对向量 |
| $f = x^T A x$ | $(A + A^T)x$(若 $A$ 对称则为 $2Ax$) | 标量对向量 |
| $y = Ax$ | $\partial y / \partial x = A$ | 向量对向量 |
| $f = a^T X b$ | $\partial f / \partial X = ab^T$ | 标量对矩阵 |
| $f = \operatorname{tr}(AX)$ | $\partial f / \partial X = A^T$ | 标量对矩阵 |
| $f = \operatorname{tr}(AXB)$ | $\partial f / \partial X = A^TB^T$ | 标量对矩阵 |
| $f = \log\det(X)$ | $\partial f / \partial X = (X^{-1})^T$ | 标量对矩阵 |
展开目标函数:
$$f(\beta) = (X\beta - y)^T(X\beta - y) = \beta^TX^TX\beta - 2y^TX\beta + y^Ty$$对 $\beta$ 求导(利用 $\partial(\beta^T A\beta)/\partial\beta = 2A\beta$ for symmetric $A$):
$$\frac{\partial f}{\partial \beta} = 2X^TX\beta - 2X^Ty = 0$$ $$\Rightarrow \hat\beta = (X^TX)^{-1}X^Ty$$Monte Carlo — 相关资产模拟
| 方法 | 步骤 | 条件 | 效率 |
|---|---|---|---|
| Cholesky | $\Sigma = LL^T$,令 $X = LZ$ | 正定 | 最快 $O(n^3/3)$ |
| 特征分解 | $\Sigma = Q\Lambda Q^T$,令 $X = Q\Lambda^{1/2}Z$ | 半正定 | 中等,可截断负特征值 |
| SVD | $\Sigma = U\Sigma V^T$,令 $X = U\Sigma^{1/2}Z$ | 任意 | 最通用但最慢 |
| 因子模型 | $\Sigma \approx BB^T + D$,$X = Bf + \epsilon$ | 高维近似 | 高维首选 |
面试标准答法(Cholesky):给定协方差矩阵 $\Sigma$,做 Cholesky 分解 $\Sigma = LL^T$,令 $X = LZ,\ Z \sim N(0, I)$。验证:$\operatorname{Cov}(X) = L \operatorname{Cov}(Z) L^T = LIL^T = \Sigma$。若 $\Sigma$ 不正定(如数值误差),加 $\varepsilon I$ 扰动或用特征分解截断非正特征值。
高频面试例题库
$\operatorname{rank}(A) = 1$(除非 $u \perp v$),故特征值 $\lambda = 0$ 代数重数为 $n-1$,还有 $1$ 个非零特征值。
$A^2 = (uv^T)(uv^T) = u(v^Tu)v^T = (v^Tu)A$,所以 $A^2 = \alpha A$,其中 $\alpha = v^Tu$。
非零特征值:取 $x = u$,$Ax = uv^Tu = \alpha u$,故 $\lambda_1 = \alpha = v^Tu$(即 $u$ 是特征向量)。
故特征值:$\lambda_1 = v^Tu$(重数 1),$\lambda_2 = 0$(重数 $n-1$)。
幂次:$A^k = \alpha^{k-1} A = (v^Tu)^{k-1} uv^T$($k \ge 1$)。
设列秩为 $r$,取列空间的一组基 $c_1, \ldots, c_r$,令 $C = [c_1 \cdots c_r]$($m \times r$ 矩阵)。
则 $A$ 的每一列都是 $c_i$ 的线性组合:$A = CR$($R$ 是 $r \times n$ 矩阵)。
则 $A$ 的每一行是 $R$ 的行的线性组合,故行空间 $\subseteq$ Row$(R)$,行秩 $\le r$(列秩)。
同理对 $A^T$ 用以上论证:行秩 $\ge$ 列秩。故行秩 = 列秩。
分块 LU 分解:
$$M = \begin{pmatrix} I & 0 \\ CA^{-1} & I \end{pmatrix} \begin{pmatrix} A & B \\ 0 & S \end{pmatrix}$$第一个矩阵行列式为 1,第二个为 $\det(A)\det(S)$,故 $\det(M) = \det(A)\det(S)$。
OLS 联系:在贝叶斯线性回归或条件高斯分布中,Schur 补给出条件方差:$\Sigma_{y|x} = \Sigma_{yy} - \Sigma_{yx}\Sigma_{xx}^{-1}\Sigma_{xy}$,即回归残差的方差。
$v_1^T A v_2 = v_1^T (\lambda_2 v_2) = \lambda_2 v_1^T v_2$
又因 $A = A^T$:$v_1^T A v_2 = (Av_1)^T v_2 = (\lambda_1 v_1)^T v_2 = \lambda_1 v_1^T v_2$
故 $(\lambda_1 - \lambda_2) v_1^T v_2 = 0$,因 $\lambda_1 \ne \lambda_2$,所以 $v_1^T v_2 = 0$。$\square$
$\operatorname{tr}(AB) = \sum_i (AB)_{ii} = \sum_i \sum_k A_{ik}B_{ki} = \sum_k \sum_i B_{ki}A_{ik} = \sum_k (BA)_{kk} = \operatorname{tr}(BA)$。
推广:$\operatorname{tr}(ABC) = \operatorname{tr}(BCA) = \operatorname{tr}(CAB)$(循环轮换,但 不是任意置换!)
应用:$\operatorname{tr}(x^TAx) = x^TAx$(标量),$\operatorname{tr}(Q^TAQ) = \operatorname{tr}(A)$(正交相似变换不改变迹)。
PCA = 协方差矩阵的特征分解 = 数据矩阵的 SVD。
设数据矩阵 $X \in \mathbb{R}^{T \times n}$(中心化后),协方差矩阵 $\hat\Sigma = \frac{1}{T-1}X^TX$。
SVD:$X = U\Sigma V^T$,则 $X^TX = V\Sigma^2 V^T$,$V$ 的列即为 PCA 主成分方向(loadings),$\Sigma^2/(T-1)$ 的对角元为各主成分方差。
低秩近似在风险模型中的作用:
- 取前 $k$ 个最大奇异值:$\hat\Sigma_k = \sum_{i=1}^k \lambda_i v_i v_i^T + D$(因子模型结构)
- 减少估计误差(高维时协方差估计噪声大)
- 提升矩阵条件数,加速 Cholesky 分解
- 降低 Monte Carlo 模拟成本:只需模拟 $k$ 个因子
特征多项式:$p(\lambda) = \det(A - \lambda I) = (1-\lambda)(3-\lambda) = \lambda^2 - 4\lambda + 3$
Cayley–Hamilton:$A^2 - 4A + 3I = 0 \Rightarrow A^2 = 4A - 3I$
递推:$A^3 = A \cdot A^2 = A(4A - 3I) = 4A^2 - 3A = 4(4A-3I) - 3A = 13A - 12I$
一般地,$A^n = \alpha_n A + \beta_n I$,利用特征值 $\lambda_1=1, \lambda_2=3$:
$$\alpha_n = \frac{3^n - 1^n}{3-1} = \frac{3^n-1}{2}, \quad \beta_n = \frac{3 \cdot 1^n - 1 \cdot 3^n}{3-1} = \frac{3 - 3^n}{2}$$ $$A^{10} = \frac{3^{10}-1}{2}A + \frac{3-3^{10}}{2}I$$秩不等式六条:完整推导与记忆
核心口诀:乘积"最窄的门",加法"三角不等式",Sylvester"两次经过 $n$ 维损失 $\le n$",转置"null space 相同",Frobenius 是 Sylvester 的三矩阵版。
① 上界
推导:rank = 列空间维度,列空间 $\subseteq \mathbb{R}^m$,所以 $\le m$;rank 也等于行空间维度,行空间 $\subseteq \mathbb{R}^n$,所以 $\le n$。两个约束取小的。
记忆:桶有多小,水就装多少。
② 乘积(两个视角对称)
$AB$ 的第 $j$ 列 $= A \cdot b_j$($A$ 的列的线性组合),故
$$\mathcal{C}(AB) \subseteq \mathcal{C}(A) \Rightarrow \operatorname{rank}(AB) \le \operatorname{rank}(A)$$$AB$ 的第 $i$ 行 $= a_i^T \cdot B$($B$ 的行的线性组合),故
$$\mathcal{R}(AB) \subseteq \mathcal{R}(B) \Rightarrow \operatorname{rank}(AB) \le \operatorname{rank}(B)$$| 视角 | 谁的空间被包含 | 结论 |
|---|---|---|
| 列空间 | $\mathcal{C}(AB) \subseteq \mathcal{C}(A)$,由左矩阵 $A$ 控制 | $\le \operatorname{rank}(A)$ |
| 行空间 | $\mathcal{R}(AB) \subseteq \mathcal{R}(B)$,由右矩阵 $B$ 控制 | $\le \operatorname{rank}(B)$ |
注意:$B$ 的列对乘积不等式没有直接作用——真正起作用的是 $B$ 的行(它们是 $AB$ 行向量的"原材料")。
③ 加法(三角不等式)
右侧上界:$\mathcal{C}(A+B) \subseteq \mathcal{C}(A)+\mathcal{C}(B)$(子空间和),维度 $\le \dim\mathcal{C}(A)+\dim\mathcal{C}(B)$。
左侧下界:用上界两次:
$$\operatorname{rank}(A) = \operatorname{rank}((A+B)-B) \le \operatorname{rank}(A+B)+\operatorname{rank}(B)$$ $$\Rightarrow \operatorname{rank}(A+B) \ge \operatorname{rank}(A)-\operatorname{rank}(B)$$对称地得另一侧,取绝对值合并。类比实数 $|a-b|\le|a+b|\le|a|+|b|$。
④ Sylvester 不等式(最核心!)
等价形式(做题时更常用):
$$\operatorname{rank}(AB) \ge \operatorname{rank}(A)+\operatorname{rank}(B)-n$$推导(分块矩阵法):构造
$$M = \begin{pmatrix} AB & 0 \\ B & -I_n \end{pmatrix}$$对列做变换(第一列加 $A$ 倍的第二列),rank 不变:
$$M \to \begin{pmatrix} 0 & A \\ B & -I_n \end{pmatrix}$$右边矩阵:$-I_n$ 贡献满秩 $n$,$A$ 额外贡献 $\operatorname{rank}(A)$,故右边 rank $= n+\operatorname{rank}(A)$。左边 rank $\le \operatorname{rank}(AB)+n$(次加性),且 $\ge \operatorname{rank}(B)$(看右下角块)。联立得 $\operatorname{rank}(A)+\operatorname{rank}(B)\le\operatorname{rank}(AB)+n$。
直觉:$B$ 映射 $\mathbb{R}^p\to\mathbb{R}^n$ 损失 $n-\operatorname{rank}(B)$ 维;$A$ 再映射损失 $n-\operatorname{rank}(A)$ 维。两次损失共用同一个 $n$ 维中间空间,合并损失不超过 $n$,即 $(n-\operatorname{rank}(B))+(n-\operatorname{rank}(A))\le n$。
典型应用:$A^2=0 \Rightarrow 2\operatorname{rank}(A)\le 0+n \Rightarrow \operatorname{rank}(A)\le n/2$
⑤ 转置不变
关键证明($\operatorname{rank}(A)=\operatorname{rank}(A^TA)$):证明零空间相同。
若 $Ax=0$,则 $A^TAx=0$(显然)。若 $A^TAx=0$,则 $x^TA^TAx=0 \Rightarrow \|Ax\|^2=0 \Rightarrow Ax=0$。
$$\mathcal{N}(A) = \mathcal{N}(A^TA) \Rightarrow \text{nullity 相同} \Rightarrow \operatorname{rank}(A)=\operatorname{rank}(A^TA)$$OLS 意义:$X^TX$ 和 $X$ 共享零空间,$X$ 有多重共线性时 $X^TX$ 不可逆。
⑥ Frobenius 不等式
对 $\begin{pmatrix}AB&0\\B&BC\end{pmatrix}$ 做列变换后 rank 不变,次加性给出上界,分块对角结构给出下界,联立得结论。
与 Sylvester 的关系:取 $C=I$,得 Sylvester:$\operatorname{rank}(AB)+\operatorname{rank}(B)\le\operatorname{rank}(B)+\operatorname{rank}(AB) \cdot n$。Frobenius 是 Sylvester 的三矩阵推广。
可对角化条件:完整版
始终有:几何重数 $\le$ 代数重数。等号成立 $\Leftrightarrow$ 可对角化。
各充分条件(满足任一即可)
不同特征值的特征向量线性无关,直接凑够 $n$ 个。不是必要条件(有重特征值也可对角化)。
谱定理保证,且 $A=Q\Lambda Q^T$,$Q$ 正交,特征值全为实数,向量两两正交。
可对角化 $\Leftrightarrow$ 最小多项式无重根 $\Leftrightarrow$ 所有 Jordan 块大小为 1。
幂等:特征值 $\in\{0,1\}$,几何=代数重数。$A^n=I$:特征值为 $n$ 次单位根(复数域上不同),均可对角化。
不可对角化的典型情况
$\lambda=0$ 代数重数 2,$\mathcal{N}(A)=\operatorname{span}\{e_1\}$,几何重数仅 1。不可对角化,需 Jordan 标准型。
速查表
| 矩阵类型 | 结论 | 原因 |
|---|---|---|
| 实对称 $A=A^T$ | ✓ 一定可 | 谱定理 |
| $n$ 个不同特征值 | ✓ 一定可 | 不同特征向量线性无关 |
| $A^2=A$(幂等) | ✓ 一定可 | 特征值 $\in\{0,1\}$,几何=代数 |
| $A^n=I$ | ✓ $\mathbb{C}$ 上可 | 最小多项式整除 $x^n-1$,无重根 |
| 幂零 $A^k=0$,$A\ne0$ | ✗ 一定不可 | 特征值全 0,几何重数 $< n$ |
| 一般方阵 | ? 不确定 | 需验证几何=代数重数 |
不可能。$\lambda=0$ 是特征值 $\Rightarrow \exists v\ne0$ 使 $Av=0$,即零空间非平凡,$\operatorname{nullity}(A)>0$,$\operatorname{rank}(A)<n$。
同时 $\det(A)=\prod_i\lambda_i=0$(连乘中含 0 项),故 $A$ 不可逆。
这是绝对充要关系:$\lambda=0$ 是特征值 $\Leftrightarrow$ $A$ 不可逆 $\Leftrightarrow$ $\det(A)=0$ $\Leftrightarrow$ $\operatorname{rank}(A)<n$。
$\lambda=5$ 代数重数 1,几何重数自动为 1。关键看 $\lambda=2$(代数重数 3)。
几何重数 $=\dim\mathcal{N}(A-2I)=4-\operatorname{rank}(A-2I)$
- 情况一:几何重数 $=4-1=3=$ 代数重数 $\Rightarrow$ 可对角化
- 情况二:几何重数 $=4-2=2<3 \Rightarrow$ 不可对角化,需 Jordan 块
第一步:$AB\ne0$
由 Sylvester:$\operatorname{rank}(AB)\ge\operatorname{rank}(A)+\operatorname{rank}(B)-n=5-4=1>0$,故 $AB$ 不是零矩阵。
第二步:$AB$ 不一定是幂零的
反例(不幂零):$A=\operatorname{diag}(1,1,0,0),\ B=\operatorname{diag}(1,1,1,0)$,$AB=\operatorname{diag}(1,1,0,0)$,含特征值 1,不幂零。
构造(幂零):$A=e_1e_1^T$(rank 1),$B$ 为置换矩阵且第一列是 $e_2$,则 $AB$ 是秩 1 的严格上三角,$(AB)^2=0$。
关键判断:若两者同时可对角化(存在共同的 $P$),则 $AB$ 也可对角化。非零可对角化矩阵特征值含非零项,不可能是幂零矩阵。故此情况下 $AB$ 一定不是幂零矩阵。
多项式论证:设 $\alpha j+\beta j^2+\gamma j^3=0$ 对所有正整数 $j$ 成立,即多项式 $p(x)=x(\alpha+\beta x+\gamma x^2)=0$ 有无穷多个零点。次数 $\le3$ 的多项式若有无穷多零点则恒为零,故 $\alpha=\beta=\gamma=0$。三向量线性无关。
Vandermonde 验证($m=3$ 子矩阵):
$$M = \begin{pmatrix}1&2&3\\1&4&9\\1&8&27\end{pmatrix}$$分解为 $M = V \cdot D$,其中 $D=\operatorname{diag}(1,2,3)$,$V$ 是 Vandermonde 矩阵(行为 $x^1,x^2,x^3$ 在 $x=1,2,3$):
$$\det(M)=\det(V)\cdot\det(D)=(2-1)(3-1)(3-2)\cdot6=1\cdot2\cdot1\cdot6=12\ne0$$结论:Full rank,rank = 3。
Jordan 标准型深度解析
为什么需要 Jordan 标准型?
对角化失败时(几何重数 < 代数重数),矩阵无法写成 $PDP^{-1}$。但任何方阵在复数域上都相似于一个"几乎对角"的矩阵:
$$\text{对角化} \subset \text{Jordan 标准型} \supset \text{任意方阵}$$Jordan 块
对角是 $\lambda$,上对角线全是 1,其余为 0。$k=1$ 时退化为普通对角元(可对角化情形)。
关键计数关系(做题核心)
| 量 | 计算方式 | 含义 |
|---|---|---|
| Jordan 块总个数 | $n-\operatorname{rank}(A-\lambda I)$ | = 几何重数 |
| 最大块大小 | $\lambda$ 在最小多项式中的幂次 | 最顽固的"缺陷" |
| 大小 $\ge k$ 的块个数 | $\operatorname{rank}(A-\lambda I)^{k-1}-\operatorname{rank}(A-\lambda I)^k$ | 逐层分析 |
| 大小恰好为 $k$ 的块个数 | $r_{k-1}-2r_k+r_{k+1}$,$r_j=\operatorname{rank}(A-\lambda I)^j$ | 差分公式 |
| 所有块大小之和 | = 代数重数 | 必须凑到代数重数 |
大小恰为 $k$ 的块数 $n_k = r_{k-1}-2r_k+r_{k+1}$:
- $n_1 = r_0-2r_1+r_2 = 6-8+2 = 0$ 个 $1\times1$ 块
- $n_2 = r_1-2r_2+r_3 = 4-4+1 = 1$ 个 $2\times2$ 块
- $n_3 = r_2-2r_3+r_4 = 2-2+0 = 0$ 个 $3\times3$ 块
- $n_4 = r_3-2r_4+0 = 1-0+0 = 1$ 个 $4\times4$ 块
验证:$0\cdot1+1\cdot2+0\cdot3+1\cdot4=6$ ✓
$$J = \begin{pmatrix}3&1&&&&&\\&3&&&&& \\ &&3&1&&&\\&&&3&1&&\\&&&&3&1&\\&&&&&3\end{pmatrix} \quad (J_2(3) \oplus J_4(3))$$广义特征向量(Jordan 链)
一个 $k\times k$ Jordan 块对应一条链:
$$v_1 \xleftarrow{(A-\lambda I)} v_2 \xleftarrow{(A-\lambda I)} \cdots \xleftarrow{(A-\lambda I)} v_k$$即 $(A-\lambda I)v_j = v_{j-1}$,$v_1$ 是真正的特征向量,$v_2,\ldots,v_k$ 是广义特征向量。
满足:$(A-\lambda I)^j v_k = v_{k-j}$,$(A-\lambda I)^k v_k = 0$。
分解 $J_k(\lambda) = \lambda I + N$,其中 $N$ 是严格上三角幂零矩阵($N^k=0$)。
因 $\lambda I$ 和 $N$ 可交换,二项式定理:
$$J_k(\lambda)^m = (\lambda I+N)^m = \sum_{j=0}^{k-1}\binom{m}{j}\lambda^{m-j}N^j$$ $$= \begin{pmatrix}\lambda^m & \binom{m}{1}\lambda^{m-1} & \binom{m}{2}\lambda^{m-2} & \cdots \\ & \lambda^m & \binom{m}{1}\lambda^{m-1} & \cdots \\ & & \ddots & \vdots \\ & & & \lambda^m\end{pmatrix}$$关键推论:
- 若 $|\lambda|<1$:$J_k(\lambda)^m\to0$($m\to\infty$),系统稳定
- 若 $\lambda=0$(幂零块):$J_k(0)^k=0$,验证幂零性
- 若 $|\lambda|=1,\lambda\ne1$:振荡不收敛
与其他概念的关系总结
| 概念 | 在 Jordan 形中的表现 |
|---|---|
| 可对角化 | 所有 Jordan 块大小为 1,即 $J=D$(对角矩阵) |
| 幂零矩阵 | 所有特征值为 0,Jordan 块对角全 0,$J^k=0$ |
| 幂等矩阵 | 特征值 $\in\{0,1\}$,Jordan 块全为 $1\times1$(可对角化) |
| 最小多项式 | $m_A(\lambda)=\prod_i(\lambda-\lambda_i)^{s_i}$,$s_i$=最大 Jordan 块大小 |
| 特征多项式 | $p_A(\lambda)=\prod_i(\lambda-\lambda_i)^{m_i}$,$m_i$=代数重数=块大小之和 |
(1)是的。协方差矩阵 = 对称半正定;可逆时为对称正定 (SPD)。
设 $\Sigma=Q\Lambda Q^T$(特征值 $\lambda_i>0$),则 $\Sigma^{-1}=Q\Lambda^{-1}Q^T$,特征值 $1/\lambda_i>0$。
- 对称性:$(\Sigma^{-1})^T=(\Sigma^T)^{-1}=\Sigma^{-1}$ ✓
- 正定性:特征值 $1/\lambda_i>0$ ✓
$\Sigma^{-1}$ 在统计上称精度矩阵(Precision Matrix),高斯图模型中的条件独立结构由它决定。
(2)不一定。反例:
$$A = \begin{pmatrix}1&0.9&0.9\\0.9&1&-0.9\\0.9&-0.9&1\end{pmatrix}$$所有 $2\times2$ 主子式行列式 $=1-0.81=0.19>0$,均为合法协方差矩阵 ✓。但
$$\det(A) = 1\cdot(1-0.81) - 0.9\cdot(0.9+0.81) + 0.9\cdot(-0.81-0.9) < 0$$$A$ 不是半正定,不是协方差矩阵。低维主子式 PSD 无法控制高维方向的曲率。
新增高频题目
是的。 验证 $\Sigma^{-1}$ 也是 SPD:
对称性: $(\Sigma^{-1})^T = (\Sigma^T)^{-1} = \Sigma^{-1}$ ✓
正定性: $\Sigma = Q\Lambda Q^T$(特征值 $\lambda_i > 0$),则
$$\Sigma^{-1} = Q\Lambda^{-1}Q^T,\quad \Lambda^{-1} = \operatorname{diag}(1/\lambda_1,\ldots,1/\lambda_n)$$$1/\lambda_i > 0$,故 $\Sigma^{-1}$ 也是正定的。 ✓
$\Sigma^{-1}$ 在统计中称为精度矩阵(Precision Matrix),在高斯图模型中,其非零元素对应条件独立结构。
不一定。 反例:
$$A = \begin{pmatrix}1&0.9&0.9\\0.9&1&-0.9\\0.9&-0.9&1\end{pmatrix}$$所有 $1\times1$ 主子式 $= 1 > 0$ ✓,所有 $2\times2$ 主子式 $\det = 1-0.81 = 0.19 > 0$ ✓,每个子矩阵都是合法协方差矩阵。
但 $\det(A) = 1(0.19) - 0.9(0.9+0.81) + 0.9(-0.81-0.9) < 0$,$A$ 不是半正定,不是协方差矩阵。
本质原因:PSD 要求所有主子式行列式 $\ge 0$,但低维子矩阵 PSD 不能控制高维方向的曲率——三个变量两两正相关时,第三对相关系数必须受到约束(如上一节三变量相关系数例题)。
是的,线性无关,full rank。
证明(多项式论证):设 $\alpha \cdot j + \beta \cdot j^2 + \gamma \cdot j^3 = 0$ 对所有 $j = 1,2,3,\ldots$ 成立。
即多项式 $p(x) = \alpha x + \beta x^2 + \gamma x^3 = x(\alpha + \beta x + \gamma x^2)$ 在无穷多个点 $x = 1,2,3,\ldots$ 取零值。
次数 $\le 3$ 的多项式若有无穷多零点,则恒为零,故 $\alpha = \beta = \gamma = 0$,线性无关。
验证(Vandermonde 行列式):取 $j=1,2,3$ 构成 $3\times3$ 子矩阵:
$$M = \begin{pmatrix}1&2&3\\1&4&9\\1&8&27\end{pmatrix}$$分解:$M = \begin{pmatrix}1^1&2^1&3^1\\1^2&2^2&3^2\\1^3&2^3&3^3\end{pmatrix}$,这是 Vandermonde 矩阵的转置乘以 $\operatorname{diag}(1,2,3)$。
$$\det(M) = (2-1)(3-1)(3-2) \cdot 1\cdot2\cdot3 = 1\cdot2\cdot1\cdot6 = 12 \ne 0 \checkmark$$假设 $c_1x_1+\cdots+c_nx_n = 0$,且 $c_i$ 不全为零。两边左乘 $A$:
$$c_1\lambda_1 x_1 + \cdots + c_n\lambda_n x_n = 0 \quad \cdots (2)$$$(2) - \lambda_n \times (1)$:$c_1(\lambda_1-\lambda_n)x_1 + \cdots + c_{n-1}(\lambda_{n-1}-\lambda_n)x_{n-1} = 0$
不断重复这个操作,最终得到 $c_1(\lambda_1-\lambda_2)\cdots(\lambda_1-\lambda_n)x_1 = 0$。
因为 $x_1 \ne 0$ 且所有 $\lambda_i$ 不同,所以 $c_1 = 0$。类似地推出所有 $c_i = 0$,矛盾。故线性无关。$\square$
设 $\lambda$ 是复特征值,$x$ 是对应的复特征向量(可能是复数)。$\lambda^*$ 是 $\lambda$ 的共轭。
因 $A$ 是实矩阵,$A\bar{x} = \overline{Ax} = \overline{\lambda x} = \lambda^* \bar{x}$。
计算 $\bar{x}^T A x$:
$$\bar{x}^T A x = \bar{x}^T (\lambda x) = \lambda \bar{x}^T x = \lambda \|x\|^2$$ $$\bar{x}^T A x = (A\bar{x})^T x = (\lambda^* \bar{x})^T x = \lambda^* \bar{x}^T x = \lambda^* \|x\|^2$$故 $(\lambda - \lambda^*)\|x\|^2 = 0$。因 $x \ne 0$,$\|x\|^2 > 0$,所以 $\lambda = \lambda^*$,即 $\lambda$ 为实数。$\square$
$\max\ x^TAx$ 与 Rayleigh 商
Step 0:为什么可以先假设 $A$ 对称?
任意方阵 $A$ 都可以唯一分解为对称部分与反对称部分之和:
$$A = \underbrace{\frac{A+A^T}{2}}_{A_s\ (\text{对称})} + \underbrace{\frac{A-A^T}{2}}_{A_k\ (\text{反对称},\ A_k^T=-A_k)}$$代入二次型:
$$x^TAx = x^TA_s x + x^TA_k x$$关键:$x^TA_k x = 0$ 恒成立。
因此 $x^TAx = x^TA_s x$,优化问题完全等价于对称矩阵版本。
为什么 $x^TA_k x = 0$?
设 $S = A - A^T$(反对称,$S^T = -S$)。$x^TSx$ 是标量,故
$$x^TSx = (x^TSx)^T = x^TS^T x = x^T(-S)x = -x^TSx$$ $$\Rightarrow\quad 2\,x^TSx = 0 \quad\Rightarrow\quad x^TSx = 0$$与 $x$ 无关,对所有向量恒成立。
一句话总结:$A$ 的反对称部分对二次型没有任何贡献,所以 $\max x^TAx$ 只取决于 $\frac{A+A^T}{2}$。面试时先写出这一步分解,立刻展示深度。
Step 1:无约束情况 → 问题无界
若 $A_s$ 有正特征值 $\lambda > 0$,取对应特征向量 $v$,令 $x = tv$:
$$x^TA_s x = t^2 v^TA_s v = t^2\lambda\|v\|^2 \xrightarrow{t\to\infty} +\infty$$故必须加约束,最自然的是 $\|x\|_2 = 1$(单位球面)或等价的 Rayleigh 商形式。
Step 2:约束 $\|x\|=1$ → 答案是最大特征值
证明:谱定理给出 $A_s = Q\Lambda Q^T$,令 $y = Q^Tx$(正交换基,$\|y\|=\|x\|=1$):
$$x^TA_s x = y^T\Lambda y = \sum_i \lambda_i y_i^2$$在 $\sum_i y_i^2 = 1$ 约束下,这是特征值的加权平均(权重 $y_i^2 \ge 0$,和为 1):
$$\sum_i \lambda_i y_i^2 \le \lambda_{\max}\sum_i y_i^2 = \lambda_{\max}$$当 $y = e_k$($\lambda_{\max}$ 对应分量的标准基),即 $x = q_k$(最大特征值的特征向量)时等号成立。$\square$
Rayleigh 商(去掉 $\|x\|=1$ 的限制)
将 $x = \|x\| \cdot \hat x$ 代入即化为 $\|x\|=1$ 情形,结论不变。Rayleigh 商是尺度不变的。
Courant–Fischer 定理(所有特征值的 min-max 刻画)
设 $A_s$ 的特征值 $\lambda_1 \ge \lambda_2 \ge \cdots \ge \lambda_n$,则
$$\lambda_k = \max_{\dim V = k}\ \min_{x \in V,\, \|x\|=1} x^TA_s x = \min_{\dim V = n-k+1}\ \max_{x \in V,\, \|x\|=1} x^TA_s x$$等价的简洁形式:
$$\lambda_k = \max_{\substack{x \perp q_1,\ldots,q_{k-1}\\\|x\|=1}} x^TA_s x$$在前 $k-1$ 个特征向量的正交补中找最大值,得第 $k$ 大特征值。PCA 逐步提取主成分正是这个过程。
| 优化问题 | 最优值 | 最优 $x$ |
|---|---|---|
| $\max_{\|x\|=1} x^TAx$ | $\lambda_{\max}(A_s)$ | $\lambda_{\max}$ 的特征向量 $q_1$ |
| $\min_{\|x\|=1} x^TAx$ | $\lambda_{\min}(A_s)$ | $\lambda_{\min}$ 的特征向量 $q_n$ |
| $\max_{\|x\|=1,\, x\perp q_1} x^TAx$ | $\lambda_2$(第二大特征值) | $q_2$(第二特征向量) |
| $\max_{x\ne0} \frac{x^TAx}{x^Tx}$ | $\lambda_{\max}(A_s)$ | 同上,尺度不变 |
| $\max_{\|x\|=1} \|Ax\|^2 = \max x^TA^TAx$ | $\sigma_{\max}^2$(最大奇异值平方) | $A^TA$ 的最大特征向量(右奇异向量) |
完整推导链
│ A = A_s + A_k(对称 + 反对称分解)
│ xTA_k x = 0(反对称二次型恒为零)
▼
max xTA_s x,A_s = (A+AT)/2
│ 加约束 ‖x‖ = 1
│ 谱定理:A_s = QΛQT,换基 y = QTx
▼
max Σ λᵢ yᵢ²,subject to Σ yᵢ² = 1
│ 加权平均,权重非负和为 1
▼
最大值 = λ_max(A_s),在 x = 对应特征向量时取到
量化金融中的应用
协方差矩阵 $\Sigma$ 已经是对称正半定的,所以 $\Sigma_s = \Sigma$,Rayleigh 商直接给出:
- 最大化组合方差的方向 = $\lambda_{\max}(\Sigma)$ 对应的特征向量 = 第一主成分
- PCA 降维 = 逐步用 Courant–Fischer 提取各主成分方向
- 风险最大的因子暴露 = $\lambda_{\max}$ 方向,风险预算时需重点控制
- 条件数 $\kappa = \lambda_{\max}/\lambda_{\min}$ = Rayleigh 商最大值与最小值之比,决定矩阵病态程度
Step 1:计算对称部分
$$A_s = \frac{A+A^T}{2} = \frac{1}{2}\begin{pmatrix}4&4\\4&4\end{pmatrix} = \begin{pmatrix}2&2\\2&2\end{pmatrix}$$Step 2:求 $A_s$ 的特征值
$$\det(A_s - \lambda I) = (2-\lambda)^2 - 4 = \lambda^2 - 4\lambda = \lambda(\lambda-4) = 0$$特征值:$\lambda_1 = 4,\ \lambda_2 = 0$。
Step 3:结论
$$\max_{\|x\|=1} x^TAx = \lambda_{\max}(A_s) = 4$$最优 $x$:$\lambda_1=4$ 的特征向量,$(A_s - 4I)v = 0 \Rightarrow v = \frac{1}{\sqrt{2}}\begin{pmatrix}1\\1\end{pmatrix}$。
验证:$x^TAx = \frac{1}{2}(1,1)\begin{pmatrix}2&3\\1&2\end{pmatrix}\begin{pmatrix}1\\1\end{pmatrix} = \frac{1}{2}(1,1)\begin{pmatrix}5\\3\end{pmatrix} = \frac{8}{2} = 4$ ✓
上下界:已由换基证明 $R(x)\in[\lambda_n,\lambda_1]$。
连续性:$R(x) = \frac{x^TAx}{x^Tx}$ 是 $\mathbb{R}^n\setminus\{0\}$ 上的连续函数,其定义域(去掉原点的连通集)在 $R$ 下的像是连通集,即区间。
端点可达:$R(q_1)=\lambda_1$,$R(q_n)=\lambda_n$。
由介值定理,$R$ 能取到 $[\lambda_n, \lambda_1]$ 中所有值。$\square$
推论:$A$ 正定 $\Leftrightarrow$ $\lambda_n>0$ $\Leftrightarrow$ $R(x)>0,\ \forall x\ne0$,即 $x^TAx>0$ 恒成立。
$\|Ax\|^2 = x^TA^TAx$,这是以 $A^TA$($n\times n$ 对称半正定矩阵)为参数的二次型。
$A^TA$ 的特征值 = $A$ 的奇异值的平方:$A^TA = V\Sigma^T\Sigma V^T$,故
$$\max_{\|x\|=1} x^TA^TAx = \lambda_{\max}(A^TA) = \sigma_{\max}^2(A)$$最优 $x = v_1$(最大奇异值对应的右奇异向量),此时 $\|Av_1\| = \sigma_1$。
谱范数:$\|A\|_2 = \max_{\|x\|=1}\|Ax\| = \sigma_{\max}(A)$,这正是矩阵谱范数的定义。
几何意义:$A$ 把单位球映射成一个椭球,半轴长度是各奇异值 $\sigma_1\ge\cdots\ge\sigma_r>0$,方向是右奇异向量。$\sigma_1$ 是最长半轴,即 $A$ 最大拉伸方向。
覆盖考点:Rank / Nullity / Eigenvalues / Diagonalization / Jordan Form / SVD / Idempotent / Nilpotent / PSD / OLS / Rayleigh Quotient / Courant–Fischer / Matrix Calculus / Monte Carlo / Rank Inequalities / Covariance