概率不等式
完全参考手册
涵盖 Jensen、Markov、Chebyshev、Cantelli、Hölder、Young、Wald 及方差分解,附推导与例题。
Jensen 不等式
设 $\varphi$ 为凸函数,$X$ 为可积随机变量,则
等号成立当且仅当:$X$ a.s. 为常数,或 $\varphi$ 在 $X$ 的值域上是线性的。
设 $m = \mathbb{E}[X]$。凸函数在任意点处存在支撑超平面(次梯度),故 $\exists\, a,b$ 使得
$$\varphi(x) \;\ge\; ax + b \quad\forall x, \qquad \varphi(m) = am + b$$对两边取期望:$\mathbb{E}[\varphi(X)] \ge a\mathbb{E}[X] + b = am + b = \varphi(m)$。$\square$
条件版本(给定 $\sigma$-域 $\mathcal{G}$):
凹函数($\varphi'' \le 0$,如 $\log x$)时不等号方向反转:$\varphi(\mathbb{E}[X]) \ge \mathbb{E}[\varphi(X)]$。
证明:对正数 $x_1,\ldots,x_n$,
$$\frac{x_1+\cdots+x_n}{n} \;\ge\; (x_1\cdots x_n)^{1/n}$$令 $X$ 为在 $\{x_1,\ldots,x_n\}$ 上均匀分布的离散随机变量。因 $\log$ 是凹函数,Jensen 给出
$$\log\!\left(\frac{\sum x_i}{n}\right) = \log\mathbb{E}[X] \;\ge\; \mathbb{E}[\log X] = \frac{\sum \log x_i}{n} = \log(x_1\cdots x_n)^{1/n}$$两边取指数即得。$\square$
$X_i \sim \text{Exp}(\lambda)$,MLE 为 $\hat\lambda = 1/\bar{X}$。说明 $\hat\lambda$ 有偏。
$\varphi(t) = 1/t$ 在 $t>0$ 上是凸函数($\varphi'' = 2/t^3 > 0$)。Jensen 给出
$$\mathbb{E}\!\left[\frac{1}{\bar{X}}\right] \;\ge\; \frac{1}{\mathbb{E}[\bar{X}]} = \frac{1}{1/\lambda} = \lambda$$精确值:$\sum X_i \sim \text{Gamma}(n, 1/\lambda)$,利用负矩公式 $\mathbb{E}[1/Y]=\frac{1}{\beta(\alpha-1)}$:
$$\mathbb{E}[\hat\lambda] = n\cdot\mathbb{E}\!\left[\frac{1}{\sum X_i}\right] = n\cdot\frac{\lambda}{n-1} = \frac{n}{n-1}\lambda > \lambda$$无偏修正:$\hat\lambda_{\text{unbiased}} = \dfrac{n-1}{n}\cdot\dfrac{1}{\bar{X}}$。
证明方差非负,即 $\text{Var}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2 \ge 0$。
$\varphi(x)=x^2$ 凸($\varphi''=2>0$),Jensen 直接给出 $\mathbb{E}[X^2] \ge (\mathbb{E}[X])^2$。$\square$
期望迭代 · 方差分解
记忆口诀:Var = E[Var] + Var[E](先条件,再各自求方差/期望,最后取外层)。
利用 $\mathbb{E}[X^2] = \mathbb{E}[\mathbb{E}[X^2\mid Y]]$ 及 $\mathbb{E}[X^2\mid Y] = \text{Var}(X\mid Y) + (\mathbb{E}[X\mid Y])^2$:
$$= \mathbb{E}[\text{Var}(X\mid Y)] + \mathbb{E}[(\mathbb{E}[X\mid Y])^2] - (\mathbb{E}[\mathbb{E}[X\mid Y]])^2 = \mathbb{E}[\text{Var}(X\mid Y)] + \text{Var}(\mathbb{E}[X\mid Y]) \quad\square$$设 $\Lambda \sim \text{Gamma}(\alpha, \beta)$,$X\mid\Lambda \sim \text{Poisson}(\Lambda)$。求 $\text{Var}(X)$。
已知 $\mathbb{E}[X\mid\Lambda]=\Lambda$,$\text{Var}(X\mid\Lambda)=\Lambda$(泊松性质)。
$$\text{Var}(X) = \mathbb{E}[\Lambda] + \text{Var}(\Lambda) = \alpha\beta + \alpha\beta^2 = \alpha\beta(1+\beta)$$(负二项分布的方差公式)。
$N$ 为随机变量,$X_1,X_2,\ldots$ i.i.d.,$S_N = X_1+\cdots+X_N$,$N\perp X_i$。求 $\text{Var}(S_N)$。
$\mathbb{E}[S_N\mid N]=N\mu$,$\text{Var}(S_N\mid N)=N\sigma^2$,故
$$\text{Var}(S_N) = \mathbb{E}[N\sigma^2] + \text{Var}(N\mu) = \sigma^2\mathbb{E}[N] + \mu^2\text{Var}(N)$$这与 Wald 方程配合使用极为常见。
$L^p$ 范数
离散/向量:$\|x\|_p = \left(\sum_i |x_i|^p\right)^{1/p}$,$1\le p < \infty$;$\|x\|_\infty = \max_i|x_i|$。
随机变量:$\|X\|_p = \left(\mathbb{E}|X|^p\right)^{1/p}$。
| 范数 | 几何形状(二维单位球) | 直觉 |
|---|---|---|
| $L^1$ | 菱形(Manhattan) | 各坐标绝对值之和;更均匀 |
| $L^2$ | 圆形(Euclidean) | 标准距离 |
| $L^\infty$ | 正方形 | 取最大坐标;关注峰值 |
对固定向量 $x$,若 $p \le q$,则 $\|x\|_p \ge \|x\|_q$(即 $\|x\|_1 \ge \|x\|_2 \ge \cdots \ge \|x\|_\infty$)。
$L^p$ 的对偶范数是 $L^q$,其中 $\frac{1}{p}+\frac{1}{q}=1$。定义为
$$\|y\|_q = \sup_{\|x\|_p \le 1} \langle x, y\rangle$$"从 $y$ 方向看单位球能延伸多远。" $L^1 \leftrightarrow L^\infty$,$L^2$ 自对偶。
$L^1$ 正则化(Lasso):最优性条件 $0 \in \nabla f(w^*) + \lambda\partial\|w\|_1$,其中次梯度集 $\partial\|w\|_1 = \{g : g_i = \text{sign}(w_i)$ 若 $w_i\ne 0$,$g_i\in[-1,1]$ 若 $w_i=0\}$。若 $|\nabla_i f(w^*)| < \lambda$,则 $w_i^*=0$(稀疏)。
Cauchy–Schwarz 不等式
等号成立 iff $X = cY$ a.s.($c$ 为常数)。向量版本:$|\langle x,y\rangle| \le \|x\|_2\|y\|_2$,即 $(\sum x_i y_i)^2 \le (\sum x_i^2)(\sum y_i^2)$。
本质:$\langle x,y\rangle = \|x\|\|y\|\cos\theta \le \|x\|\|y\|$。
对任意 $t\in\mathbb{R}$,$0 \le \mathbb{E}[(X+tY)^2] = \mathbb{E}[X^2] + 2t\mathbb{E}[XY] + t^2\mathbb{E}[Y^2]$。
此关于 $t$ 的二次函数恒非负,故判别式 $\Delta = 4(\mathbb{E}[XY])^2 - 4\mathbb{E}[X^2]\mathbb{E}[Y^2] \le 0$。$\square$
令 $U = \frac{X-\mu_X}{\sigma_X}$,$V = \frac{Y-\mu_Y}{\sigma_Y}$,则 $|\rho| = |\mathbb{E}[UV]| \le \sqrt{\mathbb{E}[U^2]\mathbb{E}[V^2]} = 1$。
$X, Y$ 独立,$Y > 0$。利用 C-S 证明 $1 = (\mathbb{E}[\sqrt{X/Y}\cdot\sqrt{Y}])^2 \le \mathbb{E}[X/Y]\cdot\mathbb{E}[Y]$(即 $\frac{1}{\mathbb{E}[Y]} \le \mathbb{E}[X/Y]/\mathbb{E}[X]$,设 $\mathbb{E}[X]=1$)。
令 $A=\sqrt{X/Y}$,$B=\sqrt{Y}$。C-S:$(\mathbb{E}[AB])^2 \le \mathbb{E}[A^2]\mathbb{E}[B^2]$,即 $(\mathbb{E}[\sqrt{X}])^2 \le \mathbb{E}[X/Y]\cdot\mathbb{E}[Y]$,故 $\mathbb{E}[X/Y] \ge (\mathbb{E}[\sqrt{X}])^2/\mathbb{E}[Y]$。
Hölder 不等式
设 $p > 1$,$q > 1$,$\frac{1}{p}+\frac{1}{q}=1$,则
等号成立 iff $|X|^p = c|Y|^q$ a.s.。C-S 是 $p=q=2$ 的特例。
不妨设 $\|X\|_p = \|Y\|_q = 1$。对 $a = |X|$,$b = |Y|$,$\lambda = 1/p$ 应用 Young 不等式:
$$|X||Y| \le \frac{|X|^p}{p} + \frac{|Y|^q}{q}$$取期望:$\mathbb{E}[|XY|] \le \frac{1}{p}+\frac{1}{q} = 1 = \|X\|_p\|Y\|_q$。$\square$
Young 不等式
$a, b \ge 0$,$p, q > 1$,$\frac{1}{p}+\frac{1}{q}=1$,则
等号成立 iff $a^p = b^q$。
令 $\lambda = 1/p$,$1-\lambda = 1/q$,$x = \ln a^p$,$y = \ln b^q$。$e^x$ 凸,Jensen:
$$e^{\lambda x + (1-\lambda)y} \le \lambda e^x + (1-\lambda)e^y$$ $$\Rightarrow\quad e^{\frac{\ln a^p}{p}+\frac{\ln b^q}{q}} = ab \;\le\; \frac{a^p}{p}+\frac{b^q}{q} \quad\square$$Minkowski 不等式(三角不等式的 $L^p$ 版)
即 $L^p$ 范数满足三角不等式(范数公理之一)。由 Hölder 不等式证明。
Markov 不等式
$X \ge 0$,$a > 0$,则
Markov 仅利用了均值信息,界通常非常松。例如 $\mathbb{E}[X]=5$,$\Pr(X\ge 20)\le 1/4$——仅知道"至多 25%",实际可能远小。
某资产日收益率(损失取正值)$L \ge 0$,$\mathbb{E}[L] = 0.02$。问日损失超过 10% 的概率上界。
即最多有 20% 的天数日亏损超过 10%。
Chebyshev 不等式
其中 $\mu = \mathbb{E}[X]$,$\sigma^2 = \text{Var}(X)$,$t > 0$。
令 $Y = (X-\mu)^2 \ge 0$,对 $Y$ 应用 Markov,$a = t^2$:
$$\Pr(|X-\mu|\ge t) = \Pr(Y \ge t^2) \le \frac{\mathbb{E}[Y]}{t^2} = \frac{\sigma^2}{t^2} \quad\square$$令 $1 - \delta = 1 - \sigma^2/t^2$,解得 $t = \sigma/\sqrt{\delta}$,故以至少 $1-\delta$ 的概率有 $|X-\mu| < \sigma/\sqrt{\delta}$。
$X_1,\ldots,X_n$ i.i.d.,$\text{Var}(X_i)=\sigma^2$。$\bar{X}_n = \frac{1}{n}\sum X_i$。问 $\Pr(|\bar{X}_n - \mu| \ge \varepsilon)$ 的上界。
$\text{Var}(\bar{X}_n) = \sigma^2/n$,Chebyshev 给出
$$\Pr(|\bar{X}_n - \mu| \ge \varepsilon) \le \frac{\sigma^2}{n\varepsilon^2}$$这直接证明了大数定律(弱收敛):固定 $\varepsilon$,$n\to\infty$ 时右侧趋于 0。
Cantelli 不等式(单边 Chebyshev)
与 Chebyshev 的双边界不同,Cantelli 给出单边(上尾)的更紧的界。
对 $Y = X - \mu + \lambda \ge 0$($\lambda > 0$)应用 Markov:
$$\Pr(X-\mu \ge t) = \Pr(Y \ge t+\lambda) \le \frac{\mathbb{E}[Y^2]}{(t+\lambda)^2} = \frac{\sigma^2 + \lambda^2}{(t+\lambda)^2}$$对 $\lambda$ 最小化右侧,令导数为零得 $\lambda^* = \sigma^2/t$,代入得
$$\Pr(X-\mu \ge t) \le \frac{\sigma^2}{\sigma^2+t^2} \quad\square$$给定资产收益 $R$,$\mu = \mathbb{E}[R]$,$\sigma^2 = \text{Var}(R)$。损失 $L = -R$,则
$$\Pr(L \ge \mu_L + t) \le \frac{\sigma^2}{\sigma^2 + t^2}$$可用于在分布未知时估计 VaR 的无分布上界。
$\sigma = 3$,$t = 9$。分别用 Chebyshev 和 Cantelli 给出 $\Pr(X-\mu \ge 9)$ 的上界。
Chebyshev(双边除以 2 近似单边):$\Pr(|X-\mu|\ge 9) \le \frac{9}{81} = \frac{1}{9} \approx 11.1\%$,单边至多 $11.1\%$。
Cantelli(直接单边):$\Pr(X-\mu \ge 9) \le \frac{9}{9+81} = \frac{9}{90} = \frac{1}{10} = 10\%$。
Cantelli 给出更紧的单边界($10\%$ vs $11.1\%$)。
Chernoff 界(指数矩方法)
对任意 $s > 0$,
其中 $M_X(s) = \mathbb{E}[e^{sX}]$ 为矩母函数 (MGF)。
$e^{sx}$ 单调递增,故 $X \ge a \Leftrightarrow e^{sX} \ge e^{sa}$。Markov:
$$\Pr(X \ge a) = \Pr(e^{sX} \ge e^{sa}) \le \frac{\mathbb{E}[e^{sX}]}{e^{sa}} = e^{-sa} M_X(s)$$对 $s > 0$ 取下确界。$\square$
$X_i \sim \text{Bernoulli}(p)$ i.i.d.,$S_n = \sum_{i=1}^n X_i$,$\mu = np$。证明对 $\delta > 0$:
$$\Pr(S_n \ge (1+\delta)\mu) \le \left(\frac{e^\delta}{(1+\delta)^{1+\delta}}\right)^\mu$$$M_{X_i}(s) = 1 - p + pe^s$。故 $M_{S_n}(s) = (1-p+pe^s)^n$。
Chernoff:$\Pr(S_n \ge a) \le e^{-sa}(1-p+pe^s)^n$,令 $a = (1+\delta)\mu$,$s = \ln(1+\delta)$ 优化后得上式。
指数衰减速率远优于 Chebyshev 的多项式衰减,适合大偏差分析。
若 $a_i \le X_i \le b_i$,$S_n = \sum X_i$,则
$$\Pr\!\left(S_n - \mathbb{E}[S_n] \ge t\right) \;\le\; \exp\!\left(-\frac{2t^2}{\sum_{i=1}^n (b_i-a_i)^2}\right)$$Wald 方程
设 $X_1, X_2, \ldots$ i.i.d.,$N$ 为非负整数值随机变量,$N \perp (X_1, X_2, \ldots)$,$\mathbb{E}|X_i| < \infty$,$\mathbb{E}[N] < \infty$。令 $S_N = X_1 + \cdots + X_N$,则
此外(Wald 二阶方程):
方差部分由全方差公式(§2)直接给出,与例题 5 完全一致。
赌徒每局赢 $+1$ 或输 $-1$,各以 $1/2$ 概率。博弈在第 $N$ 局停止,$N \sim \text{Geom}(p)$ 独立于每局结果。求总盈亏 $S_N$ 的期望和方差。
$\mathbb{E}[X_i]=0$,$\text{Var}(X_i)=1$,$\mathbb{E}[N]=1/p$,$\text{Var}(N)=(1-p)/p^2$。
$$\mathbb{E}[S_N] = \mathbb{E}[N]\cdot 0 = 0$$ $$\text{Var}(S_N) = \frac{1}{p}\cdot 1 + 0^2\cdot\frac{1-p}{p^2} = \frac{1}{p}$$保险理赔:$N \sim \text{Poisson}(\lambda)$ 次理赔,每次金额 $X_i$ i.i.d.,$\mathbb{E}[X_i]=\mu_X$,$\text{Var}(X_i)=\sigma_X^2$。求总理赔 $S_N$ 的均值和方差。
$\mathbb{E}[N]=\text{Var}(N)=\lambda$(泊松性质),故
$$\mathbb{E}[S_N] = \lambda\mu_X, \qquad \text{Var}(S_N) = \lambda\sigma_X^2 + \mu_X^2\lambda = \lambda(\sigma_X^2 + \mu_X^2) = \lambda\mathbb{E}[X_i^2]$$集中不等式对比表
| 不等式 | 形式 | 所需信息 | 衰减速率 | 适用场景 |
|---|---|---|---|---|
| Markov | $\Pr(X\ge a)\le \mu/a$ | $\mathbb{E}[X]$ | $O(1/a)$,多项式 | 最弱,兜底 |
| Chebyshev | $\Pr(|X-\mu|\ge t)\le \sigma^2/t^2$ | 均值 + 方差 | $O(1/t^2)$,多项式 | 双边,LLN 证明 |
| Cantelli | $\Pr(X-\mu\ge t)\le \sigma^2/(\sigma^2+t^2)$ | 均值 + 方差 | $O(1/t^2)$,比 C 紧 | 单边,VaR 上界 |
| Chernoff | $\Pr(X\ge a)\le e^{-sa}M_X(s)$ | MGF 存在 | 指数衰减 | 大偏差,尾部极细 |
| Hoeffding | $\Pr(S_n - \mu \ge t)\le e^{-2t^2/\sum(b_i-a_i)^2}$ | 有界区间 | 指数衰减 | 有界 r.v.,ML 泛化 |
Markov $\Rightarrow$ Chebyshev(令 $Y=(X-\mu)^2$)$\Rightarrow$ Cantelli(优化辅助参数)。Chernoff 由 Markov 作用于 $e^{sX}$ 得到,是所有多项式界的指数加强版。