Quantitative Finance · Interview Prep · Princeton MFin

Sharpe Ratio
量化面试完全手册

涵盖定义、统计推断、组合优化、均值-方差理论与实务修正,附推导过程与面试速查题库。

§ 01

定义与年化

设超额收益序列 $x_t = r_t - r_{f,t}$,样本均值 $\bar{x}$,样本标准差 $\hat{\sigma}$,样本 Sharpe 定义为:

$$\hat{S} = \frac{\bar{x}}{\hat{\sigma}}, \qquad \bar{x} = \frac{1}{n}\sum_{t=1}^n x_t, \quad \hat{\sigma}^2 = \frac{1}{n-1}\sum_{t=1}^n (x_t - \bar{x})^2$$

年化换算(i.i.d.)

若 $x_t$ 独立同分布,每期与年之间有因子 $A$(如日度 $A=252$,月度 $A=12$,周度 $A=52$):

$$S_{\text{ann}} = \sqrt{A} \cdot S_{\text{per}}$$
⚠️
陷阱:自相关。若收益存在序列相关,直接乘 $\sqrt{A}$ 是错的。正确做法:先用 HAC 估计年化方差,再计算年化 Sharpe。见 §19。

各频率年化因子

频率年化因子 $A$年化 Sharpe
日度252$\sqrt{252} \approx 15.87 \times S_d$
周度52$\sqrt{52} \approx 7.21 \times S_w$
月度12$\sqrt{12} \approx 3.46 \times S_m$
§ 02

杠杆不变性

若对策略加 $L$ 倍杠杆(无借贷成本、无交易成本):

$$\mu(Lw) = L\mu, \quad \sigma(Lw) = L\sigma \quad \Rightarrow \quad S(Lw) = \frac{L\mu}{L\sigma} = S$$
🔑
核心结论:Sharpe 决定配置比例,杠杆决定绝对风险敞口。加减杠杆不改变 Sharpe,只改变你在资本市场线(CML)上的位置。
⚠️
现实中杠杆影响 Sharpe 的原因:① 融资成本($r_f$ 上升);② 保证金/强平风险;③ 市场冲击成本随规模增大;④ 尾部风险不对称。
§ 03

与 t 统计量的关系

检验均值是否显著不为 0 的 t 统计量:

$$t = \frac{\bar{x}}{\hat{\sigma}/\sqrt{n}} = \sqrt{n} \cdot \hat{S}$$
含义与样本长度的关系
Sharpe $\hat{S}$单位风险收益(不含样本信息)❌ 无关
t 统计量均值显著性(含样本量信息)✅ 正比于 $\sqrt{n}$
💡
相同 Sharpe 的策略,样本越长 t 值越大,统计显著性越高。这是为什么 "策略本身好" 和 "统计上可以被置信" 是两件事。
§ 04

Sharpe 的标准误推导(Delta Method)

核心推导目标:求 $\text{Var}(\hat{S})$,其中 $\hat{S} = g(\bar{r}, s) = \bar{r}/s$。

1
准备各分量的方差。在 i.i.d. 正态假设 $r_i \sim \mathcal{N}(\mu, \sigma^2)$ 下: $$\bar{r} \sim \mathcal{N}\!\left(\mu, \frac{\sigma^2}{n}\right), \quad \text{Var}(\bar{r}) = \frac{\sigma^2}{n}$$ 由卡方性质 $\frac{(n-1)s^2}{\sigma^2} \sim \chi^2_{n-1}$,$\text{Var}(\chi^2_k) = 2k$,得 $$\text{Var}(s^2) = \frac{2\sigma^4}{n-1} \approx \frac{2\sigma^4}{n}$$ 一阶近似($h(v) = \sqrt{v}$ 在 $v = \sigma^2$ 处展开): $$\text{Var}(s) \approx \left(\frac{1}{2\sigma}\right)^2 \text{Var}(s^2) = \frac{\sigma^2}{2n}$$
2
计算 $\text{Cov}(\bar{r}, s)$。正态分布下样本均值与样本方差独立,故 $$\text{Cov}(\bar{r}, s^2) = 0 \implies \text{Cov}(\bar{r}, s) \approx 0$$
3
Delta Method 展开。$g(x,y) = x/y$,在 $(\mu, \sigma)$ 处一阶展开: $$\hat{S} - S \approx \frac{\partial g}{\partial x}\bigg|_{(\mu,\sigma)}(\bar{r}-\mu) + \frac{\partial g}{\partial y}\bigg|_{(\mu,\sigma)}(s-\sigma)$$ 其中 $\frac{\partial g}{\partial x} = \frac{1}{\sigma}$,$\frac{\partial g}{\partial y} = -\frac{\mu}{\sigma^2} = -\frac{S}{\sigma}$。
4
合并方差: $$\text{Var}(\hat{S}) \approx \frac{1}{\sigma^2}\cdot\frac{\sigma^2}{n} + \frac{S^2}{\sigma^2}\cdot\frac{\sigma^2}{2n} = \frac{1}{n} + \frac{S^2}{2n} = \frac{1 + \frac{1}{2}S^2}{n}$$
$$\boxed{\widehat{\text{SE}}(\hat{S}) \approx \sqrt{\frac{1 + \frac{1}{2}\hat{S}^2}{n-1}}}$$

直观分解

来源含义
$1$$\text{Var}(\bar{r})$均值估计的不确定性
$\frac{1}{2}S^2$$\text{Var}(s)$方差估计的不确定性(S 越高影响越大)
$n-1$自由度样本量越大 SE 越小
⚠️
自相关/异方差时:用 Newey–West HAC 标准误替换上式。
§ 05

显著性检验

检验 $H_0: S = 0$

$$t = \sqrt{n} \cdot \hat{S} \overset{\text{approx}}{\sim} t_{n-1}$$

大样本下用正态近似,双侧 95% CI:$\hat{S} \pm 1.96 \cdot \widehat{\text{SE}}(\hat{S})$。

检验 $H_0: S = S_0$(非中心 t)

在 i.i.d. 正态下,$\sqrt{n}\hat{S}$ 服从非中心 $t_{n-1}$,非中心参数 $\delta = \sqrt{n}S_0$。大样本时用 Delta Method 近似:

$$z = \frac{\hat{S} - S_0}{\widehat{\text{SE}}(\hat{S})} \overset{\text{approx}}{\sim} \mathcal{N}(0,1)$$
数值练习
$n = 252$,$\hat{S}_d = 0.2$(日度)。检验年化 Sharpe $> 0$:
$t = \sqrt{252} \times 0.2 \approx 3.17$,$p \approx 0.0015$(单侧显著)。
§ 06

负收益天数问题

高频面试题年化 Sharpe = 8,观察到连续 $N$ 天总收益为负,$N$ 多大才能拒绝 "$S_\text{ann}=8$"?

1
日度 Sharpe:$S_d = S_\text{ann}/\sqrt{252} = 8/\sqrt{252} \approx 0.504$,即 $\mu_d/\sigma_d \approx 0.5$。
2
$N$ 天总收益 $X_N = \sum_{t=1}^N r_t \sim \mathcal{N}(N\mu_d,\, N\sigma_d^2)$。
3
在 $H_0$ 下 $P(X_N < 0) = \Phi\!\left(-\frac{\mu_d \sqrt{N}}{\sigma_d}\right) = \Phi(-S_d\sqrt{N}) \leq \alpha$ $$\Rightarrow \quad N \geq \left(\frac{z_{1-\alpha}}{S_d}\right)^2$$
显著性 $\alpha$$z_{1-\alpha}$最小 $N$(天)近似
10%1.28$(1.28/0.504)^2 \approx 6.4$$\approx$ 7 天
5%1.645$(1.645/0.504)^2 \approx 10.7$$\approx$ 11 天
1%2.326$(2.326/0.504)^2 \approx 21.3$$\approx$ 22 天
0.5%2.576$(2.576/0.504)^2 \approx 26.1$$\approx$ 27 天
💡
年化 Sharpe=8 的策略,连续 22 天亏损才在 1% 显著性下可以拒绝。说明即使策略非常好,短期亏损也不足为奇——这正是统计置信与策略质量的区别。
📋
常用参考表:$\Phi(-1.64) = 0.05$,$\Phi(-1.96) = 0.025$,$\Phi(-2.33) = 0.01$,$\Phi(-2.58) = 0.005$。
§ 07

样本偏差修正

有限样本下 $\hat{S}$ 对真实 $S$ 有偏(正偏)。一阶近似:

$$\mathbb{E}[\hat{S}] \approx S\left(1 + \frac{1+S^2}{4(n-1)}\right)$$

实际中更常直接报告置信区间与检验,而非逐点校正。

§ 08

比较两策略 Sharpe

检验 $H_0: S_1 = S_2$,不能直接相减,需考虑两序列的协方差与自相关。

Jobson–Korkie (1981) + Memmel (2003) 修正

给出 $\text{Var}(\hat{S}_1 - \hat{S}_2)$ 的封闭近似,涉及三四阶矩,构造 z 统计量。

Ledoit–Wolf (2008)

更稳健的大样本检验,允许非正态、自相关。

🔑
面试要点:必须说明两策略的相关性会影响差异的显著性。同窗口观测需要协方差调整,不能用简单 z 检验。
§ 09

两策略组合的 Sharpe

策略 1:Sharpe $S_1$,vol $\sigma_1$,return $\mu_1 = S_1\sigma_1$。
策略 2:Sharpe $S_2$,vol $\sigma_2$,相关系数 $\rho$。权重 $w_1, w_2$,$w_1+w_2=1$。

组合期望
$\mu_p = w_1\mu_1 + w_2\mu_2 = w_1S_1\sigma_1 + w_2S_2\sigma_2$
组合方差
$\sigma_p^2 = w_1^2\sigma_1^2 + w_2^2\sigma_2^2 + 2w_1w_2\rho\sigma_1\sigma_2$
组合 Sharpe
$S_p = \mu_p / \sigma_p$

特殊情形:$\rho = 1$(完全正相关)

$$\sigma_p = |w_1\sigma_1 + w_2\sigma_2| \implies S_p = \frac{w_1\mu_1 + w_2\mu_2}{w_1\sigma_1 + w_2\sigma_2} \leq \max(S_1, S_2)$$

完全正相关时无分散化收益,Sharpe 最多等于较大者。

特殊情形:$\sigma_1 = \sigma_2$,$S_1 = S_2 = S$

$$S_p = \frac{S}{\sqrt{(1+\rho)/2}}, \quad \rho < 1 \text{ 时} \; S_p > S$$

关键面试题:10%/90% 混合

面试题现有 Sharpe=3 的策略。加入 10% 的新(不相关)策略,保持组合 Sharpe $\geq 3$,新策略的最低 Sharpe 是多少?

1
设新策略 Sharpe=$s$,vol=$\sigma_2$,旧策略 vol=$\sigma_1$,$\rho=0$。
目标:$S_p \geq 3$,即 $S_p^2 \geq 9$。
2
为简化,令 $\sigma_1 = \sigma_2 = \sigma$(volatility 相同,Sharpe 之比即 return 之比): $$S_p^2 = \frac{(0.9\mu_1 + 0.1\mu_2)^2}{(0.9)^2\sigma^2 + (0.1)^2\sigma^2} = \frac{(0.9\cdot3 + 0.1\cdot s)^2\sigma^2}{0.82\sigma^2}$$
3
要求 $S_p^2 \geq 9$: $$(0.9\cdot3 + 0.1\cdot s)^2 \geq 9 \times 0.82 = 7.38$$ $$0.27 + 0.1s \geq \sqrt{7.38} \approx 2.716$$ $$s \geq \frac{2.716 - 2.7}{0.1} \approx 0.16$$
$$\boxed{s_{\min} \approx 0.16}$$
💡
为什么答案远低于 3?分散化的威力。新策略与旧策略不相关,加入它不仅增加分子(期望收益),更重要的是分母(组合方差)的增幅被相关性为零所抑制。即使新策略本身很弱,不相关这一特性已经贡献了巨大的风险分散价值。
§ 10

最大 Sharpe 的最优权重

问题:$\max_w \dfrac{w^\top\mu}{\sqrt{w^\top\Sigma w}}$(含无风险资产时替换 $\mu \to \mu - r_f\mathbf{1}$)。

推导(拉格朗日法)

1
同质性:Sharpe 是 $w$ 的零次齐次函数,固定分母为 1 等价:$\max_w\; w^\top\mu$ s.t. $w^\top\Sigma w = 1$。
2
拉格朗日:$\mathcal{L} = w^\top\mu - \frac{\lambda}{2}(w^\top\Sigma w - 1)$。FOC:$\mu - \lambda\Sigma w = 0 \Rightarrow w \propto \Sigma^{-1}\mu$。
3
归一化($\mathbf{1}^\top w = 1$):$w^* = \dfrac{\Sigma^{-1}\mu}{\mathbf{1}^\top\Sigma^{-1}\mu}$。
$$w_{\text{tan}} = \frac{\Sigma^{-1}(\mu - r_f\mathbf{1})}{\mathbf{1}^\top\Sigma^{-1}(\mu - r_f\mathbf{1})}, \qquad S_{\max} = \sqrt{(\mu-r_f\mathbf{1})^\top\Sigma^{-1}(\mu-r_f\mathbf{1})}$$

两策略(归一化 vol=1)的闭式解

设 $\sigma_1 = \sigma_2 = 1$,相关矩阵 $C = \begin{pmatrix}1&\rho\\\rho&1\end{pmatrix}$,$s = (S_1, S_2)^\top$,则

$$S_{\max} = \sqrt{s^\top C^{-1} s} = \sqrt{\frac{S_1^2 + S_2^2 - 2\rho S_1 S_2}{1-\rho^2}}$$
§ 11

等相关 $N$ 因子等权组合

经典闭式解设 $N$ 个因子,每因子 Sharpe $= S$,方差 $= \sigma^2$,两两相关 $= \rho$,等权 $w_i = 1/N$。

推导

$$\sigma_p^2 = \frac{1}{N^2}\left(N\sigma^2 + N(N-1)\rho\sigma^2\right) = \frac{\sigma^2\left(1+(N-1)\rho\right)}{N}$$
$$\mu_p = \frac{1}{N} \cdot N\mu = \mu = S\sigma$$
$$\boxed{S_{\text{combo}} = S \cdot \sqrt{\frac{N}{1+(N-1)\rho}}}$$

等权即最优权

等 Sharpe + 等方差 + 等相关条件下,$w^* \propto \Sigma^{-1}\mu \propto \Sigma^{-1}\mathbf{1} \propto \mathbf{1}$(等相关矩阵的逆满足 $R^{-1}\mathbf{1} \propto \mathbf{1}$),因此等权就是切线组合。

$N=16$,$S=1$ 时的数值

$$S_{\text{combo}} = \frac{4}{\sqrt{1+15\rho}}$$
$\rho$$S_{\text{combo}}$解释
04.00完全独立,信息可加
0.22.00中等相关
0.51.37高相关,收益大幅衰减
1.01.00完全冗余,无分散化
§ 12

多策略 Sharpe 分配逻辑

Case 1:N 个独立策略,Sharpe 不同

最大化组合 Sharpe $S_p = \dfrac{\sum w_i\mu_i}{\sqrt{\sum w_i^2\sigma_i^2}}$(独立时协方差为零)。

由 Cauchy–Schwarz 不等式:最优权重 $w_i \propto \mu_i/\sigma_i^2 = S_i/\sigma_i$。若所有策略 vol 相同,则 $w_i \propto S_i$(按 Sharpe 分配)。

$$S_p^2 = \sum_i S_i^2 \quad \text{(独立时)}$$

Case 2:N 个独立策略,Sharpe 相同 $= S$

$$S_p = S\sqrt{N}$$

Case 3:某策略 Sharpe $= 0$

🚫
Sharpe = 0 的策略永远不应该分配资金。$\mu_i = 0$,加入不增加分子,只增加分母(方差),纯负贡献。
§ 13

分散化的直觉

📐
分散化的本质是向量加法。把每个策略的 Sharpe 想象成向量空间里的一个向量。不相关的策略向量相互垂直——正交方向上的"信号"可以无损叠加。

数学上:$S_p^2 = \sum S_i^2$(独立时),信号平方可加,而非信号本身。这就是为什么两个 Sharpe=1 的不相关策略合并后 Sharpe=$\sqrt{2}$,而非 2。

相关性是"Sharpe 杀手"

从公式 $S_{\text{combo}} = S\sqrt{\frac{N}{1+(N-1)\rho}}$ 可以看出:

  • $\rho \to 0$:$S_{\text{combo}} \to S\sqrt{N}$(最大分散化)
  • $\rho \to 1$:$S_{\text{combo}} \to S$(完全冗余,无提升)
  • 相关性每上升 0.1,分散化收益大幅缩水
🔑
"多做一个 Sharpe 高的策略"远不如"找一个与现有策略不相关的策略"。低相关性比高 Sharpe 更珍贵。

§ 14

均值-方差框架:固定目标收益的最小方差组合

问题设定

$$\min_w\; w^\top\Sigma w \quad \text{s.t.}\quad \mathbf{1}^\top w = 1,\; \mu^\top w = \mu^*$$

拉格朗日推导

定义四个标量:

$$A = \mathbf{1}^\top\Sigma^{-1}\mathbf{1}, \quad B = \mathbf{1}^\top\Sigma^{-1}\mu, \quad C = \mu^\top\Sigma^{-1}\mu, \quad D = AC - B^2 > 0$$
$$w(\mu^*) = \Sigma^{-1}\!\left(\frac{C-B\mu^*}{D}\mathbf{1} + \frac{A\mu^*-B}{D}\mu\right)$$

有效前沿方程

$$\sigma_p^2(\mu^*) = \frac{A{\mu^*}^2 - 2B\mu^* + C}{D}$$

在 $(\sigma, \mu)$ 平面是一条向右开口的双曲线,其上半支为有效前沿。

§ 15

全局最小方差(GMV)组合

$$\min_w\; w^\top\Sigma w \quad \text{s.t.}\; \mathbf{1}^\top w = 1$$

FOC:$2\Sigma w - \lambda\mathbf{1} = 0 \Rightarrow w \propto \Sigma^{-1}\mathbf{1}$,归一化得:

$$w_{\text{GMV}} = \frac{\Sigma^{-1}\mathbf{1}}{A}, \qquad \mu_{\text{GMV}} = \frac{B}{A}, \qquad \sigma^2_{\text{GMV}} = \frac{1}{A}$$
§ 16

切线组合与资本市场线(CML)

$$w_{\text{tan}} = \frac{\Sigma^{-1}(\mu-r_f\mathbf{1})}{\mathbf{1}^\top\Sigma^{-1}(\mu-r_f\mathbf{1})}, \qquad S_{\max} = \sqrt{(\mu-r_f\mathbf{1})^\top\Sigma^{-1}(\mu-r_f\mathbf{1})}$$

资本市场线(CML)

$$\mu_p = r_f + S_{\max} \cdot \sigma_p$$

均值-方差效用最优杠杆

效用函数 $U = \mu_p - \frac{\gamma}{2}\sigma_p^2$,最优杠杆(切线组合的配置比例):

$$\alpha^* = \frac{\mu_{\text{tan}} - r_f}{\gamma\,\sigma^2_{\text{tan}}}$$
§ 17

两基金分离定理

含无风险资产

$$\text{最优组合} = \alpha \cdot w_{\text{tan}} + (1-\alpha) \cdot \text{无风险资产}$$

$\alpha$ 由风险厌恶系数 $\gamma$ 决定,所有投资者持有相同的切线组合(仅比例不同)。

仅含风险资产(无 $r_f$)

任何有效前沿上的组合都可表示为两个有效组合的线性组合。常用基:GMV 组合 + 任意另一有效组合。

§ 18

风险贡献与 Euler 分解

组合波动的 Euler 分解($\sigma_p$ 是 $w$ 的一次齐次函数):

$$\sigma_p = \sum_{i=1}^n w_i \cdot \frac{(\Sigma w)_i}{\sigma_p}$$
$$RC_i = w_i \cdot \frac{(\Sigma w)_i}{\sigma_p}, \qquad \sum_i RC_i = \sigma_p$$

风险平价(Risk Parity):$RC_1 = RC_2 = \cdots = RC_n$,即每个资产贡献等额风险。

💡
Risk parity ≠ 等权重。High-vol 资产需要更小的名义权重才能达到等风险贡献。实务中常用迭代法或二次规划求解。

§ 19

自相关下的年化 Sharpe

若收益存在序列相关,年化方差应使用 Newey–West 型估计:

$$\widehat{\sigma^2_{\text{ann}}} = \hat{\gamma}(0) + 2\sum_{k=1}^{A-1}\left(1 - \frac{k}{A}\right)\hat{\gamma}(k)$$

其中 $\hat{\gamma}(k) = \frac{1}{n}\sum_{t=k+1}^n (x_t - \bar{x})(x_{t-k} - \bar{x})$ 是第 $k$ 阶样本自协方差。

HAC 标准误检验

$$t_{\text{HAC}} = \frac{\bar{x}}{\widehat{\text{SE}}_{\text{HAC}}(\bar{x})}$$
🔑
对于趋势跟踪、均值回归等存在序列相关的策略,必须用 HAC,否则会高估年化 Sharpe 的显著性。
§ 20

交易成本对 Sharpe 的影响

设单位换手成本 $c$,换手率(turnover)$\tau$,则期望收益约减为 $\mu' = \mu - c\tau$。

$$S' \approx \frac{\mu - c\tau}{\sigma} = S - \frac{c\tau}{\sigma}$$

含交易成本的组合优化

原始目标:$\max_w \mu^\top w - \frac{\lambda}{2}w^\top\Sigma w$,加入成本惩罚:

$$\max_{w_t}\; \mu^\top w_t - \frac{\lambda}{2}w_t^\top\Sigma w_t - \gamma\|w_t - w_{t-1}\|_1$$

或二次成本版本($L_2$ 惩罚):$-\frac{\gamma}{2}\|w_t - w_{t-1}\|_2^2$。

降低换手的实务方法

方法思路
显式惩罚在目标函数中加 $c^\top|\Delta w|$
换手约束$\|w_t - w_{t-1}\|_1 \leq \tau_{\max}$
信号平滑$w_t = (1-\rho)w_{t-1} + \rho\tilde{w}_t$,$\rho \in (0,1)$
分层执行控制结合 Almgren-Chriss 冲击成本模型
§ 21

多重检验与数据挖矿偏差

若同时测试 $m$ 个策略,取最优的 Sharpe 存在选择偏差。校正方法:

方法说明
Bonferroni / Holm调整 p 值阈值为 $\alpha/m$(保守)
Benjamini–Hochberg控制 FDR(假发现率),更宽松
White's Reality CheckBootstrap 构造零分布
SPA TestSuperior Predictive Ability
样本外验证最根本:在独立测试集上验证
⚠️
Harvey, Liu & Zhu (2016) 建议:对已发表的量化因子,显著性门槛应从 $t > 2$ 提高到 $t > 3$,以应对数据挖矿膨胀。
§ 22

面试题库速查

Q1. Sharpe Ratio 定义与年化;有自相关还能用 √A 年化吗?

$\hat{S} = \bar{x}/\hat{\sigma}$。i.i.d. 时年化 $S_\text{ann} = \sqrt{A} \cdot S_\text{per}$。
有自相关时不能直接乘 $\sqrt{A}$——需要用 HAC 估计年化方差:$\hat{\sigma}^2_\text{ann} = \hat{\gamma}(0) + 2\sum_{k=1}^{A-1}(1-k/A)\hat{\gamma}(k)$。

Q2. Sharpe 的标准误是多少?怎么推?

Delta Method:$\hat{S} = g(\bar{r}, s) = \bar{r}/s$,展开得

$$\text{SE}(\hat{S}) \approx \sqrt{\frac{1+\frac{1}{2}S^2}{n-1}}$$

"1" 来自均值不确定性,"$\frac{1}{2}S^2$" 来自方差估计(卡方分布)的不确定性。有自相关时用 HAC。

Q3. 年化 Sharpe=8,连续多少天亏损才能拒绝?

日度 $S_d = 8/\sqrt{252} \approx 0.504$。$N$ 天总收益 $\sim \mathcal{N}(N\mu_d, N\sigma_d^2)$。

$$N \geq \left(\frac{z_{1-\alpha}}{S_d}\right)^2$$

$\alpha=5\% \Rightarrow N \approx 11$ 天;$\alpha=1\% \Rightarrow N \approx 22$ 天。

Q4. 加杠杆 Sharpe 会变吗?

理论上不变:$S(Lw) = L\mu/(L\sigma) = S$。现实中因融资成本、保证金约束、冲击成本随规模增加,实际 Sharpe 会下降。

Q5. 两个独立、Sharpe=1 的策略等权组合,Sharpe 是多少?

等 vol、$\rho=0$:$S_p = S\sqrt{N/(1+(N-1)\rho)} = 1 \times \sqrt{2} \approx 1.414$。

或者用 $S_p^2 = S_1^2 + S_2^2$(独立时):$S_p = \sqrt{1+1} = \sqrt{2}$。

Q6. 最大 Sharpe 的权重怎么推?

同质性固定分母,拉格朗日得 $w^* \propto \Sigma^{-1}(\mu - r_f\mathbf{1})$,归一化得切线组合。$S_\max = \sqrt{(\mu-r_f\mathbf{1})^\top\Sigma^{-1}(\mu-r_f\mathbf{1})}$。

Q7. 16 个独立等 Sharpe=1 的因子,组合 Sharpe?

$\rho=0$:$S_p = 1 \times \sqrt{16} = 4$。有相关时:$S_p = 4/\sqrt{1+15\rho}$。

Q8. Sharpe=0 的策略应该配多少资金?

。$\mu_i = 0$,加入不增加组合期望收益(分子),只增加方差(分母),对 Sharpe 纯负贡献。$w^* = 0$。

Q9. 现有 Sharpe=3,加入 10% 不相关新策略保持 Sharpe≥3,最低 Sharpe 是多少?

答案约 $0.16$。等 vol 假设下:$(0.9 \times 3 + 0.1 \times s)^2 \geq 9 \times (0.81 + 0.01) = 7.38$,解得 $s \geq 0.16$。远低于 3,体现分散化带来的巨大价值:不相关性本身就是 alpha。

Q10. 信息比率(IR)与 Sharpe 有什么区别?

$\text{IR} = \mathbb{E}[a]/\sigma(a)$,$a_t = r_t - r_{\text{benchmark},t}$ 是主动收益。Sharpe 是超额(vs 无风险利率)收益的 IR。若基准是无风险利率,IR=Sharpe。主动管理用 IR,绝对收益策略用 Sharpe。

Q11. 相关性如何影响组合 Sharpe?直觉?

$S_p^2 = (S_1^2 + S_2^2 - 2\rho S_1 S_2)/(1-\rho^2)$(等 vol 下)。$\rho \downarrow \Rightarrow S_p \uparrow$。

直觉:正交信号可以无损叠加(向量加法)。相关信号在同方向上"浪费",噪声重叠而信号未增加。

Q12. 有自相关的策略如何正确计算和检验年化 Sharpe?

① 用 HAC(Newey–West)估计 $\bar{x}$ 的标准误;② 年化方差用自协方差加权求和;③ $t_\text{HAC} = \bar{x}/\widehat{\text{SE}}_\text{HAC}$;④ 报告时注明带宽选择方法(如 Bartlett kernel,带宽 $\sim n^{1/5}$)。

Q13. 序列一半为 0、一半服从 (μ,σ²),删掉所有 0 后 Sharpe 如何变化?

设完整序列共 $2n$ 个点($n$ 个 0,$n$ 个非零)。
完整序列均值:$\bar{x}_{\text{full}} = \mu/2$。
完整序列方差(全方差公式):$\sigma^2_{\text{full}} = \sigma^2/2 + \mu^2/4$。
故 $S_{\text{full}} = \dfrac{\mu/2}{\sqrt{\sigma^2/2 + \mu^2/4}}$。
删零后:$S_{\text{trim}} = \mu/\sigma$。
比值 $S_{\text{trim}}/S_{\text{full}} = \sqrt{2 + S_{\text{trim}}^2/2} > 1$,删零后 Sharpe 严格提升

直觉:0 收益贡献了分子(期望)的"稀释",但同时拉低了分母(波动);稀释效应主导,净效果是 Sharpe 下降——反过来删掉 0 就是 Sharpe 上升。详细推导见 §23。

Q14. 非正态收益下怎么修正 Sharpe?偏度/峰度的影响方向?

Adjusted Sharpe(Pezier & White 2006):$S^* = S \cdot \left[1 + \dfrac{\hat{\gamma}_1}{6}S - \dfrac{\hat{\gamma}_2-3}{24}S^2\right]$,其中 $\hat\gamma_1$ 为偏度,$\hat\gamma_2$ 为峰度。
负偏度(左肥尾,如卖期权)→ $S^*$ 低于 $S$;超峰度(fat tails)→ $S^*$ 进一步降低。

Q15. Probabilistic Sharpe Ratio (PSR) 是什么?

$\text{PSR}(S^*) = \Phi\!\left(\dfrac{(\hat{S}-S^*)\sqrt{n-1}}{\sqrt{1 - \hat\gamma_1\hat{S} + \frac{\hat\gamma_2-1}{4}\hat{S}^2}}\right)$,即 $P(\text{真实 }S > S^*)$。纳入了有限样本、偏度、峰度对估计不确定性的影响,比单纯的 $t$ 检验更全面。

Q16. Kelly criterion 与 Sharpe 有什么关系?

连续时间 Kelly(对数效用):$f^* = \mu/\sigma^2 = S/\sigma$(fraction of wealth)。
Sharpe 越高,Kelly 仓位越大;vol 越高,Kelly 仓位越小。
若对数收益 $\mu$ 已超额(扣 $r_f$),则 $f^* = S_{\text{ann}}/\sigma_{\text{ann}}$(年化口径一致)。
实务中常取 half-Kelly 以控制回撤。

Q17. Sortino / Calmar 与 Sharpe 的区别及适用场景?

Sortino:分母换成下行标准差 $\sigma_d$(只计负收益的波动),$\text{Sortino} = \mu/\sigma_d \geq \text{Sharpe}$。适合收益正偏、收益对称性差的策略(如趋势跟踪)。
Calmar:$\text{Calmar} = \mu_\text{ann}/\text{MaxDD}$,用最大回撤代替波动率,适合对回撤敏感的 CTA/hedge fund 投资者。
Sharpe 的优点:数学性质好(均值-方差框架闭式),统计推断成熟,行业通用。

§ 23

稀疏序列与零收益:全方差公式推导

面试题序列共 $2n$ 个观测:$n$ 个为 0,另外 $n$ 个 i.i.d. $\sim (\mu, \sigma^2)$,$\mu > 0$。
问:删掉所有 0 后,Sharpe 如何变化?请用全方差公式推导。

Step 1:完整序列的矩

令 $G$ 为组别指示变量,$G=1$(概率 $1/2$)对应非零组,$G=0$ 对应零组。

$$\bar{x}_{\text{full}} = \frac{n\mu + n\cdot 0}{2n} = \frac{\mu}{2}$$

Step 2:全方差公式(Law of Total Variance)

$$\text{Var}(X) = \underbrace{\mathbb{E}[\text{Var}(X\mid G)]}_{\text{组内方差的均值}} + \underbrace{\text{Var}(\mathbb{E}[X\mid G])}_{\text{组间均值的方差}}$$
1
组内方差均值:$G=1$ 时 $\text{Var}=\sigma^2$,$G=0$ 时 $\text{Var}=0$。 $$\mathbb{E}[\text{Var}(X\mid G)] = \frac{1}{2}\sigma^2 + \frac{1}{2}\cdot 0 = \frac{\sigma^2}{2}$$
2
组间均值方差:$\mathbb{E}[X\mid G=1]=\mu$,$\mathbb{E}[X\mid G=0]=0$,各以概率 $1/2$ 取值。 $$\text{Var}(\mathbb{E}[X\mid G]) = \frac{1}{2}\!\left(\mu - \frac{\mu}{2}\right)^{\!2} + \frac{1}{2}\!\left(0 - \frac{\mu}{2}\right)^{\!2} = \frac{\mu^2}{4}$$
3
合并: $$\sigma^2_{\text{full}} = \frac{\sigma^2}{2} + \frac{\mu^2}{4}$$

Step 3:两种 Sharpe 对比

完整序列
$S_{\text{full}} = \dfrac{\mu/2}{\sqrt{\sigma^2/2 + \mu^2/4}}$
删零后
$S_{\text{trim}} = \dfrac{\mu}{\sigma}$

Step 4:比值

$$\frac{S_{\text{trim}}}{S_{\text{full}}} = \frac{\mu/\sigma}{\dfrac{\mu/2}{\sqrt{\sigma^2/2+\mu^2/4}}} = \frac{2\sqrt{\sigma^2/2 + \mu^2/4}}{\sigma} = \sqrt{\frac{2\sigma^2/2 + \mu^2/2}{\sigma^2/2 \cdot 2}} = \sqrt{2 + \frac{\mu^2}{2\sigma^2}}$$
$$\boxed{\frac{S_{\text{trim}}}{S_{\text{full}}} = \sqrt{2 + \frac{S_{\text{trim}}^2}{2}} > 1}$$
💡
直觉:插入 0 同时稀释了均值(分子 $\times 1/2$)和方差(分母比例减小)。但对分子的稀释比例大于对分母的稀释——均值被 dilute 了 $1/2$,而 std 仅被 dilute 了不到 $1/2$(因为额外引入了跨组均值方差 $\mu^2/4$)。因此净效果是完整序列的 Sharpe 低于删零后的 Sharpe。
🔑
实务含义:如果策略有大量不交易日(返回 0),用全样本计算的 Sharpe 会被低估。应使用交易日 Sharpe,或明确说明年化因子使用的是交易日频率。
§ 24

非正态收益下的修正 Sharpe

标准 Sharpe 假设收益正态,忽略了偏度($\gamma_1$)和超额峰度($\gamma_2 - 3$)对风险的影响。

Adjusted Sharpe Ratio(Pezier & White, 2006)

$$S^* = \hat{S} \cdot \left[1 + \frac{\hat\gamma_1}{6}\hat{S} - \frac{\hat\gamma_2 - 3}{24}\hat{S}^2\right]$$
情形$\gamma_1$$\gamma_2$$S^*$ vs $S$典型策略
左偏 + 厚尾$< 0$$> 3$$S^* < S$(高估风险)卖期权、信用策略
右偏 + 薄尾$> 0$$< 3$$S^* > S$(低估风险奖励)趋势跟踪、动量
正态$= 0$$= 3$$S^* = S$
⚠️
卖期权策略的 Sharpe 虚高——极端亏损($\gamma_1 \ll 0$,$\gamma_2 \gg 3$)使 Adjusted Sharpe 大幅低于原始 Sharpe,这正是 2008 年大量 "高 Sharpe 策略" 爆仓的根源。

Sortino Ratio(下行风险)

$$\text{Sortino} = \frac{\mu - r_f}{\sigma_{\text{downside}}}, \qquad \sigma_{\text{downside}} = \sqrt{\mathbb{E}[\min(r-r_f,0)^2]}$$

对于对称正态分布,$\sigma_{\text{downside}} = \sigma/\sqrt{2}$,Sortino $= \sqrt{2}\cdot$Sharpe。非对称时 Sortino 比 Sharpe 更能区分策略质量。

§ 25

Probabilistic & Deflated Sharpe Ratio

Probabilistic Sharpe Ratio(PSR)

Bailey & López de Prado (2012)。给定基准 Sharpe $S^*$,估计真实 Sharpe 超过 $S^*$ 的概率:

$$\text{PSR}(S^*) = \Phi\!\left(\frac{(\hat{S}-S^*)\sqrt{n-1}}{\sqrt{1 - \hat\gamma_1\hat{S} + \dfrac{\hat\gamma_2-1}{4}\hat{S}^2}}\right)$$

分母在标准误 $\sqrt{(1+\hat S^2/2)/n}$ 的基础上,进一步引入偏度项($-\hat\gamma_1\hat S$)和峰度项($(\hat\gamma_2-1)/4\cdot\hat S^2$)的修正。

💡
PSR 统一了 Sharpe 估计、样本量、非正态三个维度的不确定性,给出"这个策略真的有正 Sharpe"的直接概率表述,比单纯的 t 检验更直观。

Deflated Sharpe Ratio(DSR)

当从 $T$ 个试验中选最优策略时,存在选择偏差(multiple testing inflation)。DSR 以多重检验调整后的 $S^*$ 代入 PSR:

$$S^*_{\text{DSR}} \approx \sqrt{\frac{(1-\hat\gamma_1+\hat\gamma_2/4)\hat S^2_{\max}}{n-1}} \cdot \left[(1-\gamma)\Phi^{-1}\!\left(1-\frac{\alpha}{T}\right) + \gamma\Phi^{-1}\!\left(1-\frac{\alpha}{T}\right)\right]$$

简化理解:$S^*$ 随试验数 $T$ 的增加而提高(Bonferroni 精神)。回测越多,需要更高的 OOS Sharpe 才算真实。

指标解决的问题核心输入
标准 SE样本量不确定性$n$, $\hat S$
PSR+非正态(偏度/峰度)$n$, $\hat S$, $\gamma_1$, $\gamma_2$
DSR+多重回测选择偏差PSR 输入 + 试验次数 $T$
§ 26

Kelly Criterion 与 Sharpe 的关系

连续时间 Kelly(对数效用最优仓位)

设策略超额收益 $dX = \mu\,dt + \sigma\,dW$,最大化对数财富增长率:

$$g(f) = f\mu - \frac{f^2\sigma^2}{2} \implies f^* = \frac{\mu}{\sigma^2} = \frac{S}{\sigma}$$

其中 $S = \mu/\sigma$ 为 Sharpe。最优增长率(Kelly growth rate):

$$g^* = g(f^*) = \frac{\mu^2}{2\sigma^2} = \frac{S^2}{2}$$
🔑
核心关系:最优对数增长率 $= S^2/2$。Sharpe 越高,Kelly 允许的仓位越大($f^* \propto S$),且长期财富复利增长越快($g^* \propto S^2$)。这是为什么 Sharpe 是量化策略质量的核心衡量——它直接决定了资本的理论复利上限。

多策略 Kelly(向量扩展)

$N$ 个策略,超额收益向量 $\mu$,协方差矩阵 $\Sigma$:

$$f^* = \Sigma^{-1}\mu \propto w_{\text{tan}}, \qquad g^* = \frac{\mu^\top\Sigma^{-1}\mu}{2} = \frac{S_{\max}^2}{2}$$

多策略最优增长率等于切线组合最大 Sharpe 的平方的一半——分散化提高 $S_{\max}$,直接以平方速率提升复利增长。

实务:Half-Kelly

分数预期增长率最大回撤特征实务建议
Full Kelly ($f^*$)最大 $g^*$极端,历史最大回撤 $\approx 100\%$理论最优,实操过激
Half Kelly ($f^*/2$)$3g^*/4$回撤减半(近似)行业实践首选
Quarter Kelly$7g^*/16$更温和极保守机构
⚠️
参数估计误差($\hat\mu$, $\hat\Sigma$)会使真实 Kelly 仓位偏离最优,过度加仓导致破产。实务中参数不确定性本身就是使用 Half-Kelly 的最重要理由。
附录

核心公式速查表

公式表达式
样本 Sharpe$\hat{S} = \bar{x}/\hat{\sigma}$
年化(i.i.d.)$S_\text{ann} = \sqrt{A} \cdot S_\text{per}$
标准误(SE)$\text{SE}(\hat{S}) \approx \sqrt{(1+\frac{1}{2}S^2)/(n-1)}$
t 统计量$t = \sqrt{n}\,\hat{S}$
负收益天数阈值$N \geq (z_{1-\alpha}/S_d)^2$
切线组合权重$w^* \propto \Sigma^{-1}(\mu - r_f\mathbf{1})$
最大 Sharpe$S_\max = \sqrt{(\mu-r_f\mathbf{1})^\top\Sigma^{-1}(\mu-r_f\mathbf{1})}$
两策略 Sharpe(等 vol)$S_p = \sqrt{(S_1^2+S_2^2-2\rho S_1S_2)/(1-\rho^2)}$
等相关 N 因子$S_p = S\sqrt{N/(1+(N-1)\rho)}$
独立时$S_p^2 = \sum S_i^2$
GMV 权重$w_\text{GMV} = \Sigma^{-1}\mathbf{1}/A$
有效前沿$\sigma_p^2 = (A\mu^{*2} - 2B\mu^* + C)/D$
CML$\mu_p = r_f + S_\max\,\sigma_p$
风险贡献$RC_i = w_i(\Sigma w)_i/\sigma_p$
TC 修正$S' \approx S - c\tau/\sigma$
稀疏序列(半零)$S_{\text{full}} = \dfrac{\mu/2}{\sqrt{\sigma^2/2+\mu^2/4}}$,$S_{\text{trim}}/S_{\text{full}}=\sqrt{2+S_{\text{trim}}^2/2}$
Adjusted Sharpe$S^* = S[1+(\gamma_1/6)S - (\gamma_2-3)/24\cdot S^2]$
PSR$\Phi\!\left(\frac{(\hat S-S^*)\sqrt{n-1}}{\sqrt{1-\gamma_1\hat S+(\gamma_2-1)/4\cdot\hat S^2}}\right)$
Kelly 最优仓位$f^* = \mu/\sigma^2 = S/\sigma$
Kelly 最优增长率$g^* = S^2/2$
多策略 Kelly 增长率$g^* = S_{\max}^2/2$