定义与年化
设超额收益序列 $x_t = r_t - r_{f,t}$,样本均值 $\bar{x}$,样本标准差 $\hat{\sigma}$,样本 Sharpe 定义为:
年化换算(i.i.d.)
若 $x_t$ 独立同分布,每期与年之间有因子 $A$(如日度 $A=252$,月度 $A=12$,周度 $A=52$):
各频率年化因子
| 频率 | 年化因子 $A$ | 年化 Sharpe |
|---|---|---|
| 日度 | 252 | $\sqrt{252} \approx 15.87 \times S_d$ |
| 周度 | 52 | $\sqrt{52} \approx 7.21 \times S_w$ |
| 月度 | 12 | $\sqrt{12} \approx 3.46 \times S_m$ |
杠杆不变性
若对策略加 $L$ 倍杠杆(无借贷成本、无交易成本):
与 t 统计量的关系
检验均值是否显著不为 0 的 t 统计量:
| 量 | 含义 | 与样本长度的关系 |
|---|---|---|
| Sharpe $\hat{S}$ | 单位风险收益(不含样本信息) | ❌ 无关 |
| t 统计量 | 均值显著性(含样本量信息) | ✅ 正比于 $\sqrt{n}$ |
Sharpe 的标准误推导(Delta Method)
核心推导目标:求 $\text{Var}(\hat{S})$,其中 $\hat{S} = g(\bar{r}, s) = \bar{r}/s$。
直观分解
| 项 | 来源 | 含义 |
|---|---|---|
| $1$ | $\text{Var}(\bar{r})$ | 均值估计的不确定性 |
| $\frac{1}{2}S^2$ | $\text{Var}(s)$ | 方差估计的不确定性(S 越高影响越大) |
| $n-1$ | 自由度 | 样本量越大 SE 越小 |
显著性检验
检验 $H_0: S = 0$
大样本下用正态近似,双侧 95% CI:$\hat{S} \pm 1.96 \cdot \widehat{\text{SE}}(\hat{S})$。
检验 $H_0: S = S_0$(非中心 t)
在 i.i.d. 正态下,$\sqrt{n}\hat{S}$ 服从非中心 $t_{n-1}$,非中心参数 $\delta = \sqrt{n}S_0$。大样本时用 Delta Method 近似:
$t = \sqrt{252} \times 0.2 \approx 3.17$,$p \approx 0.0015$(单侧显著)。
负收益天数问题
高频面试题年化 Sharpe = 8,观察到连续 $N$ 天总收益为负,$N$ 多大才能拒绝 "$S_\text{ann}=8$"?
| 显著性 $\alpha$ | $z_{1-\alpha}$ | 最小 $N$(天) | 近似 |
|---|---|---|---|
| 10% | 1.28 | $(1.28/0.504)^2 \approx 6.4$ | $\approx$ 7 天 |
| 5% | 1.645 | $(1.645/0.504)^2 \approx 10.7$ | $\approx$ 11 天 |
| 1% | 2.326 | $(2.326/0.504)^2 \approx 21.3$ | $\approx$ 22 天 |
| 0.5% | 2.576 | $(2.576/0.504)^2 \approx 26.1$ | $\approx$ 27 天 |
样本偏差修正
有限样本下 $\hat{S}$ 对真实 $S$ 有偏(正偏)。一阶近似:
实际中更常直接报告置信区间与检验,而非逐点校正。
比较两策略 Sharpe
检验 $H_0: S_1 = S_2$,不能直接相减,需考虑两序列的协方差与自相关。
Jobson–Korkie (1981) + Memmel (2003) 修正
给出 $\text{Var}(\hat{S}_1 - \hat{S}_2)$ 的封闭近似,涉及三四阶矩,构造 z 统计量。
Ledoit–Wolf (2008)
更稳健的大样本检验,允许非正态、自相关。
两策略组合的 Sharpe
策略 1:Sharpe $S_1$,vol $\sigma_1$,return $\mu_1 = S_1\sigma_1$。
策略 2:Sharpe $S_2$,vol $\sigma_2$,相关系数 $\rho$。权重 $w_1, w_2$,$w_1+w_2=1$。
特殊情形:$\rho = 1$(完全正相关)
完全正相关时无分散化收益,Sharpe 最多等于较大者。
特殊情形:$\sigma_1 = \sigma_2$,$S_1 = S_2 = S$
关键面试题:10%/90% 混合
面试题现有 Sharpe=3 的策略。加入 10% 的新(不相关)策略,保持组合 Sharpe $\geq 3$,新策略的最低 Sharpe 是多少?
目标:$S_p \geq 3$,即 $S_p^2 \geq 9$。
最大 Sharpe 的最优权重
问题:$\max_w \dfrac{w^\top\mu}{\sqrt{w^\top\Sigma w}}$(含无风险资产时替换 $\mu \to \mu - r_f\mathbf{1}$)。
推导(拉格朗日法)
两策略(归一化 vol=1)的闭式解
设 $\sigma_1 = \sigma_2 = 1$,相关矩阵 $C = \begin{pmatrix}1&\rho\\\rho&1\end{pmatrix}$,$s = (S_1, S_2)^\top$,则
等相关 $N$ 因子等权组合
经典闭式解设 $N$ 个因子,每因子 Sharpe $= S$,方差 $= \sigma^2$,两两相关 $= \rho$,等权 $w_i = 1/N$。
推导
等权即最优权
等 Sharpe + 等方差 + 等相关条件下,$w^* \propto \Sigma^{-1}\mu \propto \Sigma^{-1}\mathbf{1} \propto \mathbf{1}$(等相关矩阵的逆满足 $R^{-1}\mathbf{1} \propto \mathbf{1}$),因此等权就是切线组合。
$N=16$,$S=1$ 时的数值
| $\rho$ | $S_{\text{combo}}$ | 解释 |
|---|---|---|
| 0 | 4.00 | 完全独立,信息可加 |
| 0.2 | 2.00 | 中等相关 |
| 0.5 | 1.37 | 高相关,收益大幅衰减 |
| 1.0 | 1.00 | 完全冗余,无分散化 |
多策略 Sharpe 分配逻辑
Case 1:N 个独立策略,Sharpe 不同
最大化组合 Sharpe $S_p = \dfrac{\sum w_i\mu_i}{\sqrt{\sum w_i^2\sigma_i^2}}$(独立时协方差为零)。
由 Cauchy–Schwarz 不等式:最优权重 $w_i \propto \mu_i/\sigma_i^2 = S_i/\sigma_i$。若所有策略 vol 相同,则 $w_i \propto S_i$(按 Sharpe 分配)。
Case 2:N 个独立策略,Sharpe 相同 $= S$
Case 3:某策略 Sharpe $= 0$
分散化的直觉
数学上:$S_p^2 = \sum S_i^2$(独立时),信号平方可加,而非信号本身。这就是为什么两个 Sharpe=1 的不相关策略合并后 Sharpe=$\sqrt{2}$,而非 2。
相关性是"Sharpe 杀手"
从公式 $S_{\text{combo}} = S\sqrt{\frac{N}{1+(N-1)\rho}}$ 可以看出:
- $\rho \to 0$:$S_{\text{combo}} \to S\sqrt{N}$(最大分散化)
- $\rho \to 1$:$S_{\text{combo}} \to S$(完全冗余,无提升)
- 相关性每上升 0.1,分散化收益大幅缩水
均值-方差框架:固定目标收益的最小方差组合
问题设定
拉格朗日推导
定义四个标量:
有效前沿方程
在 $(\sigma, \mu)$ 平面是一条向右开口的双曲线,其上半支为有效前沿。
全局最小方差(GMV)组合
FOC:$2\Sigma w - \lambda\mathbf{1} = 0 \Rightarrow w \propto \Sigma^{-1}\mathbf{1}$,归一化得:
切线组合与资本市场线(CML)
资本市场线(CML)
均值-方差效用最优杠杆
效用函数 $U = \mu_p - \frac{\gamma}{2}\sigma_p^2$,最优杠杆(切线组合的配置比例):
两基金分离定理
含无风险资产
$\alpha$ 由风险厌恶系数 $\gamma$ 决定,所有投资者持有相同的切线组合(仅比例不同)。
仅含风险资产(无 $r_f$)
任何有效前沿上的组合都可表示为两个有效组合的线性组合。常用基:GMV 组合 + 任意另一有效组合。
风险贡献与 Euler 分解
组合波动的 Euler 分解($\sigma_p$ 是 $w$ 的一次齐次函数):
风险平价(Risk Parity):$RC_1 = RC_2 = \cdots = RC_n$,即每个资产贡献等额风险。
自相关下的年化 Sharpe
若收益存在序列相关,年化方差应使用 Newey–West 型估计:
其中 $\hat{\gamma}(k) = \frac{1}{n}\sum_{t=k+1}^n (x_t - \bar{x})(x_{t-k} - \bar{x})$ 是第 $k$ 阶样本自协方差。
HAC 标准误检验
交易成本对 Sharpe 的影响
设单位换手成本 $c$,换手率(turnover)$\tau$,则期望收益约减为 $\mu' = \mu - c\tau$。
含交易成本的组合优化
原始目标:$\max_w \mu^\top w - \frac{\lambda}{2}w^\top\Sigma w$,加入成本惩罚:
或二次成本版本($L_2$ 惩罚):$-\frac{\gamma}{2}\|w_t - w_{t-1}\|_2^2$。
降低换手的实务方法
| 方法 | 思路 |
|---|---|
| 显式惩罚 | 在目标函数中加 $c^\top|\Delta w|$ |
| 换手约束 | $\|w_t - w_{t-1}\|_1 \leq \tau_{\max}$ |
| 信号平滑 | $w_t = (1-\rho)w_{t-1} + \rho\tilde{w}_t$,$\rho \in (0,1)$ |
| 分层执行控制 | 结合 Almgren-Chriss 冲击成本模型 |
多重检验与数据挖矿偏差
若同时测试 $m$ 个策略,取最优的 Sharpe 存在选择偏差。校正方法:
| 方法 | 说明 |
|---|---|
| Bonferroni / Holm | 调整 p 值阈值为 $\alpha/m$(保守) |
| Benjamini–Hochberg | 控制 FDR(假发现率),更宽松 |
| White's Reality Check | Bootstrap 构造零分布 |
| SPA Test | Superior Predictive Ability |
| 样本外验证 | 最根本:在独立测试集上验证 |
面试题库速查
$\hat{S} = \bar{x}/\hat{\sigma}$。i.i.d. 时年化 $S_\text{ann} = \sqrt{A} \cdot S_\text{per}$。
有自相关时不能直接乘 $\sqrt{A}$——需要用 HAC 估计年化方差:$\hat{\sigma}^2_\text{ann} = \hat{\gamma}(0) + 2\sum_{k=1}^{A-1}(1-k/A)\hat{\gamma}(k)$。
Delta Method:$\hat{S} = g(\bar{r}, s) = \bar{r}/s$,展开得
$$\text{SE}(\hat{S}) \approx \sqrt{\frac{1+\frac{1}{2}S^2}{n-1}}$$"1" 来自均值不确定性,"$\frac{1}{2}S^2$" 来自方差估计(卡方分布)的不确定性。有自相关时用 HAC。
日度 $S_d = 8/\sqrt{252} \approx 0.504$。$N$ 天总收益 $\sim \mathcal{N}(N\mu_d, N\sigma_d^2)$。
$$N \geq \left(\frac{z_{1-\alpha}}{S_d}\right)^2$$$\alpha=5\% \Rightarrow N \approx 11$ 天;$\alpha=1\% \Rightarrow N \approx 22$ 天。
理论上不变:$S(Lw) = L\mu/(L\sigma) = S$。现实中因融资成本、保证金约束、冲击成本随规模增加,实际 Sharpe 会下降。
等 vol、$\rho=0$:$S_p = S\sqrt{N/(1+(N-1)\rho)} = 1 \times \sqrt{2} \approx 1.414$。
或者用 $S_p^2 = S_1^2 + S_2^2$(独立时):$S_p = \sqrt{1+1} = \sqrt{2}$。
同质性固定分母,拉格朗日得 $w^* \propto \Sigma^{-1}(\mu - r_f\mathbf{1})$,归一化得切线组合。$S_\max = \sqrt{(\mu-r_f\mathbf{1})^\top\Sigma^{-1}(\mu-r_f\mathbf{1})}$。
$\rho=0$:$S_p = 1 \times \sqrt{16} = 4$。有相关时:$S_p = 4/\sqrt{1+15\rho}$。
零。$\mu_i = 0$,加入不增加组合期望收益(分子),只增加方差(分母),对 Sharpe 纯负贡献。$w^* = 0$。
答案约 $0.16$。等 vol 假设下:$(0.9 \times 3 + 0.1 \times s)^2 \geq 9 \times (0.81 + 0.01) = 7.38$,解得 $s \geq 0.16$。远低于 3,体现分散化带来的巨大价值:不相关性本身就是 alpha。
$\text{IR} = \mathbb{E}[a]/\sigma(a)$,$a_t = r_t - r_{\text{benchmark},t}$ 是主动收益。Sharpe 是超额(vs 无风险利率)收益的 IR。若基准是无风险利率,IR=Sharpe。主动管理用 IR,绝对收益策略用 Sharpe。
$S_p^2 = (S_1^2 + S_2^2 - 2\rho S_1 S_2)/(1-\rho^2)$(等 vol 下)。$\rho \downarrow \Rightarrow S_p \uparrow$。
直觉:正交信号可以无损叠加(向量加法)。相关信号在同方向上"浪费",噪声重叠而信号未增加。
① 用 HAC(Newey–West)估计 $\bar{x}$ 的标准误;② 年化方差用自协方差加权求和;③ $t_\text{HAC} = \bar{x}/\widehat{\text{SE}}_\text{HAC}$;④ 报告时注明带宽选择方法(如 Bartlett kernel,带宽 $\sim n^{1/5}$)。
设完整序列共 $2n$ 个点($n$ 个 0,$n$ 个非零)。
完整序列均值:$\bar{x}_{\text{full}} = \mu/2$。
完整序列方差(全方差公式):$\sigma^2_{\text{full}} = \sigma^2/2 + \mu^2/4$。
故 $S_{\text{full}} = \dfrac{\mu/2}{\sqrt{\sigma^2/2 + \mu^2/4}}$。
删零后:$S_{\text{trim}} = \mu/\sigma$。
比值 $S_{\text{trim}}/S_{\text{full}} = \sqrt{2 + S_{\text{trim}}^2/2} > 1$,删零后 Sharpe 严格提升。
直觉:0 收益贡献了分子(期望)的"稀释",但同时拉低了分母(波动);稀释效应主导,净效果是 Sharpe 下降——反过来删掉 0 就是 Sharpe 上升。详细推导见 §23。
Adjusted Sharpe(Pezier & White 2006):$S^* = S \cdot \left[1 + \dfrac{\hat{\gamma}_1}{6}S - \dfrac{\hat{\gamma}_2-3}{24}S^2\right]$,其中 $\hat\gamma_1$ 为偏度,$\hat\gamma_2$ 为峰度。
负偏度(左肥尾,如卖期权)→ $S^*$ 低于 $S$;超峰度(fat tails)→ $S^*$ 进一步降低。
$\text{PSR}(S^*) = \Phi\!\left(\dfrac{(\hat{S}-S^*)\sqrt{n-1}}{\sqrt{1 - \hat\gamma_1\hat{S} + \frac{\hat\gamma_2-1}{4}\hat{S}^2}}\right)$,即 $P(\text{真实 }S > S^*)$。纳入了有限样本、偏度、峰度对估计不确定性的影响,比单纯的 $t$ 检验更全面。
连续时间 Kelly(对数效用):$f^* = \mu/\sigma^2 = S/\sigma$(fraction of wealth)。
Sharpe 越高,Kelly 仓位越大;vol 越高,Kelly 仓位越小。
若对数收益 $\mu$ 已超额(扣 $r_f$),则 $f^* = S_{\text{ann}}/\sigma_{\text{ann}}$(年化口径一致)。
实务中常取 half-Kelly 以控制回撤。
Sortino:分母换成下行标准差 $\sigma_d$(只计负收益的波动),$\text{Sortino} = \mu/\sigma_d \geq \text{Sharpe}$。适合收益正偏、收益对称性差的策略(如趋势跟踪)。
Calmar:$\text{Calmar} = \mu_\text{ann}/\text{MaxDD}$,用最大回撤代替波动率,适合对回撤敏感的 CTA/hedge fund 投资者。
Sharpe 的优点:数学性质好(均值-方差框架闭式),统计推断成熟,行业通用。
稀疏序列与零收益:全方差公式推导
面试题序列共 $2n$ 个观测:$n$ 个为 0,另外 $n$ 个 i.i.d. $\sim (\mu, \sigma^2)$,$\mu > 0$。
问:删掉所有 0 后,Sharpe 如何变化?请用全方差公式推导。
Step 1:完整序列的矩
令 $G$ 为组别指示变量,$G=1$(概率 $1/2$)对应非零组,$G=0$ 对应零组。
Step 2:全方差公式(Law of Total Variance)
Step 3:两种 Sharpe 对比
Step 4:比值
非正态收益下的修正 Sharpe
标准 Sharpe 假设收益正态,忽略了偏度($\gamma_1$)和超额峰度($\gamma_2 - 3$)对风险的影响。
Adjusted Sharpe Ratio(Pezier & White, 2006)
| 情形 | $\gamma_1$ | $\gamma_2$ | $S^*$ vs $S$ | 典型策略 |
|---|---|---|---|---|
| 左偏 + 厚尾 | $< 0$ | $> 3$ | $S^* < S$(高估风险) | 卖期权、信用策略 |
| 右偏 + 薄尾 | $> 0$ | $< 3$ | $S^* > S$(低估风险奖励) | 趋势跟踪、动量 |
| 正态 | $= 0$ | $= 3$ | $S^* = S$ | — |
Sortino Ratio(下行风险)
对于对称正态分布,$\sigma_{\text{downside}} = \sigma/\sqrt{2}$,Sortino $= \sqrt{2}\cdot$Sharpe。非对称时 Sortino 比 Sharpe 更能区分策略质量。
Probabilistic & Deflated Sharpe Ratio
Probabilistic Sharpe Ratio(PSR)
Bailey & López de Prado (2012)。给定基准 Sharpe $S^*$,估计真实 Sharpe 超过 $S^*$ 的概率:
分母在标准误 $\sqrt{(1+\hat S^2/2)/n}$ 的基础上,进一步引入偏度项($-\hat\gamma_1\hat S$)和峰度项($(\hat\gamma_2-1)/4\cdot\hat S^2$)的修正。
Deflated Sharpe Ratio(DSR)
当从 $T$ 个试验中选最优策略时,存在选择偏差(multiple testing inflation)。DSR 以多重检验调整后的 $S^*$ 代入 PSR:
简化理解:$S^*$ 随试验数 $T$ 的增加而提高(Bonferroni 精神)。回测越多,需要更高的 OOS Sharpe 才算真实。
| 指标 | 解决的问题 | 核心输入 |
|---|---|---|
| 标准 SE | 样本量不确定性 | $n$, $\hat S$ |
| PSR | +非正态(偏度/峰度) | $n$, $\hat S$, $\gamma_1$, $\gamma_2$ |
| DSR | +多重回测选择偏差 | PSR 输入 + 试验次数 $T$ |
Kelly Criterion 与 Sharpe 的关系
连续时间 Kelly(对数效用最优仓位)
设策略超额收益 $dX = \mu\,dt + \sigma\,dW$,最大化对数财富增长率:
其中 $S = \mu/\sigma$ 为 Sharpe。最优增长率(Kelly growth rate):
多策略 Kelly(向量扩展)
$N$ 个策略,超额收益向量 $\mu$,协方差矩阵 $\Sigma$:
多策略最优增长率等于切线组合最大 Sharpe 的平方的一半——分散化提高 $S_{\max}$,直接以平方速率提升复利增长。
实务:Half-Kelly
| 分数 | 预期增长率 | 最大回撤特征 | 实务建议 |
|---|---|---|---|
| Full Kelly ($f^*$) | 最大 $g^*$ | 极端,历史最大回撤 $\approx 100\%$ | 理论最优,实操过激 |
| Half Kelly ($f^*/2$) | $3g^*/4$ | 回撤减半(近似) | 行业实践首选 |
| Quarter Kelly | $7g^*/16$ | 更温和 | 极保守机构 |
核心公式速查表
| 公式 | 表达式 |
|---|---|
| 样本 Sharpe | $\hat{S} = \bar{x}/\hat{\sigma}$ |
| 年化(i.i.d.) | $S_\text{ann} = \sqrt{A} \cdot S_\text{per}$ |
| 标准误(SE) | $\text{SE}(\hat{S}) \approx \sqrt{(1+\frac{1}{2}S^2)/(n-1)}$ |
| t 统计量 | $t = \sqrt{n}\,\hat{S}$ |
| 负收益天数阈值 | $N \geq (z_{1-\alpha}/S_d)^2$ |
| 切线组合权重 | $w^* \propto \Sigma^{-1}(\mu - r_f\mathbf{1})$ |
| 最大 Sharpe | $S_\max = \sqrt{(\mu-r_f\mathbf{1})^\top\Sigma^{-1}(\mu-r_f\mathbf{1})}$ |
| 两策略 Sharpe(等 vol) | $S_p = \sqrt{(S_1^2+S_2^2-2\rho S_1S_2)/(1-\rho^2)}$ |
| 等相关 N 因子 | $S_p = S\sqrt{N/(1+(N-1)\rho)}$ |
| 独立时 | $S_p^2 = \sum S_i^2$ |
| GMV 权重 | $w_\text{GMV} = \Sigma^{-1}\mathbf{1}/A$ |
| 有效前沿 | $\sigma_p^2 = (A\mu^{*2} - 2B\mu^* + C)/D$ |
| CML | $\mu_p = r_f + S_\max\,\sigma_p$ |
| 风险贡献 | $RC_i = w_i(\Sigma w)_i/\sigma_p$ |
| TC 修正 | $S' \approx S - c\tau/\sigma$ |
| 稀疏序列(半零) | $S_{\text{full}} = \dfrac{\mu/2}{\sqrt{\sigma^2/2+\mu^2/4}}$,$S_{\text{trim}}/S_{\text{full}}=\sqrt{2+S_{\text{trim}}^2/2}$ |
| Adjusted Sharpe | $S^* = S[1+(\gamma_1/6)S - (\gamma_2-3)/24\cdot S^2]$ |
| PSR | $\Phi\!\left(\frac{(\hat S-S^*)\sqrt{n-1}}{\sqrt{1-\gamma_1\hat S+(\gamma_2-1)/4\cdot\hat S^2}}\right)$ |
| Kelly 最优仓位 | $f^* = \mu/\sigma^2 = S/\sigma$ |
| Kelly 最优增长率 | $g^* = S^2/2$ |
| 多策略 Kelly 增长率 | $g^* = S_{\max}^2/2$ |