θ 的性质
θ 是
随机变量,服从先验分布 \(P(\theta)\)
目标
\(\arg\max_\theta P(D|\theta)\)
目标
\(\arg\max_\theta P(\theta|D)\)
一句话区分:MLE 问"哪个参数让数据最可能出现";MAP 问"看到数据后,哪个参数最可能是真值"。前者是 likelihood,后者是 posterior。
给定 i.i.d. 样本 \(D = \{x_1, \ldots, x_n\}\),参数化分布 \(P(x|\theta)\),MLE 求:
$$\hat\theta_{\text{MLE}} = \arg\max_\theta P(D|\theta) = \arg\max_\theta \prod_{i=1}^n P(x_i|\theta)$$
取对数(单调不改变 argmax),转为 log-likelihood:
$$\ell(\theta) = \log P(D|\theta) = \sum_{i=1}^n \log P(x_i|\theta)$$
求解步骤
- 写出单样本 likelihood \(P(x_i|\theta)\)
- 连乘得 \(L(\theta) = \prod_i P(x_i|\theta)\)
- 取 log 得 \(\ell(\theta)\)
- 对 θ 求导令 \(\frac{\partial \ell}{\partial \theta} = 0\),解出 \(\hat\theta\)
- 验证二阶条件(确认是极大值)
常见陷阱:MLE 给出的估计量不一定无偏。例如正态分布的方差 MLE \(\hat\sigma^2 = \frac{1}{n}\sum(x_i-\bar x)^2\) 是有偏的(分母应为 n−1)。指数分布 \(\hat\lambda = 1/\bar x\) 也是有偏的(\(E[1/\bar x] \neq 1/\lambda\))。
MAP 利用 Bayes 定理,在 likelihood 基础上加入先验:
$$P(\theta|D) = \frac{P(D|\theta) \cdot P(\theta)}{P(D)} \propto P(D|\theta) \cdot P(\theta)$$
$$\hat\theta_{\text{MAP}} = \arg\max_\theta [P(D|\theta) \cdot P(\theta)] = \arg\max_\theta [\ell(\theta) + \log P(\theta)]$$
求解条件(对 θ 求导):
$$\frac{\partial}{\partial\theta}\bigl[\log P(D|\theta) + \log P(\theta)\bigr] = 0$$
MAP vs 完整 Bayesian
MAP 只取 posterior 的众数(mode),丢弃了分布形状。完整 Bayesian 推断要计算 posterior 的完整分布,代价更高但信息更丰富。
直觉:\(\log P(\theta)\) 相当于对参数的"惩罚项"。数据量大时,先验影响减弱,MAP → MLE;数据量小时,先验起正则化作用,拉向先验均值。
①
Consistency
当 \(n\to\infty\) 时,\(\hat\theta_{\text{MLE}} \xrightarrow{p} \theta^*\)
②
Asymptotic Normality
\(\sqrt{n}(\hat\theta - \theta^*) \xrightarrow{d} \mathcal{N}\!\left(0,\,\frac{1}{I(\theta^*)}\right)\)
③
Asymptotic Efficiency
在所有无偏估计量中,MLE 方差最小(达到 Cramér-Rao 下界)
④
Invariance
若 \(\hat\theta\) 是 θ 的 MLE,则 \(g(\hat\theta)\) 是 \(g(\theta)\) 的 MLE
Fisher Information
Fisher Information 衡量一个观测能提供多少关于 θ 的信息:
$$I(\theta) = -\mathbb{E}\left[\frac{\partial^2 \log P(x|\theta)}{\partial\theta^2}\right] = \mathbb{E}\left[\left(\frac{\partial \log P(x|\theta)}{\partial\theta}\right)^{\!2}\right]$$
Cramér-Rao 下界:对任意无偏估计量 \(\hat\theta\),有 \(\text{Var}(\hat\theta) \geq \frac{1}{nI(\theta)}\)。MLE 在大样本下达到此下界,即渐近最优。
设 \(X_i \sim \text{Exp}(\lambda)\),即 \(f(x|\lambda) = \lambda e^{-\lambda x},\ x\geq0\)。
$$\ell(\lambda) = n\log\lambda - \lambda\sum x_i$$
$$\ell'(\lambda) = \frac{n}{\lambda} - \sum x_i = 0 \implies \hat\lambda_{\text{MLE}} = \frac{1}{\bar x}$$
有偏性:\(\mathbb{E}[\hat\lambda] = \mathbb{E}[1/\bar X] \neq 1/\lambda\),因为
\(\mathbb{E}[1/\bar X] = \frac{n}{n-1}\lambda\)(Jensen 不等式)。
因此无偏修正为 \(\hat\lambda_{\text{unbiased}} = \frac{n-1}{n} \cdot \frac{1}{\bar x}\)。
设 \(X_i \sim \mathcal{N}(\mu, \sigma^2)\),σ 已知,估计 μ。
$$\ell(\mu) = \sum_{i=1}^n \left[-\frac{(x_i-\mu)^2}{2\sigma^2}\right] + \text{const}$$
$$\ell'(\mu) = \frac{1}{\sigma^2}\sum(x_i - \mu) = 0 \implies \hat\mu_{\text{MLE}} = \bar x$$
设 \(X \sim \mathcal{N}(0, s^2)\),μ=0 已知,一次观测得 \(X = k\),估计 s。
$$L(s) = \frac{1}{\sqrt{2\pi}s}e^{-k^2/(2s^2)},\quad \ell(s) = -\log s - \frac{k^2}{2s^2} + \text{const}$$
$$\ell'(s) = -\frac{1}{s} + \frac{k^2}{s^3} = 0 \implies s^2 = k^2 \implies \hat s = |k|$$
数据 \(X_i \sim \mathcal{N}(\mu, \sigma^2)\),先验 \(\mu \sim \mathcal{N}(0, \tau^2)\)。
$$\ell(\mu) + \log P(\mu) = -\sum\frac{(x_i-\mu)^2}{2\sigma^2} - \frac{\mu^2}{2\tau^2} + \text{const}$$
$$\frac{\partial}{\partial\mu}[\cdots] = \frac{1}{\sigma^2}\sum(x_i-\mu) - \frac{\mu}{\tau^2} = 0$$
$$\hat\mu_{\text{MAP}} = \frac{n/\sigma^2}{n/\sigma^2 + 1/\tau^2}\bar x = \frac{n\tau^2}{n\tau^2 + \sigma^2}\bar x$$
收缩解释:MAP 估计是 MLE(\(\bar x\))与先验均值(0)的加权平均,权重由精度(方差倒数)决定。\(n\to\infty\) 时权重趋向 MLE;样本少时被先验"拉向 0"(shrinkage)。
MLE:最小化加权平方和
$$\hat\theta_{\text{MLE}} = \frac{M_1/\sigma_1^2 + M_2/\sigma_2^2}{1/\sigma_1^2 + 1/\sigma_2^2}$$
MAP(先验 \(\theta \sim \mathcal{N}(\mu_0, \tau^2)\)):
$$\hat\theta_{\text{MAP}} = \frac{M_1/\sigma_1^2 + M_2/\sigma_2^2 + \mu_0/\tau^2}{1/\sigma_1^2 + 1/\sigma_2^2 + 1/\tau^2}$$
规律:MAP = 加权平均,权重 = 精度 = 方差的倒数。先验贡献一项 \(\mu_0/\tau^2\)。
MAP 等价于带正则化约束的 MLE,先验分布决定正则化类型:
\(\theta \sim \mathcal{N}(0, \tau^2)\)
高斯先验
L₂ 正则 / Ridge
\(\ell(\theta) - \frac{1}{2\tau^2}\|\theta\|^2\)
\(\theta \sim \text{Laplace}(0, b)\)
拉普拉斯先验
L₁ 正则 / LASSO
\(\ell(\theta) - \frac{1}{b}|\theta|\)
\(\theta \sim \text{Uniform}\)
均匀先验
无正则化 = MLE
面试高频考点:为什么 Ridge 防止过拟合?因为高斯先验鼓励 θ 接近 0,惩罚大参数值;为什么 LASSO 产生稀疏解?因为拉普拉斯先验在 0 处有尖峰,倾向于将部分参数精确推到 0。
从 \(\{1, 2, \ldots, N\}\) 中均匀无放回抽取 k 个,观测到最大值 \(M_k = m_k\),估计未知 N。
PMF
$$P(M_k = m_k) = \frac{\binom{m_k-1}{k-1}}{\binom{N}{k}}, \quad k \leq m_k \leq N$$
MLE 估计
固定 \(m_k\),\(P(M_k = m_k)\) 关于 N 单调递减(分母 \(\binom{N}{k}\) 随 N 增大),因此:
$$\hat N_{\text{MLE}} = m_k$$
期望
$$\mathbb{E}[M_k] = \frac{k(N+1)}{k+1}$$
无偏估计(UMVUE)
令 \(\mathbb{E}[M_k] = m_k\) 解出 N:
$$\hat N = m_k \cdot \frac{k+1}{k} - 1 = m_k + \frac{m_k}{k} - 1$$
直觉解释:
- \(m_k\) 低估了 N(你采样到的最大值不可能超过 N)
- \(\frac{m_k}{k}\) 是相邻观测值的平均间距,作为 "\(m_k\) 到 N" 这段距离的补偿
- 减 1 是因为序列从 1 开始
历史背景(面试聊天话题):二战中盟军通过德国坦克序列号,用此方法估计德军生产量。统计估计约 256 辆/月,战后德军档案证实为 255 辆/月,远比情报部门 1,400 辆/月的估计精准。
Bayesian 框架天然支持顺序更新:先用 \(x_1\) 得到 posterior,将其作为下一次的 prior,再用 \(x_2\) 更新……最终结果与一次性用所有数据相同。
$$\underbrace{P(\theta|x_1)}_{\text{Step 1 posterior}} \propto P(x_1|\theta)P(\theta)$$
$$\underbrace{P(\theta|x_1,x_2)}_{\text{Step 2 posterior}} \propto P(x_2|\theta)\cdot\underbrace{P(\theta|x_1)}_{\text{Step 2 prior}}$$
实际意义(Quant 视角):在线学习、滤波(Kalman Filter)、实时参数更新都是顺序 Bayesian 的应用。每次新数据到来,无需重新用所有历史数据,只需更新 sufficient statistics。
共轭先验(Conjugate Prior)
若先验与 posterior 属于同一分布族,称为共轭先验,可以解析更新:
P 是未知数,你可以测量一次得到 \(X = P + \varepsilon\),其中 \(\varepsilon \sim \mathcal{N}(0,1)\)。你可以选择收取 P 元(若 P 为负则亏损)。你的策略是什么?
Answer
阈值策略:当且仅当 \(X > 0\) 时收取。
观测到 X 后,P 的后验期望为 \(\mathbb{E}[P|X] = X\)(无先验时)。期望收益 \(\mathbb{E}[\text{payoff}] = \mathbb{E}[P \cdot \mathbf{1}_{X>0}]\)。
$$= \mathbb{E}[(X-\varepsilon)\cdot\mathbf{1}_{X>0}] = \mathbb{E}[X\cdot\mathbf{1}_{X>0}] - \mathbb{E}[\varepsilon\cdot\mathbf{1}_{X>0}]$$
$$= \int_0^\infty x\phi(x-P)\,dx - \int_0^\infty \varepsilon\,\phi(\varepsilon)\,d\varepsilon$$
由于 \(\mathbb{E}[P|X] = X > 0\) 时收取严格优于任意其他 cut-off,阈值 0 最优。期望收益 = \(\phi(0) = \frac{1}{\sqrt{2\pi}} \approx 0.399\)(与 P 无关!)
你的朋友也独立测量得到 Y(你不知道 Y),朋友先决定是否收取,若朋友收取则你无法收取。如何调整策略?
Answer
提高阈值:\(X > c^*\) 才收取,其中 \(c^* > 0\)。
关键洞察:若朋友没收(轮到你),说明朋友的 \(Y \leq 0\)(他的 MLE 为负)。这提供了关于 P 的负面信号:P 倾向于偏低。
你收取的条件概率空间缩小为 \(\{Y\leq 0, X > c^*\}\),在此条件下 P 的后验期望降低。因此需要更高的 X 阈值来保证 \(\mathbb{E}[P|X, Y\leq 0] > 0\)。
升级版:你测量到 \(X = P + \varepsilon\),之后 P 每秒 ±1(等概率),你知道每次变动方向,可以选择任意时刻收取一次。策略是什么?
Answer
设阈值 \(c\),当当前值 \(P_t \geq c\) 时收取(且题意提示等待更优)。
设初始测量 X,此后 P 做随机游走且你观测每步变动。设当前 P 值(已知)为 \(v\)。
最优停止:若未来上升期望收益 > 当前值,继续等待。对称随机游走,\(\mathbb{E}[P_{t+1}|P_t] = P_t\),但可以"止损"(P 下跌时不收,P 上涨时获益)。
$$V(v) = \max\left(v,\; \frac{1}{2}V(v+1) + \frac{1}{2}V(v-1)\right)$$
解为阈值策略:存在最优 \(c^*\) 使得当 \(P_t \geq c^*\) 时立即收取。由于 V(v) 是凸函数,等待期权价值随距阈值距离增大而增大。
在 1c 的游戏中,朋友知道 Y(你不知道 Y),朋友每秒先于你决策,若朋友收取你就无法收取。如何保证正期望收益?最优策略是什么?
Answer
保证正期望:只有当 P 足够高(远超朋友可能的收取阈值)才收取。
关键结构:
- 朋友有阈值策略 \(c_f\)(你可以通过博弈论推断)
- 当朋友没收时,意味着 \(P_t < c_f\),这是 P 低的信号
- 你仍可以等待 P 上升到足够高再收取
- 最优阈值 \(c_y > c_f\):你需要更高的 P 来抵消"信息劣势"
保证正期望的策略:设阈值 \(c_y\) 足够高,使得即使在朋友不收(P 有负面信号)的条件下,\(\mathbb{E}[P|P_t = c_y, \text{朋友未收}] > 0\)。
面试答题框架:
- 先确认是 frequentist(θ 固定)还是 Bayesian(θ 随机),有无先验
- 写出 likelihood,取 log,求导令为 0
- 检查是否有偏;若有偏,能否修正(e.g. n→n-1)
- 讨论大样本性质(一致性、渐近正态、效率)
- 若有先验,加 log P(θ) 项,讨论等价正则化和 shrinkage 效果
Prepared for Quant Researcher interviews · MLE & MAP · Princeton MFin ·
Yuchen Yu
来源:SIG Quant 面经(高频考题)
\(X \sim \mathcal{N}(0, \sigma_x^2)\),\(Y \sim \mathcal{N}(0, \sigma_y^2)\),两者独立。令 \(Z = X + Y\),已观测到 \(Z = z\),求 \(\mathbb{E}[X \mid Z]\)。只问 expectation,不问 variance。
完整推导
方法一:联合正态条件期望公式(最快)
由于 \(X\) 和 \(Y\) 独立正态,\((X, Z)\) 是联合正态分布,可直接用条件期望公式:
$$\mathbb{E}[X \mid Z] = \mathbb{E}[X] + \frac{\operatorname{Cov}(X,Z)}{\operatorname{Var}(Z)}\,(Z - \mathbb{E}[Z])$$
逐项计算:
$$\mathbb{E}[X] = 0, \quad \mathbb{E}[Z] = \mathbb{E}[X] + \mathbb{E}[Y] = 0$$
$$\operatorname{Cov}(X,Z) = \operatorname{Cov}(X,\, X+Y) = \operatorname{Var}(X) + \underbrace{\operatorname{Cov}(X,Y)}_{=0} = \sigma_x^2$$
$$\operatorname{Var}(Z) = \operatorname{Var}(X+Y) = \sigma_x^2 + \sigma_y^2$$
代入:
$$\boxed{\mathbb{E}[X \mid Z] = \frac{\sigma_x^2}{\sigma_x^2 + \sigma_y^2} \cdot Z}$$
方法二:MAP 推导(直接优化)
把 \(X\) 视为随机变量(非固定参数),MAP 估计为:
$$\hat{x}_{\text{MAP}} = \arg\max_x \; P(X=x) \cdot P(Z=z \mid X=x)$$
展开两项(丢掉常数归一化因子):
$$= \arg\max_x \; \exp\!\left(-\frac{x^2}{2\sigma_x^2}\right) \cdot \exp\!\left(-\frac{(z-x)^2}{2\sigma_y^2}\right)$$
取对数,转为最小化:
$$\min_x \; \underbrace{\frac{x^2}{2\sigma_x^2}}_{\text{先验惩罚:}x\text{ 离 0 太远}} + \underbrace{\frac{(z-x)^2}{2\sigma_y^2}}_{\text{似然惩罚:需要 }Y\text{ 太大}}$$
对 \(x\) 求导令为零:
$$\frac{\partial}{\partial x}\left[\frac{x^2}{2\sigma_x^2} + \frac{(z-x)^2}{2\sigma_y^2}\right] = \frac{x}{\sigma_x^2} - \frac{z-x}{\sigma_y^2} = 0$$
$$x\,\sigma_y^2 = (z-x)\,\sigma_x^2$$
$$x(\sigma_x^2 + \sigma_y^2) = z\,\sigma_x^2$$
$$\hat{x}_{\text{MAP}} = \frac{\sigma_x^2}{\sigma_x^2 + \sigma_y^2} \cdot z$$
与方法一结果完全一致。
为什么对 x 求导,而非对 z?
关键区分:\(z\) 是已经观测到的固定常数(比如 \(z = 3.7\)),不是决策变量。MAP 问的是"给定这个观测值,最可能的 \(x\) 是什么"——\(x\) 才是我们在搜索的。对 \(z\) 求导等于问"什么样的观测值最大化后验",这毫无意义。
为什么不能直接用 MLE?
MLE 在此失效:MLE 把待估量视为固定未知参数,对 \(x\) 最大化 \(P(Z=z \mid X=x) = P(Y=z-x)\),得到 \(\hat{x}_{\text{MLE}} = z\)(令 \(Y=0\))。这完全忽略了 \(X\) 本身很小的先验信息。当 \(\sigma_x^2 \ll \sigma_y^2\) 时,MLE 说"X=z=5",而贝叶斯说"X 大概率接近 0"——MLE 荒谬,MAP 正确。
根本原因:\(X\) 是随机变量,有自己的分布,不能用频率派工具估计。
直觉解读
$$\mathbb{E}[X|Z] = \underbrace{\frac{\sigma_x^2}{\sigma_x^2+\sigma_y^2}}_{\text{X占总方差的比例}} \cdot Z$$
- 若 \(\sigma_x^2 \gg \sigma_y^2\):Z 几乎全是 X,则 \(\mathbb{E}[X|Z] \approx Z\)
- 若 \(\sigma_x^2 \ll \sigma_y^2\):Z 几乎全是噪声 Y,则 \(\mathbb{E}[X|Z] \approx 0\)(先验更可信)
- 若 \(\sigma_x^2 = \sigma_y^2\):\(\mathbb{E}[X|Z] = Z/2\),对半分
来源:SIG 第一轮 Quant 面经
用量角器测量一个三角形的三个角,结果分别是 56°, 55°, 57°(共 168°),真实的角度应该是多少?自己设置 assumption。
完整推导
建立模型
这道题不是数学题,是统计估计题。设真实角度为 \(\alpha, \beta, \gamma\),满足约束 \(\alpha + \beta + \gamma = 180°\)。测量值为:
$$x_1 = \alpha + \varepsilon_1, \quad x_2 = \beta + \varepsilon_2, \quad x_3 = \gamma + \varepsilon_3$$
Assumption:测量误差独立同分布,\(\varepsilon_i \sim \mathcal{N}(0, \sigma^2)\)(各量角器精度相同)。
约束 MLE(等价于约束最小二乘)
似然函数(取对数,丢常数):
$$\ell(\alpha,\beta,\gamma) = -\frac{1}{2\sigma^2}\left[(x_1-\alpha)^2 + (x_2-\beta)^2 + (x_3-\gamma)^2\right]$$
最大化似然等价于约束最小化残差平方和:
$$\min_{\alpha,\beta,\gamma} \; (x_1-\alpha)^2 + (x_2-\beta)^2 + (x_3-\gamma)^2$$
$$\text{s.t.} \quad \alpha + \beta + \gamma = 180°$$
拉格朗日乘数法
$$\mathcal{L} = (x_1-\alpha)^2 + (x_2-\beta)^2 + (x_3-\gamma)^2 - \lambda(\alpha+\beta+\gamma-180°)$$
对 \(\alpha, \beta, \gamma\) 分别求偏导令为 0:
$$\frac{\partial\mathcal{L}}{\partial\alpha} = -2(x_1-\alpha) - \lambda = 0 \implies x_1 - \alpha = \frac{\lambda}{2}$$
$$\frac{\partial\mathcal{L}}{\partial\beta} = -2(x_2-\beta) - \lambda = 0 \implies x_2 - \beta = \frac{\lambda}{2}$$
$$\frac{\partial\mathcal{L}}{\partial\gamma} = -2(x_3-\gamma) - \lambda = 0 \implies x_3 - \gamma = \frac{\lambda}{2}$$
三式相加:
$$(x_1+x_2+x_3) - (\alpha+\beta+\gamma) = \frac{3\lambda}{2}$$
$$168° - 180° = \frac{3\lambda}{2} \implies \lambda = \frac{-24°}{3} \cdot \frac{2}{1}\cdot\frac{1}{2} = -8°$$
代回,每个误差为 \(-\lambda/2 = 4°\),因此修正量为 \(+4°\):
$$\hat\alpha = 56° + 4° = 60°, \quad \hat\beta = 55° + 4° = 59°, \quad \hat\gamma = 57° + 4° = 61°$$
直觉:均匀分配误差
总误差 \(180° - 168° = 12°\) 被均匀分配给三个角(\(12°/3 = 4°\)),这是因为假设各量角器精度相同(\(\sigma_1^2 = \sigma_2^2 = \sigma_3^2\))。
推广:精度不同时
若各量角器精度不同(方差为 \(\sigma_1^2, \sigma_2^2, \sigma_3^2\)),目标函数变为加权残差平方和:
$$\min \; \frac{(x_1-\alpha)^2}{\sigma_1^2} + \frac{(x_2-\beta)^2}{\sigma_2^2} + \frac{(x_3-\gamma)^2}{\sigma_3^2} \quad \text{s.t.} \quad \alpha+\beta+\gamma=180°$$
拉格朗日得:\(x_i - \hat\theta_i = \lambda\sigma_i^2 / 2\),即精度越高的测量,修正量越小(改动越小,因为越可信)。
面试核心:考察约束 MLE + 拉格朗日,以及"精度加权"直觉。说出"这是约束优化,不是纯数学题"就得分。
来源:多个 Quant 面经(高频);量角器题的两变量版本
两把标尺精度不同,测量同一个东西,得到结果 \(M_1\) 和 \(M_2\),问真值是多少?对标尺测量分布作假设,用贝叶斯算最大概率。
完整推导
设立模型
设真值为 \(\mu\),两把标尺的测量误差独立正态:
$$M_1 = \mu + \varepsilon_1, \quad \varepsilon_1 \sim \mathcal{N}(0, \sigma_1^2)$$
$$M_2 = \mu + \varepsilon_2, \quad \varepsilon_2 \sim \mathcal{N}(0, \sigma_2^2)$$
MLE:最大化联合似然
$$L(\mu) = P(M_1|\mu) \cdot P(M_2|\mu) = \frac{1}{\sqrt{2\pi}\sigma_1}\exp\!\left(-\frac{(M_1-\mu)^2}{2\sigma_1^2}\right) \cdot \frac{1}{\sqrt{2\pi}\sigma_2}\exp\!\left(-\frac{(M_2-\mu)^2}{2\sigma_2^2}\right)$$
取对数,丢常数,最大化等价于最小化:
$$\min_\mu \; \frac{(M_1-\mu)^2}{2\sigma_1^2} + \frac{(M_2-\mu)^2}{2\sigma_2^2}$$
对 \(\mu\) 求导令为零:
$$\frac{\partial}{\partial\mu}\left[\frac{(M_1-\mu)^2}{2\sigma_1^2} + \frac{(M_2-\mu)^2}{2\sigma_2^2}\right] = -\frac{M_1-\mu}{\sigma_1^2} - \frac{M_2-\mu}{\sigma_2^2} = 0$$
$$\frac{\mu}{\sigma_1^2} + \frac{\mu}{\sigma_2^2} = \frac{M_1}{\sigma_1^2} + \frac{M_2}{\sigma_2^2}$$
$$\boxed{\hat\mu_{\text{MLE}} = \frac{M_1/\sigma_1^2 + M_2/\sigma_2^2}{1/\sigma_1^2 + 1/\sigma_2^2} = \frac{w_1 M_1 + w_2 M_2}{w_1 + w_2}}$$
$$\text{其中精度权重 } w_i = \frac{1}{\sigma_i^2}$$
MAP:加入先验 \(\mu \sim \mathcal{N}(\mu_0, \tau^2)\)
后验正比于似然 × 先验,同样取对数最小化:
$$\hat\mu_{\text{MAP}} = \frac{M_1/\sigma_1^2 + M_2/\sigma_2^2 + \mu_0/\tau^2}{1/\sigma_1^2 + 1/\sigma_2^2 + 1/\tau^2}$$
先验贡献第三项 \(\mu_0/\tau^2\),权重为先验精度 \(1/\tau^2\)。
推广到 n 把标尺
$$\hat\mu = \frac{\sum_{i=1}^n M_i/\sigma_i^2}{\sum_{i=1}^n 1/\sigma_i^2}$$
精度相同时(\(\sigma_i^2 = \sigma^2\) for all \(i\))退化为简单算术平均。
规律:精度加权平均。精度(\(1/\sigma^2\))越高的测量,在加权平均中权重越大,影响越强——越精准的标尺说话越有力。这个公式是 Kalman Filter 的离散单步更新,也是信号融合的基础。
来源:Quant 面经,绿皮书变体
有 1 枚不公平硬币(正面概率 \(p_u\))和 999 枚公平硬币。随机选一枚,抛了 5 次都是正面,求这枚是公平硬币的概率。
完整推导
贝叶斯公式框架
设事件:\(F\) = 选到公平硬币,\(U\) = 选到不公平硬币,\(D\) = 观测到 5 次正面。
$$P(F) = \frac{999}{1000}, \quad P(U) = \frac{1}{1000}$$
$$P(D \mid F) = \left(\frac{1}{2}\right)^5 = \frac{1}{32}$$
$$P(D \mid U) = p_u^5$$
由全概率公式:
$$P(D) = P(D|F)\,P(F) + P(D|U)\,P(U) = \frac{1}{32} \cdot \frac{999}{1000} + p_u^5 \cdot \frac{1}{1000}$$
贝叶斯后验:
$$P(F \mid D) = \frac{P(D|F)\,P(F)}{P(D)} = \frac{\dfrac{1}{32} \cdot \dfrac{999}{1000}}{\dfrac{1}{32} \cdot \dfrac{999}{1000} + p_u^5 \cdot \dfrac{1}{1000}}$$
化简(分子分母同乘 \(1000/p_u^5\)):
$$P(F \mid D) = \frac{999/32}{999/32 + p_u^5 \cdot \frac{1}{(1/2)^5}} = \frac{999}{999 + 32\,p_u^5}$$
具体情形
\(p_u = 1\)(双面正)
\(\dfrac{999}{999+32} \approx 96.9\%\)
\(p_u = 0.9\)(偏正)
\(\dfrac{999}{999+32\times 0.9^5} \approx \dfrac{999}{999+18.9} \approx 98.1\%\)
\(p_u = 0.7\)
\(\dfrac{999}{999+32\times 0.168} \approx 99.5\%\)
直觉:999:1 的强先验使得即使 5 次正面,公平硬币仍是最可能的。只有当 \(p_u\) 非常大(接近 1),不公平硬币才会有可观的后验概率。这展示了先验信息在贝叶斯推断中的力量。
Follow-up:需要多少次正面才能"翻转"结论?
设 \(n\) 次正面,令 \(P(F|D) = P(U|D)\)(后验相等):
$$\frac{999}{1000} \cdot \left(\frac{1}{2}\right)^n = \frac{1}{1000} \cdot p_u^n$$
$$999 \cdot \left(\frac{1}{2p_u}\right)^n = 1$$
$$n = \frac{\log 999}{\log(2p_u)}$$
当 \(p_u = 1\) 时,\(n \approx \log_2 999 \approx 10\)。需要约 10 次连续正面才能使两种硬币的后验概率相等。
来源:SIG 第二轮 Quant 面经
给定 \(X, Y \sim \mathcal{N}(0,1)\) 独立,求 \(P(X+Y > 0 \;\text{且}\; X+2Y > 0)\)。Follow-up:若 \(X, Y\) 不独立,协方差为 \(\rho\),结果如何变化?
完整推导
Step 1:构造联合正态向量
令 \(U = X+Y\),\(V = X+2Y\),则 \((U, V)\) 是 \((X,Y)\) 的线性变换,仍然服从联合正态。
$$\mathbb{E}[U] = \mathbb{E}[V] = 0$$
$$\operatorname{Var}(U) = \operatorname{Var}(X) + \operatorname{Var}(Y) = 1 + 1 = 2$$
$$\operatorname{Var}(V) = \operatorname{Var}(X) + 4\operatorname{Var}(Y) = 1 + 4 = 5$$
$$\operatorname{Cov}(U,V) = \operatorname{Cov}(X+Y,\, X+2Y) = \operatorname{Var}(X) + 2\operatorname{Var}(Y) + 3\operatorname{Cov}(X,Y)$$
$$= 1 + 2 + 0 = 3 \quad (\text{独立情形})$$
Step 2:相关系数
$$\rho_{UV} = \frac{\operatorname{Cov}(U,V)}{\sqrt{\operatorname{Var}(U)\operatorname{Var}(V)}} = \frac{3}{\sqrt{2 \times 5}} = \frac{3}{\sqrt{10}}$$
Step 3:联合正态的角度公式
对于均值为零的联合正态 \((U,V)\),两个半平面 \(\{U>0\}\) 和 \(\{V>0\}\) 的交集概率为:
$$P(U>0,\, V>0) = \frac{1}{4} + \frac{1}{2\pi}\arcsin(\rho_{UV})$$
代入 \(\rho_{UV} = 3/\sqrt{10}\):
$$P(X+Y>0,\, X+2Y>0) = \frac{1}{4} + \frac{\arcsin(3/\sqrt{10})}{2\pi}$$
数值上:\(\arcsin(3/\sqrt{10}) \approx \arcsin(0.9487) \approx 71.6° \approx 1.25\text{ rad}\),所以结果 \(\approx 0.25 + 0.199 = 0.449\)。
几何直觉
在 \((x,y)\) 平面上,\(X+Y=0\) 是直线 \(y=-x\)(斜率 \(-1\)),\(X+2Y=0\) 是直线 \(y=-x/2\)(斜率 \(-1/2\))。两条线将平面分成四个区域,概率等于满足两个半平面条件的区域对应的角度 / \(360°\)(利用圆对称性)。
$$\text{两条分界线的夹角} = \arctan(-1/2) - \arctan(-1) \approx 45° - 26.6° = 18.4°$$
$$P \approx \frac{180° + 18.4°}{360°} \approx 0.551 \quad \text{(另一半)}$$
Follow-up:\(\operatorname{Cov}(X,Y) = \rho\) 时
$$\operatorname{Cov}(U,V) = 1 + 2 + 3\rho = 3 + 3\rho$$
$$\operatorname{Var}(U) = 2 + 2\rho, \quad \operatorname{Var}(V) = 5 + 4\rho$$
$$\rho_{UV} = \frac{3(1+\rho)}{\sqrt{(2+2\rho)(5+4\rho)}} = \frac{3(1+\rho)}{\sqrt{2(1+\rho)(5+4\rho)}} = \frac{3\sqrt{1+\rho}}{\sqrt{2(5+4\rho)}}$$
结论:\(\rho\) 增大时,\(\rho_{UV}\) 也增大,\(P(U>0, V>0)\) 增大(两个事件更正相关,更容易同时发生)。
来源:多个 Quant 面经(高频)
给定 \(n\) 个随机变量,两两相关系数均为 \(\rho\),求 \(\rho\) 的可行范围。
完整推导(以 n=3 为例)
写出相关矩阵
$$\Sigma = \begin{pmatrix} 1 & \rho & \rho \\ \rho & 1 & \rho \\ \rho & \rho & 1 \end{pmatrix}$$
合法的相关矩阵必须是正半定(positive semidefinite),即所有特征值 \(\geq 0\),等价于所有主子式行列式 \(\geq 0\)。
计算行列式
$$\det(\Sigma) = 1(1-\rho^2) - \rho(\rho - \rho^2) + \rho(\rho^2 - \rho)$$
$$= 1 - \rho^2 - \rho^2 + \rho^3 + \rho^3 - \rho^2 = 1 - 3\rho^2 + 2\rho^3$$
$$= (1-\rho)^2(1+2\rho)$$
令 \(\det(\Sigma) \geq 0\):
$$(1-\rho)^2(1+2\rho) \geq 0$$
由于 \((1-\rho)^2 \geq 0\) 恒成立,需要 \(1+2\rho \geq 0\),即 \(\rho \geq -1/2\)。结合 \(\rho \leq 1\):
$$\boxed{\rho \in \left[-\frac{1}{2},\; 1\right]}$$
特征值验证
矩阵 \(\Sigma = (1-\rho)I + \rho \mathbf{1}\mathbf{1}^T\) 的特征值为:
$$\lambda_1 = 1 + (n-1)\rho \quad \text{(重数 1,对应全1向量)}$$
$$\lambda_2 = 1 - \rho \quad \text{(重数 } n-1\text{,对应与全1正交的向量)}$$
正半定要求 \(\lambda_1 \geq 0\) 且 \(\lambda_2 \geq 0\):
$$1+(n-1)\rho \geq 0 \implies \rho \geq -\frac{1}{n-1}$$
$$1-\rho \geq 0 \implies \rho \leq 1$$
$$\boxed{\rho \in \left[-\frac{1}{n-1},\; 1\right]}$$
当 \(n=3\) 时得 \(\rho \geq -1/2\),与行列式法一致。
直觉:若 \(n\) 很大,\(\rho\) 的下界趋向 0,说明很多变量不可能都强负相关——因为如果 A 与 B 负相关,B 与 C 负相关,则 A 与 C 必须正相关,产生矛盾。
来源:多个 Quant 面经(高频)
对 \((x_i, y_i)\) 数据做 OLS,\(Y = \theta_1 X + c_1\) 得斜率 \(\theta_1\);把 \(x\) 和 \(y\) 交换,\(X = \theta_2 Y + c_2\) 得斜率 \(\theta_2\)。问 \(\theta_1 \times \theta_2\) 的范围。
完整推导
OLS 斜率公式
正向回归 \(Y \sim X\),OLS 斜率最小化 \(\sum(y_i - \theta x_i - c)^2\)(竖直残差):
$$\theta_1 = \frac{\operatorname{Cov}(X,Y)}{\operatorname{Var}(X)} = \frac{S_{xy}}{S_{xx}}$$
反向回归 \(X \sim Y\),OLS 斜率最小化 \(\sum(x_i - \theta y_i - c)^2\)(水平残差):
$$\theta_2 = \frac{\operatorname{Cov}(X,Y)}{\operatorname{Var}(Y)} = \frac{S_{xy}}{S_{yy}}$$
乘积
$$\theta_1 \times \theta_2 = \frac{S_{xy}}{S_{xx}} \cdot \frac{S_{xy}}{S_{yy}} = \frac{S_{xy}^2}{S_{xx} \cdot S_{yy}} = \rho^2 = R^2$$
其中 \(\rho = \operatorname{Corr}(X,Y)\) 是 Pearson 相关系数,\(R^2\) 是两次回归共同的决定系数。
$$\boxed{\theta_1 \times \theta_2 = R^2 \in [0, 1]}$$
几何直觉
两条回归线:
- Y on X:最小化纵向(Y 方向)距离的平方和,直线倾向于更"平躺"
- X on Y:最小化横向(X 方向)距离的平方和,直线倾向于更"陡立"
- 两条线在样本均值 \((\bar{x}, \bar{y})\) 处相交
- \(\rho^2 = 1\)(完美线性关系)时两线重合;\(\rho = 0\) 时一条水平一条垂直,乘积为 0
面试 Follow-up:若最小化垂直距离(而非纵向或横向),得到的是 PCA 的第一主成分,斜率为 \(\operatorname{Var}(Y) - \operatorname{Var}(X) + \sqrt{(\operatorname{Var}(Y)-\operatorname{Var}(X))^2 + 4\operatorname{Cov}^2(X,Y)}\) 的函数,等价于最大化方差方向。
来源:多个 Quant 面经(极高频)
将数据集完整复制 \(k\) 倍(共 \(kn\) 个样本),对以下量有何影响:OLS 系数 \(\hat\beta\)、\(R^2\)、残差方差 \(\hat\sigma^2\)、标准误 \(\text{SE}(\hat\beta)\)、\(t\) 统计量、\(p\) 值?
逐项推导
OLS 系数 \(\hat\beta\):不变
$$\hat\beta = (X^TX)^{-1}X^Ty$$
复制 \(k\) 倍后,\(X^TX \to k(X^TX)\),\(X^Ty \to k(X^Ty)\):
$$\hat\beta_{\text{new}} = (kX^TX)^{-1}(kX^Ty) = \frac{1}{k}(X^TX)^{-1} \cdot k(X^Ty) = \hat\beta$$
\(R^2\):不变
\(R^2 = 1 - \text{SS}_{\text{res}} / \text{SS}_{\text{tot}}\)。复制后分子分母同乘 \(k\),比值不变。
残差方差 \(\hat\sigma^2\):不变
$$\hat\sigma^2 = \frac{\text{SS}_{\text{res}}}{n - p - 1}$$
复制后 \(\text{SS}_{\text{res}} \to k\,\text{SS}_{\text{res}}\),\(n \to kn\)(\(p\) 不变):
$$\hat\sigma^2_{\text{new}} = \frac{k\,\text{SS}_{\text{res}}}{kn - p - 1} \approx \frac{k\,\text{SS}_{\text{res}}}{k(n-p-1)} = \hat\sigma^2 \quad (k\text{ 大时})$$
标准误 \(\text{SE}(\hat\beta)\):缩小到 \(1/\sqrt{k}\)
$$\text{SE}(\hat\beta) = \hat\sigma\sqrt{(X^TX)^{-1}}$$
复制后 \((X^TX)^{-1} \to \frac{1}{k}(X^TX)^{-1}\),\(\hat\sigma\) 不变:
$$\text{SE}_{\text{new}} = \hat\sigma\sqrt{\frac{1}{k}(X^TX)^{-1}} = \frac{1}{\sqrt{k}}\,\text{SE}(\hat\beta)$$
\(t\) 统计量:扩大 \(\sqrt{k}\) 倍
$$t_{\text{new}} = \frac{\hat\beta}{\text{SE}_{\text{new}}} = \frac{\hat\beta}{\text{SE}/\sqrt{k}} = \sqrt{k}\, t$$
\(p\) 值:变小(虚假显著性)
\(t\) 统计量变大 \(\sqrt{k}\) 倍,\(p\) 值急剧缩小,系数看起来"更显著"。
\(\hat\beta\)(系数)
不变
\(R^2\)
不变
\(\hat\sigma^2\)(残差方差)
近似不变
\(\text{SE}(\hat\beta)\)
缩小 \(1/\sqrt{k}\)
\(t\) 统计量
扩大 \(\sqrt{k}\)
\(p\) 值
变小(虚假显著)
核心洞察:数据复制增加了"样本量"的假象,使 \(t\) 统计量虚增,\(p\) 值虚减,产生虚假显著性。信息量并没有增加,但模型以为有了更多独立证据。这是数据泄露和 p-hacking 的一种形式。
来源:Quant 面经
\(x\) 是 10 维特征向量,\(y\) 是某股票明日收益,做 Ridge Regression,选 \(\lambda = \lambda_1\)。若数据不变但 \(x\) 扩充到 1000 维,\(\lambda\) 应变大还是变小?
答案与推导
\(\lambda\) 应变大
Ridge Regression 的目标函数:
$$\hat\beta_{\text{Ridge}} = \arg\min_\beta \; \underbrace{\|y - X\beta\|^2}_{\text{拟合}} + \lambda\underbrace{\|\beta\|^2}_{\text{正则化}}$$
从 MAP 角度:Ridge 等价于先验 \(\beta \sim \mathcal{N}(0, \frac{1}{2\lambda}I)\),\(\lambda = \frac{1}{2\tau^2}\)(\(\tau^2\) 是先验方差)。
为什么维度增加需要更大的 \(\lambda\)?
- 过拟合风险增加:从 10 维增到 1000 维,参数量从 10 增到 1000,但样本量不变。根据偏差-方差权衡,参数多时方差爆炸,需要更强的正则化来抑制过拟合。
- 有效自由度:Ridge 的有效自由度为 \(\text{df}(\lambda) = \sum_j \frac{d_j^2}{d_j^2+\lambda}\)(\(d_j\) 为奇异值)。维度增加后如果 \(\lambda\) 不变,有效自由度成比例增大,模型过于灵活。
- 稀疏性假设:1000 个特征中绝大多数与 y 无关,需要更强的惩罚把无关系数压向 0。
规律:特征维度 \(p\) 与样本量 \(n\) 的比值 \(p/n\) 是衡量过拟合风险的核心指标。\(p/n\) 从 \(10/n\) 增到 \(1000/n\),\(\lambda\) 需要相应增大约 100 倍(粗略估计)。
同样的 10 维 \(x\),若把 \(y\) 从"今天到明天的收益"改为"今天到 1 个月后的收益",\(\lambda\) 应变大还是变小?若把所有 \(y\) 都 rescale 到 \([0,1]\),分析是否变化?
答案与推导
\(\lambda\) 应变大(信噪比更低)
月度收益 = 日度收益之和,若假设日度收益 i.i.d.,则 30 天收益:
$$y_{\text{1month}} = \sum_{t=1}^{30} r_t$$
$$\operatorname{Var}(y_{\text{1month}}) = 30\,\operatorname{Var}(r_{\text{daily}})$$
信号(特征 \(x\) 能解释的部分)随时间增加有限,而噪声的方差随时间线性增加。月度收益的信噪比远低于日度收益:
$$\text{SNR} = \frac{\text{Signal}}{\text{Noise variance}} \propto \frac{1}{\sqrt{T}}$$
信噪比降低意味着过拟合风险增大,需要更强的正则化。
Rescale \(y\) 到 \([0,1]\) 的影响
Ridge 的 \(\hat\beta\) 对 \(y\) 的缩放是线性的:若 \(y \to cy\),则 \(\hat\beta \to c\hat\beta\)(\(\lambda\) 不变时)。但如果想保持同等的正则化"强度"(相对于系数的大小),需要调整 \(\lambda\):
$$\text{若 } y \to cy, \text{ 等价正则化需要 } \lambda \to c^2\lambda$$
因此 rescale \(y\) 会改变 \(\hat\beta\) 的量纲,若不同步调整 \(\lambda\),正则化的相对强度会变化。分析结论会改变——需要重新选择 \(\lambda\)。
实践建议:标准化 \(y\)(zero mean, unit variance)和 \(x\) 后再做 Ridge,这样 \(\lambda\) 的选择与量纲无关,交叉验证的结果更稳定。
MLE
\(\hat\theta = \arg\max_\theta \sum_i \log P(x_i|\theta)\)
MAP
\(\hat\theta = \arg\max_\theta \left[\sum_i \log P(x_i|\theta) + \log P(\theta)\right]\)
Normal MLE
\(\hat\mu = \bar x,\quad \hat\sigma^2 = \frac{1}{n}\sum(x_i-\bar x)^2\)(有偏,分母需 \(n-1\) 才无偏)
Normal MAP
\(\hat\mu = \frac{n\bar x/\sigma^2 + \mu_0/\tau^2}{n/\sigma^2 + 1/\tau^2}\)(shrinkage toward \(\mu_0\))
Z=X+Y 估 X
\(\mathbb{E}[X|Z] = \dfrac{\sigma_x^2}{\sigma_x^2+\sigma_y^2}\cdot Z\)(信号占总方差的权重)
多标尺加权
\(\hat\mu = \dfrac{\sum_i M_i/\sigma_i^2}{\sum_i 1/\sigma_i^2}\)(精度加权平均)
量角器修正
每角增加 \(\Delta = (180° - \sum x_i)/n\)(等精度时均匀分配误差)
硬币贝叶斯
\(P(F|D) = \dfrac{P(D|F)P(F)}{P(D|F)P(F)+P(D|U)P(U)}\)(标准贝叶斯公式)
联合正态
\(P(U>0,V>0) = \dfrac{1}{4}+\dfrac{1}{2\pi}\arcsin\!\left(\dfrac{\operatorname{Cov}(U,V)}{\sqrt{\operatorname{Var}(U)\operatorname{Var}(V)}}\right)\)
两两相关范围
\(\rho \in [-1/(n-1),\;1]\)(相关矩阵正半定条件)
斜率之积
\(\theta_1 \cdot \theta_2 = R^2 = \rho^2 \in [0,1]\)(两方向回归的斜率乘积等于决定系数)
数据复制×k
\(\hat\beta\)不变,\(R^2\)不变,\(\text{SE}\to\text{SE}/\sqrt{k}\),\(t\to t\sqrt{k}\),\(p\text{值}\downarrow\)(虚假显著)
Ridge ↔ MAP
\(\beta\sim\mathcal{N}(0,\tau^2)\) ⟺ \(\ell(\beta) - \lambda\|\beta\|^2\),其中 \(\lambda = 1/(2\tau^2)\)
LASSO ↔ MAP
\(\beta\sim\text{Laplace}(0,b)\) ⟺ \(\ell(\beta) - \lambda\|\beta\|_1\),其中 \(\lambda = 1/b\)
German Tank
\(\hat N_{\text{UMVUE}} = m_k + m_k/k - 1\),其中 \(m_k\) = 样本最大值,\(k\) = 样本量
Fisher Info
\(I(\theta) = -\mathbb{E}[\partial^2\ell/\partial\theta^2]\),Cramér-Rao: \(\text{Var}(\hat\theta)\geq 1/(nI(\theta))\)
面试答题框架(万能模板):
- 先确认:θ 是固定参数(MLE)还是随机变量(MAP/贝叶斯)?有无先验?
- 写出 likelihood,取 log,得目标函数
- 若有先验:加 \(\log P(\theta)\) 项,识别正则化类型(L2=Ridge, L1=LASSO)
- 对待估量求导令为 0,解出估计量
- 讨论有偏性;若有偏,给出无偏修正
- 检验大样本性质:一致性、渐近正态、Cramér-Rao 效率
- 给出直觉解释:精度加权、shrinkage 方向、信噪比含义
Prepared for Quant Researcher interviews · MLE & MAP · Princeton MFin ·
Yuchen Yu · SIG Superday Prep