01

Jensen 不等式

定理 · Jensen Inequality

设 $\varphi$ 为凸函数,$X$ 为可积随机变量,则

$$\varphi\!\bigl(\mathbb{E}[X]\bigr) \;\le\; \mathbb{E}\!\bigl[\varphi(X)\bigr]$$

等号成立当且仅当:$X$ a.s. 为常数,或 $\varphi$ 在 $X$ 的值域上是线性的。

推导

设 $m = \mathbb{E}[X]$。凸函数在任意点处存在支撑超平面(次梯度),故 $\exists\, a,b$ 使得

$$\varphi(x) \;\ge\; ax + b \quad\forall x, \qquad \varphi(m) = am + b$$

对两边取期望:$\mathbb{E}[\varphi(X)] \ge a\mathbb{E}[X] + b = am + b = \varphi(m)$。$\square$

条件版本(给定 $\sigma$-域 $\mathcal{G}$):

$$\varphi\!\bigl(\mathbb{E}[X\mid\mathcal{G}]\bigr) \;\le\; \mathbb{E}\!\bigl[\varphi(X)\mid\mathcal{G}\bigr]$$

凹函数($\varphi'' \le 0$,如 $\log x$)时不等号方向反转:$\varphi(\mathbb{E}[X]) \ge \mathbb{E}[\varphi(X)]$。

例题 1 AM–GM 不等式(算术平均 ≥ 几何平均)

证明:对正数 $x_1,\ldots,x_n$,

$$\frac{x_1+\cdots+x_n}{n} \;\ge\; (x_1\cdots x_n)^{1/n}$$

令 $X$ 为在 $\{x_1,\ldots,x_n\}$ 上均匀分布的离散随机变量。因 $\log$ 是凹函数,Jensen 给出

$$\log\!\left(\frac{\sum x_i}{n}\right) = \log\mathbb{E}[X] \;\ge\; \mathbb{E}[\log X] = \frac{\sum \log x_i}{n} = \log(x_1\cdots x_n)^{1/n}$$

两边取指数即得。$\square$

例题 2 指数分布 MLE 的偏性

$X_i \sim \text{Exp}(\lambda)$,MLE 为 $\hat\lambda = 1/\bar{X}$。说明 $\hat\lambda$ 有偏。

$\varphi(t) = 1/t$ 在 $t>0$ 上是凸函数($\varphi'' = 2/t^3 > 0$)。Jensen 给出

$$\mathbb{E}\!\left[\frac{1}{\bar{X}}\right] \;\ge\; \frac{1}{\mathbb{E}[\bar{X}]} = \frac{1}{1/\lambda} = \lambda$$

精确值:$\sum X_i \sim \text{Gamma}(n, 1/\lambda)$,利用负矩公式 $\mathbb{E}[1/Y]=\frac{1}{\beta(\alpha-1)}$:

$$\mathbb{E}[\hat\lambda] = n\cdot\mathbb{E}\!\left[\frac{1}{\sum X_i}\right] = n\cdot\frac{\lambda}{n-1} = \frac{n}{n-1}\lambda > \lambda$$

无偏修正:$\hat\lambda_{\text{unbiased}} = \dfrac{n-1}{n}\cdot\dfrac{1}{\bar{X}}$。

例题 3 $\mathbb{E}[X^2] \ge (\mathbb{E}[X])^2$

证明方差非负,即 $\text{Var}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2 \ge 0$。

$\varphi(x)=x^2$ 凸($\varphi''=2>0$),Jensen 直接给出 $\mathbb{E}[X^2] \ge (\mathbb{E}[X])^2$。$\square$

02

期望迭代 · 方差分解

全期望公式 (Law of Total Expectation)
$$\mathbb{E}[X] = \mathbb{E}\!\bigl[\mathbb{E}[X\mid Y]\bigr]$$
全方差公式 / Eve's Law (Law of Total Variance)
$$\text{Var}(X) \;=\; \underbrace{\mathbb{E}\!\bigl[\text{Var}(X\mid Y)\bigr]}_{\text{组内方差(期望)}} \;+\; \underbrace{\text{Var}\!\bigl(\mathbb{E}[X\mid Y]\bigr)}_{\text{组间方差}}$$

记忆口诀:Var = E[Var] + Var[E](先条件,再各自求方差/期望,最后取外层)。

推导
$$\text{Var}(X) = \mathbb{E}[X^2] - (\mathbb{E}[X])^2$$

利用 $\mathbb{E}[X^2] = \mathbb{E}[\mathbb{E}[X^2\mid Y]]$ 及 $\mathbb{E}[X^2\mid Y] = \text{Var}(X\mid Y) + (\mathbb{E}[X\mid Y])^2$:

$$= \mathbb{E}[\text{Var}(X\mid Y)] + \mathbb{E}[(\mathbb{E}[X\mid Y])^2] - (\mathbb{E}[\mathbb{E}[X\mid Y]])^2 = \mathbb{E}[\text{Var}(X\mid Y)] + \text{Var}(\mathbb{E}[X\mid Y]) \quad\square$$
例题 4 混合泊松模型

设 $\Lambda \sim \text{Gamma}(\alpha, \beta)$,$X\mid\Lambda \sim \text{Poisson}(\Lambda)$。求 $\text{Var}(X)$。

已知 $\mathbb{E}[X\mid\Lambda]=\Lambda$,$\text{Var}(X\mid\Lambda)=\Lambda$(泊松性质)。

$$\text{Var}(X) = \mathbb{E}[\Lambda] + \text{Var}(\Lambda) = \alpha\beta + \alpha\beta^2 = \alpha\beta(1+\beta)$$

(负二项分布的方差公式)。

例题 5 随机样本量的方差

$N$ 为随机变量,$X_1,X_2,\ldots$ i.i.d.,$S_N = X_1+\cdots+X_N$,$N\perp X_i$。求 $\text{Var}(S_N)$。

$\mathbb{E}[S_N\mid N]=N\mu$,$\text{Var}(S_N\mid N)=N\sigma^2$,故

$$\text{Var}(S_N) = \mathbb{E}[N\sigma^2] + \text{Var}(N\mu) = \sigma^2\mathbb{E}[N] + \mu^2\text{Var}(N)$$

这与 Wald 方程配合使用极为常见。

03

$L^p$ 范数

定义

离散/向量:$\|x\|_p = \left(\sum_i |x_i|^p\right)^{1/p}$,$1\le p < \infty$;$\|x\|_\infty = \max_i|x_i|$。

随机变量:$\|X\|_p = \left(\mathbb{E}|X|^p\right)^{1/p}$。

范数几何形状(二维单位球)直觉
$L^1$菱形(Manhattan)各坐标绝对值之和;更均匀
$L^2$圆形(Euclidean)标准距离
$L^\infty$正方形取最大坐标;关注峰值
性质:$p$ 越小越均匀,$p$ 越大越重视峰值

对固定向量 $x$,若 $p \le q$,则 $\|x\|_p \ge \|x\|_q$(即 $\|x\|_1 \ge \|x\|_2 \ge \cdots \ge \|x\|_\infty$)。

对偶范数

$L^p$ 的对偶范数是 $L^q$,其中 $\frac{1}{p}+\frac{1}{q}=1$。定义为

$$\|y\|_q = \sup_{\|x\|_p \le 1} \langle x, y\rangle$$

"从 $y$ 方向看单位球能延伸多远。" $L^1 \leftrightarrow L^\infty$,$L^2$ 自对偶。

ML 应用:正则化与稀疏性

$L^1$ 正则化(Lasso):最优性条件 $0 \in \nabla f(w^*) + \lambda\partial\|w\|_1$,其中次梯度集 $\partial\|w\|_1 = \{g : g_i = \text{sign}(w_i)$ 若 $w_i\ne 0$,$g_i\in[-1,1]$ 若 $w_i=0\}$。若 $|\nabla_i f(w^*)| < \lambda$,则 $w_i^*=0$(稀疏)。

04

Cauchy–Schwarz 不等式

定理
$$|\mathbb{E}[XY]|^2 \;\le\; \mathbb{E}[X^2]\,\mathbb{E}[Y^2]$$

等号成立 iff $X = cY$ a.s.($c$ 为常数)。向量版本:$|\langle x,y\rangle| \le \|x\|_2\|y\|_2$,即 $(\sum x_i y_i)^2 \le (\sum x_i^2)(\sum y_i^2)$。

本质:$\langle x,y\rangle = \|x\|\|y\|\cos\theta \le \|x\|\|y\|$。

推导(判别式法)

对任意 $t\in\mathbb{R}$,$0 \le \mathbb{E}[(X+tY)^2] = \mathbb{E}[X^2] + 2t\mathbb{E}[XY] + t^2\mathbb{E}[Y^2]$。

此关于 $t$ 的二次函数恒非负,故判别式 $\Delta = 4(\mathbb{E}[XY])^2 - 4\mathbb{E}[X^2]\mathbb{E}[Y^2] \le 0$。$\square$

应用:相关系数 $|\rho| \le 1$

令 $U = \frac{X-\mu_X}{\sigma_X}$,$V = \frac{Y-\mu_Y}{\sigma_Y}$,则 $|\rho| = |\mathbb{E}[UV]| \le \sqrt{\mathbb{E}[U^2]\mathbb{E}[V^2]} = 1$。

例题 6 $X \perp Y$,$Y > 0$,证明 $\frac{1}{\mathbb{E}[Y]} \le \mathbb{E}\!\left[X \cdot \frac{1}{Y}\right]$ 的上界

$X, Y$ 独立,$Y > 0$。利用 C-S 证明 $1 = (\mathbb{E}[\sqrt{X/Y}\cdot\sqrt{Y}])^2 \le \mathbb{E}[X/Y]\cdot\mathbb{E}[Y]$(即 $\frac{1}{\mathbb{E}[Y]} \le \mathbb{E}[X/Y]/\mathbb{E}[X]$,设 $\mathbb{E}[X]=1$)。

令 $A=\sqrt{X/Y}$,$B=\sqrt{Y}$。C-S:$(\mathbb{E}[AB])^2 \le \mathbb{E}[A^2]\mathbb{E}[B^2]$,即 $(\mathbb{E}[\sqrt{X}])^2 \le \mathbb{E}[X/Y]\cdot\mathbb{E}[Y]$,故 $\mathbb{E}[X/Y] \ge (\mathbb{E}[\sqrt{X}])^2/\mathbb{E}[Y]$。

05

Hölder 不等式

定理

设 $p > 1$,$q > 1$,$\frac{1}{p}+\frac{1}{q}=1$,则

$$\mathbb{E}[|XY|] \;\le\; \|X\|_p\,\|Y\|_q = \bigl(\mathbb{E}|X|^p\bigr)^{1/p}\bigl(\mathbb{E}|Y|^q\bigr)^{1/q}$$

等号成立 iff $|X|^p = c|Y|^q$ a.s.。C-S 是 $p=q=2$ 的特例。

由 Young 不等式推导

不妨设 $\|X\|_p = \|Y\|_q = 1$。对 $a = |X|$,$b = |Y|$,$\lambda = 1/p$ 应用 Young 不等式:

$$|X||Y| \le \frac{|X|^p}{p} + \frac{|Y|^q}{q}$$

取期望:$\mathbb{E}[|XY|] \le \frac{1}{p}+\frac{1}{q} = 1 = \|X\|_p\|Y\|_q$。$\square$

06

Young 不等式

定理

$a, b \ge 0$,$p, q > 1$,$\frac{1}{p}+\frac{1}{q}=1$,则

$$ab \;\le\; \frac{a^p}{p} + \frac{b^q}{q}$$

等号成立 iff $a^p = b^q$。

由 Jensen 推导($e^x$ 是凸函数)

令 $\lambda = 1/p$,$1-\lambda = 1/q$,$x = \ln a^p$,$y = \ln b^q$。$e^x$ 凸,Jensen:

$$e^{\lambda x + (1-\lambda)y} \le \lambda e^x + (1-\lambda)e^y$$ $$\Rightarrow\quad e^{\frac{\ln a^p}{p}+\frac{\ln b^q}{q}} = ab \;\le\; \frac{a^p}{p}+\frac{b^q}{q} \quad\square$$
07

Minkowski 不等式(三角不等式的 $L^p$ 版)

定理
$$\|X+Y\|_p \;\le\; \|X\|_p + \|Y\|_p, \quad p \ge 1$$

即 $L^p$ 范数满足三角不等式(范数公理之一)。由 Hölder 不等式证明。

08

Markov 不等式

定理

$X \ge 0$,$a > 0$,则

$$\Pr(X \ge a) \;\le\; \frac{\mathbb{E}[X]}{a}$$
推导
$$X \ge a \cdot \mathbf{1}_{\{X \ge a\}} \quad\Rightarrow\quad \mathbb{E}[X] \ge a\cdot\Pr(X \ge a) \quad\square$$
局限性

Markov 仅利用了均值信息,界通常非常松。例如 $\mathbb{E}[X]=5$,$\Pr(X\ge 20)\le 1/4$——仅知道"至多 25%",实际可能远小。

例题 7 股票损失概率上界

某资产日收益率(损失取正值)$L \ge 0$,$\mathbb{E}[L] = 0.02$。问日损失超过 10% 的概率上界。

$$\Pr(L \ge 0.10) \le \frac{0.02}{0.10} = 0.20$$

即最多有 20% 的天数日亏损超过 10%。

09

Chebyshev 不等式

定理
$$\Pr\!\bigl(|X - \mu| \ge t\bigr) \;\le\; \frac{\sigma^2}{t^2}$$

其中 $\mu = \mathbb{E}[X]$,$\sigma^2 = \text{Var}(X)$,$t > 0$。

由 Markov 推导

令 $Y = (X-\mu)^2 \ge 0$,对 $Y$ 应用 Markov,$a = t^2$:

$$\Pr(|X-\mu|\ge t) = \Pr(Y \ge t^2) \le \frac{\mathbb{E}[Y]}{t^2} = \frac{\sigma^2}{t^2} \quad\square$$
置信区间构造

令 $1 - \delta = 1 - \sigma^2/t^2$,解得 $t = \sigma/\sqrt{\delta}$,故以至少 $1-\delta$ 的概率有 $|X-\mu| < \sigma/\sqrt{\delta}$。

例题 8 样本均值的置信界

$X_1,\ldots,X_n$ i.i.d.,$\text{Var}(X_i)=\sigma^2$。$\bar{X}_n = \frac{1}{n}\sum X_i$。问 $\Pr(|\bar{X}_n - \mu| \ge \varepsilon)$ 的上界。

$\text{Var}(\bar{X}_n) = \sigma^2/n$,Chebyshev 给出

$$\Pr(|\bar{X}_n - \mu| \ge \varepsilon) \le \frac{\sigma^2}{n\varepsilon^2}$$

这直接证明了大数定律(弱收敛):固定 $\varepsilon$,$n\to\infty$ 时右侧趋于 0。

10

Cantelli 不等式(单边 Chebyshev)

定理
$$\Pr(X - \mu \ge t) \;\le\; \frac{\sigma^2}{\sigma^2 + t^2}, \quad t > 0$$

与 Chebyshev 的双边界不同,Cantelli 给出单边(上尾)的更紧的界。

推导(令 $Y = X - \mu + \lambda$,优化 $\lambda$)

对 $Y = X - \mu + \lambda \ge 0$($\lambda > 0$)应用 Markov:

$$\Pr(X-\mu \ge t) = \Pr(Y \ge t+\lambda) \le \frac{\mathbb{E}[Y^2]}{(t+\lambda)^2} = \frac{\sigma^2 + \lambda^2}{(t+\lambda)^2}$$

对 $\lambda$ 最小化右侧,令导数为零得 $\lambda^* = \sigma^2/t$,代入得

$$\Pr(X-\mu \ge t) \le \frac{\sigma^2}{\sigma^2+t^2} \quad\square$$
金融应用:单边风控 / VaR 上界

给定资产收益 $R$,$\mu = \mathbb{E}[R]$,$\sigma^2 = \text{Var}(R)$。损失 $L = -R$,则

$$\Pr(L \ge \mu_L + t) \le \frac{\sigma^2}{\sigma^2 + t^2}$$

可用于在分布未知时估计 VaR 的无分布上界。

例题 9 Cantelli vs Chebyshev 对比

$\sigma = 3$,$t = 9$。分别用 Chebyshev 和 Cantelli 给出 $\Pr(X-\mu \ge 9)$ 的上界。

Chebyshev(双边除以 2 近似单边):$\Pr(|X-\mu|\ge 9) \le \frac{9}{81} = \frac{1}{9} \approx 11.1\%$,单边至多 $11.1\%$。

Cantelli(直接单边):$\Pr(X-\mu \ge 9) \le \frac{9}{9+81} = \frac{9}{90} = \frac{1}{10} = 10\%$。

Cantelli 给出更紧的单边界($10\%$ vs $11.1\%$)。

11

Chernoff 界(指数矩方法)

一般形式

对任意 $s > 0$,

$$\Pr(X \ge a) \;\le\; \inf_{s>0} e^{-sa}\,\mathbb{E}[e^{sX}] = \inf_{s>0} e^{-sa + \log M_X(s)}$$

其中 $M_X(s) = \mathbb{E}[e^{sX}]$ 为矩母函数 (MGF)

由 Markov 推导

$e^{sx}$ 单调递增,故 $X \ge a \Leftrightarrow e^{sX} \ge e^{sa}$。Markov:

$$\Pr(X \ge a) = \Pr(e^{sX} \ge e^{sa}) \le \frac{\mathbb{E}[e^{sX}]}{e^{sa}} = e^{-sa} M_X(s)$$

对 $s > 0$ 取下确界。$\square$

例题 10 Bernoulli 求和的 Chernoff 界

$X_i \sim \text{Bernoulli}(p)$ i.i.d.,$S_n = \sum_{i=1}^n X_i$,$\mu = np$。证明对 $\delta > 0$:

$$\Pr(S_n \ge (1+\delta)\mu) \le \left(\frac{e^\delta}{(1+\delta)^{1+\delta}}\right)^\mu$$
解(思路)

$M_{X_i}(s) = 1 - p + pe^s$。故 $M_{S_n}(s) = (1-p+pe^s)^n$。

Chernoff:$\Pr(S_n \ge a) \le e^{-sa}(1-p+pe^s)^n$,令 $a = (1+\delta)\mu$,$s = \ln(1+\delta)$ 优化后得上式。

指数衰减速率远优于 Chebyshev 的多项式衰减,适合大偏差分析。

Hoeffding 不等式(有界随机变量)

若 $a_i \le X_i \le b_i$,$S_n = \sum X_i$,则

$$\Pr\!\left(S_n - \mathbb{E}[S_n] \ge t\right) \;\le\; \exp\!\left(-\frac{2t^2}{\sum_{i=1}^n (b_i-a_i)^2}\right)$$
12

Wald 方程

定理

设 $X_1, X_2, \ldots$ i.i.d.,$N$ 为非负整数值随机变量,$N \perp (X_1, X_2, \ldots)$,$\mathbb{E}|X_i| < \infty$,$\mathbb{E}[N] < \infty$。令 $S_N = X_1 + \cdots + X_N$,则

$$\mathbb{E}[S_N] \;=\; \mathbb{E}[N]\cdot\mathbb{E}[X_i]$$

此外(Wald 二阶方程):

$$\text{Var}(S_N) \;=\; \mathbb{E}[N]\cdot\text{Var}(X_i) + \bigl(\mathbb{E}[X_i]\bigr)^2\cdot\text{Var}(N)$$
推导(全期望)
$$\mathbb{E}[S_N] = \mathbb{E}[\mathbb{E}[S_N \mid N]] = \mathbb{E}[N \cdot \mathbb{E}[X_i]] = \mathbb{E}[N]\cdot\mu$$

方差部分由全方差公式(§2)直接给出,与例题 5 完全一致。

例题 11 赌徒问题(随机步数的总盈亏)

赌徒每局赢 $+1$ 或输 $-1$,各以 $1/2$ 概率。博弈在第 $N$ 局停止,$N \sim \text{Geom}(p)$ 独立于每局结果。求总盈亏 $S_N$ 的期望和方差。

$\mathbb{E}[X_i]=0$,$\text{Var}(X_i)=1$,$\mathbb{E}[N]=1/p$,$\text{Var}(N)=(1-p)/p^2$。

$$\mathbb{E}[S_N] = \mathbb{E}[N]\cdot 0 = 0$$ $$\text{Var}(S_N) = \frac{1}{p}\cdot 1 + 0^2\cdot\frac{1-p}{p^2} = \frac{1}{p}$$
例题 12 复合泊松过程

保险理赔:$N \sim \text{Poisson}(\lambda)$ 次理赔,每次金额 $X_i$ i.i.d.,$\mathbb{E}[X_i]=\mu_X$,$\text{Var}(X_i)=\sigma_X^2$。求总理赔 $S_N$ 的均值和方差。

$\mathbb{E}[N]=\text{Var}(N)=\lambda$(泊松性质),故

$$\mathbb{E}[S_N] = \lambda\mu_X, \qquad \text{Var}(S_N) = \lambda\sigma_X^2 + \mu_X^2\lambda = \lambda(\sigma_X^2 + \mu_X^2) = \lambda\mathbb{E}[X_i^2]$$
13

集中不等式对比表

不等式 形式 所需信息 衰减速率 适用场景
Markov $\Pr(X\ge a)\le \mu/a$ $\mathbb{E}[X]$ $O(1/a)$,多项式 最弱,兜底
Chebyshev $\Pr(|X-\mu|\ge t)\le \sigma^2/t^2$ 均值 + 方差 $O(1/t^2)$,多项式 双边,LLN 证明
Cantelli $\Pr(X-\mu\ge t)\le \sigma^2/(\sigma^2+t^2)$ 均值 + 方差 $O(1/t^2)$,比 C 紧 单边,VaR 上界
Chernoff $\Pr(X\ge a)\le e^{-sa}M_X(s)$ MGF 存在 指数衰减 大偏差,尾部极细
Hoeffding $\Pr(S_n - \mu \ge t)\le e^{-2t^2/\sum(b_i-a_i)^2}$ 有界区间 指数衰减 有界 r.v.,ML 泛化
强弱关系

Markov $\Rightarrow$ Chebyshev(令 $Y=(X-\mu)^2$)$\Rightarrow$ Cantelli(优化辅助参数)。Chernoff 由 Markov 作用于 $e^{sX}$ 得到,是所有多项式界的指数加强版。