\(X\) 为单次二值试验的结果:成功(\(X=1\))或失败(\(X=0\))。所有离散分布的基础构件。
这是二项分布 MGF 的基本单元:\(n\) 个独立 Bernoulli 的 MGF 乘积 \(= (1-p+pe^t)^n\),即 Binomial 的 MGF。
\(n\) 次独立伯努利试验中成功次数 \(X = X_1 + \cdots + X_n\),其中 \(X_i \overset{\text{iid}}{\sim} \text{Bern}(p)\)。
🔑 核心思路:指示变量分解 (Indicator Decomposition)
令 \(X_i = \mathbf{1}[\text{第}i\text{次试验成功}]\),则 \(X = \sum_{i=1}^n X_i\),每个 \(X_i \sim \text{Bern}(p)\)。
直接求和法(利用组合恒等式)
利用恒等式 \(k\binom{n}{k} = n\binom{n-1}{k-1}\):
(令 \(j=k-1\),括号内恰为二项式定理 \((p+(1-p))^{n-1}=1\)。)
利用二阶矩 E[X²] 直接推导
先求 \(E[X(X-1)]\)(下降阶乘矩):
利用恒等式 \(k(k-1)\binom{n}{k} = n(n-1)\binom{n-2}{k-2}\):
则 \(E[X^2] = E[X(X-1)] + E[X] = n(n-1)p^2 + np\)。
二项分布 MGF:\(M_X(t) = (1-p+pe^t)^n\)(\(n\) 个独立 Bern 的乘积)。
\(M_X'(t)\big|_{t=0} = n(1-p+pe^t)^{n-1}pe^t\big|_{t=0} = np\) ✓
每次试验独立,成功概率为 \(p \in (0,1)\)。\(X\) 为首次成功所需的试验次数(包含成功那次)。
Alternative convention: 有时定义 \(X\) 为首次成功之前的失败次数,此时支撑集为 \(\{0,1,2,\dots\}\),均值变为 \(\tfrac{1-p}{p}\),方差相同。本文采用前者。
令 \(q = 1-p\)。方法一:直接求和(幂级数微分法)
方法二:条件期望法 (Recursive / Law of Total Expectation)
设 \(\mu = E[X]\)。考虑第一次试验的结果:
右侧含义:若成功(概率 \(p\)),总共 1 次;若失败(概率 \(1-p\)),已用 1 次,后续重新开始还需 \(E[X]\) 次。
方法三:概率生成函数 (PGF)
几何分布的概率生成函数 \(G(z) = E[z^X]\):
由 PGF 性质 \(E[X] = G'(1)\):
利用 \(\mathrm{Var}(X) = E[X^2] - (E[X])^2\),先求 \(E[X(X-1)]\)(更方便):
对 \(\sum kq^{k-1} = \tfrac{1}{p^2}\) 再对 \(q\) 求导:
方法二:条件方差法 (Law of Total Variance)
设 \(I\) 为第一次试验结果(1=成功,0=失败)。由全方差公式:
条件均值:\(E[X|I=1]=1,\quad E[X|I=0]=1+\mu=1+\tfrac1p\)。
所以 \(E[X|I]\) 取值 1(概率 \(p\))或 \(1+\tfrac1p\)(概率 \(q\)):
条件方差:\(\mathrm{Var}(X|I=1)=0,\quad \mathrm{Var}(X|I=0)=\mathrm{Var}(X)=\sigma^2\)。
代入:
每次独立试验成功概率为 \(p\)。\(X\) 为第 \(r\) 次成功所需的总试验次数,\(r\in\mathbb{Z}^+\)。
前 \(k-1\) 次试验中恰好有 \(r-1\) 次成功(\(\binom{k-1}{r-1}\) 种选法),第 \(k\) 次必须成功。
🔑 核心思路:分解为 \(r\) 个独立几何分布之和
第 \(r\) 次成功等于:第1次成功的等待时间 \(T_1\),加上第2次成功的额外等待时间 \(T_2\),…… 其中 \(T_1, T_2, \ldots, T_r\stackrel{\text{iid}}{\sim}\mathrm{Geo}(p)\),且 $$X = T_1 + T_2 + \cdots + T_r$$
方法二:直接求和(负二项级数)
利用公式 \(\displaystyle\sum_{k=r}^\infty \binom{k-1}{r-1}q^{k-r}=\frac{1}{p^r}\cdot p^r = ??\),更优雅地:
利用恒等式 \(k\binom{k-1}{r-1} = r\binom{k}{r}\):
利用负二项级数 \(\sum_{k=r}^\infty\binom{k}{r}q^{k-r} = \tfrac{1}{p^{r+1}}\)(对应 \(\tfrac{1}{(1-q)^{r+1}}\) 的系数),整理得 \(E[X]=\tfrac{r}{p}\)。
验证:用 E[X²] 直接计算(完整版)
令 \(q=1-p\),需要 \(E[X(X-1)]\):
利用恒等式 \(k(k-1)\binom{k-1}{r-1} = r(r+1)\binom{k}{r+1}\)(类似前面的推导):
故:
更直接地展开:\(r(r+1)q + rp - r^2 = r[(r+1)q+p-r] = r[rq+q+p-r] = r[r(q-1)+1] = r[-rp+1]\)... 让我直接展开:
这不对。重新来:
似乎有误,应等于 \(rq\)。检查:\(rq = r(1-p)\)。用 \(r=1\) 验证:\(E[X^2]-E[X]^2 = \tfrac{1+q}{p^2}-\tfrac{1}{p^2}=\tfrac{q}{p^2}\)。对 \(r=1\),公式给 \(\tfrac{q}{p^2}\) ✓。
再来:\(\tfrac{r(r+1)q}{p^2}+\tfrac{r}{p}-\tfrac{r^2}{p^2} = \tfrac{r^2q+rq+rp-r^2}{p^2} = \tfrac{r^2(q-1)+r(q+p)}{p^2} = \tfrac{-r^2p+r}{p^2} = \tfrac{r(1-rp)}{p^2}\)。验证 \(r=1\):\(\tfrac{1-p}{p^2}=\tfrac{q}{p^2}\) ✓。而 \(\tfrac{r(1-rp)}{p^2}|_{r=1} = \tfrac{1-p}{p^2}\) ✓。实际上这等价于 \(\tfrac{rq}{p^2}\) 当 \(rp+rq = r\),即 \(1-rp = rq+(1-r)\)... 不对,直接验证 \(r=2\): \(\tfrac{2(1-2p)}{p^2}\neq\tfrac{2q}{p^2}\) unless \(1-2p=q\)... \(1-2p \ne 1-p=q\)。所以我计算有误。
修正:利用更简单的方法——直接用独立性:\(\mathrm{Var}(X)=r\cdot\mathrm{Var}(T_1) = r\cdot\tfrac{q}{p^2}\)。
- \(N\) — 总体大小(Population size)
- \(K\) — 总体中"成功"个数(Number of successes in population)
- \(n\) — 抽取样本量(Sample size drawn without replacement)
- \(X\) — 样本中成功个数(Number of successes in sample)
🔑 核心思路:指示变量分解 (Indicator Variables)
设第 \(i\) 次抽取是否为"成功"的指示变量为 \(X_i\)(\(i=1,\ldots,n\)),则 \(X = X_1 + X_2 + \cdots + X_n\)。 由对称性,每次抽到成功的概率均为 \(P(X_i=1) = K/N\)(无论是否放回,每个位置等概率)。
为什么 P(X_i = 1) = K/N?对称性论证
无放回抽样中,第 \(i\) 个位置抽到特定元素的概率不依赖 \(i\),因为所有 \(N!\) 种排列等可能。形式上:
Wait, let's redo: \(P(X_i=1)\) = (ways to pick 1 success for position \(i\)) × (ways for other \(n-1\) positions) / total = the marginal probability that position \(i\) is a success. By symmetry of all positions:
Direct check: \(\sum_i E[X_i] = nK/N\). Also \(E[X] = \sum_k k P(X=k)\) must equal \(nK/N\) — this is consistent. The key insight is that "which position gets which ball" is uniform, so each position has the same marginal probability of being a success.
直接求和法(利用超几何恒等式)
利用恒等式 \(k\binom{K}{k} = K\binom{K-1}{k-1}\):
令 \(j=k-1\),利用 Vandermonde 卷积 \(\sum_j\binom{K-1}{j}\binom{N-K}{n-1-j} = \binom{N-1}{n-1}\):
仍用指示变量法。令 \(p_0=K/N\),\(q_0=1-p_0=(N-K)/N\)。
计算 \(E[X_i X_j] = P(X_i=1, X_j=1)\),即两次都抽到"成功"的概率:
(第一次抽到成功概率 \(K/N\),无放回后第二次条件概率 \((K-1)/(N-1)\)。)
共 \(n\) 个对角项,\(\binom{n}{2}=\tfrac{n(n-1)}{2}\) 个交叉项(每对出现一次,乘以2后共 \(n(n-1)\) 项):
与二项分布 \(B(n,p_0)\) 方差 \(np_0 q_0\) 相比,超几何方差多了一个乘子:
- 当 \(N\to\infty\)(总体很大),FPC \(\to 1\),超几何 → 二项。
- 当 \(n=N\)(全部抽走),FPC \(=0\),方差 \(=0\)(此时 \(X=K\) 确定)。
- 无放回抽样比有放回方差更小:因为同一总体中重复抽取会引入额外变异。
数值验证例:N=10, K=4, n=3
均值:\(E[X]=3\times4/10=1.2\)。
方差:\(3\times(4/10)\times(6/10)\times(7/9)=3\times0.24\times(7/9)=0.72\times0.7\overline{7}=0.56\)。
二项方差:\(3\times0.4\times0.6=0.72\),超几何方差 \(=0.72\times(7/9)\approx0.56\) < 0.72 ✓(无放回方差更小)。
- \(\lambda\) — 单位时间(或区域)内事件的平均发生次数(rate)
- \(X\) — 实际发生次数(Number of events in a fixed interval)
极限推导:Poisson 作为 Binom(n,p) 的极限
令 \(n\to\infty,\;p\to 0\),保持 \(\lambda = np\) 不变(稀有事件极限)。
均值自然继承:\(E[\text{Binom}] = np = \lambda\),取极限后 Poisson 均值也为 \(\lambda\)。
利用下降阶乘矩 \(E[X(X-1)]\) 计算二阶矩。
Poisson 分布的均值与方差相等,均为 \(\lambda\)。实际数据中若 \(\hat{\sigma}^2 \approx \bar{x}\),常用 Poisson 建模(如保险索赔次数、网页点击数)。
若 \(\mathrm{Var}(X) > E[X]\)(过度离散 overdispersion),则考虑负二项分布;若 \(\mathrm{Var}(X) < E[X]\)(欠离散),则考虑二项分布。
MGF 法验证
Poisson 的 MGF:\(M_X(t) = e^{\lambda(e^t - 1)}\)。
泊松过程背景:为什么均值=方差?
泊松过程是满足以下条件的计数过程:(1)事件独立;(2)在极短时间 \(dt\) 内发生一次的概率为 \(\lambda\,dt\);(3)\(dt\) 内发生两次的概率可忽略。
将 \([0,1]\) 分成 \(n\) 份,每份发生概率 \(p = \lambda/n\)。当 \(n\to\infty\),每份独立,总计数 \(\to \text{Pois}(\lambda)\)。
这一"独立稀有叠加"结构天然导致均值 = 方差:离散事件的计数变异性与其期望强度完全匹配。
\(X\) 在 \(\{a, a+1, \ldots, b\}\) 上均匀分布,每个整数取到概率相等。
对称性论证(最简法)
PMF 关于 \((a+b)/2\) 完全对称,因此均值 = 中位数 = 对称中心 \(= \dfrac{a+b}{2}\)。这是对称分布的通用结论,无需计算。
标准六面骰(\(n=6, a=1, b=6\)):均值 \(= 3.5\),方差 \(= (36-1)/12 = 35/12 \approx 2.917\)。
一般区间 \([a,b]\) 上:平移不改变方差,故 \(\mathrm{Var}(X) = \dfrac{(b-a+1)^2-1}{12}\)。
\(\sum_{k=1}^n k^2\) 公式的推导
用"telescoping"法:注意 \((k+1)^3 - k^3 = 3k^2 + 3k + 1\),对 \(k=1\) 到 \(n\) 求和得:
整理即得 \(\sum_{k=1}^n k^2 = \dfrac{n(n+1)(2n+1)}{6}\)。
| Distribution | PMF | Support | Mean | Variance | Key Trick / Note |
|---|---|---|---|---|---|
Bernoulli Bern(p) |
\(p^k(1-p)^{1-k}\) | \(\{0,1\}\) | \(p\) | \(p(1-p)\) | \(X^2=X\),方差最大于 \(p=\tfrac{1}{2}\) |
Binomial Bin(n,p) |
\(\binom{n}{k}p^k(1-p)^{n-k}\) | \(\{0,\ldots,n\}\) | \(np\) | \(np(1-p)\) | \(n\) 个 iid Bern(p) 之和 |
Geometric Geo(p) |
\((1-p)^{k-1}p\) | \(k=1,2,3,\ldots\) | \(\dfrac{1}{p}\) | \(\dfrac{1-p}{p^2}\) | 无记忆性;递推 \(\mu=1+q\mu\) |
Neg. Binomial NB(r,p) |
\(\binom{k-1}{r-1}p^r(1-p)^{k-r}\) | \(k=r,r{+}1,\ldots\) | \(\dfrac{r}{p}\) | \(\dfrac{r(1-p)}{p^2}\) | \(r\) 个 iid Geo(p) 之和 |
Hypergeometric HG(N,K,n) |
\(\dfrac{\binom{K}{k}\binom{N-K}{n-k}}{\binom{N}{n}}\) | \(0\le k\le\min(n,K)\) | \(\dfrac{nK}{N}\) | \(n\dfrac{K}{N}\dfrac{N-K}{N}\dfrac{N-n}{N-1}\) | 无放回;FPC \(=\tfrac{N-n}{N-1}\le 1\) |
Poisson Pois(λ) |
\(\dfrac{\lambda^k e^{-\lambda}}{k!}\) | \(k=0,1,2,\ldots\) | \(\lambda\) | \(\lambda\) | 均值 = 方差;Binom 极限 |
Discrete Uniform \(\{a,\ldots,b\}\) |
\(\dfrac{1}{b-a+1}\) | \(a,a{+}1,\ldots,b\) | \(\dfrac{a+b}{2}\) | \(\dfrac{(b-a+1)^2-1}{12}\) | 对称性 → 均值=中位数 |
- Bern(p) ×n → Bin(n,p)
- Bin(n,p) →\(n\to\infty\) Pois(λ)
- Geo(p) ×r → NB(r,p)
- Hyper(N,K,n) →\(N\to\infty\) Bin(n, K/N)
对计数数据:
- \(\mathrm{Var} = E[X]\):Poisson
- \(\mathrm{Var} < E[X]\):Binomial(欠离散)
- \(\mathrm{Var} > E[X]\):NB(过度离散)
Bernoulli:最简单;\(X^2=X\) 是关键。Binomial:\(n\) 个 Bern 之和,指示变量拆分秒推均值。Geometric:递推法一行求解 \(E[X]=1/p\),无记忆性。NB:\(r\) 个 Geo 之和,方差线性扩展。Hypergeometric:无放回,方差乘修正因子 \(\tfrac{N-n}{N-1}\)。Poisson:均值=方差=\(\lambda\),稀有事件建模首选。离散均匀:对称取中点,方差用 \(\sum k^2\) 公式。