01

六大经典假设

线性回归模型 y = Xβ + ε 成立依赖六个核心假设(CLM假设)。违反任意一个都有可预测的后果,且对应不同的修复方案。

A1 · Linearity
线性性

模型在参数β上是线性的:y = Xβ + ε。
注意:变量可以非线性(log x, x²),只要参数是线性的即可。
违反:残差有系统性非线性模式,估计不可靠。
修复:对变量做变换(取log, 开方),加交叉项 x₁x₂,使用非线性模型。

A2 · Random Sampling / Independence
随机抽样与独立性

观测值独立同分布,无自相关:Cov(εᵢ, εⱼ) = 0(i ≠ j)。
也称为"No Autocorrelation"假设。
违反:标准误有偏,F检验失效,OLS仍无偏但非BLUE。
修复:ARIMA,Newey-West稳健标准误,GLS。

A3 · No Perfect Multicollinearity
无完全多重共线性

无常数变量,X无精确线性关系,X满列秩(full rank),(XᵀX)可逆。
违反:(XᵀX)不可逆,β̂无法计算(完全共线性);或标准误膨胀(近似共线性)。
修复:Ridge回归,删除变量,PCA降维。

A4 · Zero Conditional Mean / Exogeneity
零条件均值(外生性)

E[ε | X] = 0,即对任意可测函数g(X),E[g(X)·ε] = 0(正交条件)。
严格外生性:E[εᵢ | X₁,…,Xₙ] = 0
弱外生性:E[εᵢ | Xᵢ] = 0
违反(内生性):β̂有偏且不一致,标准误错误。
修复:IV/2SLS,加回省略变量。

A5 · Homoskedasticity
同方差性

Var(εᵢ | X) = σ²(常数,与i无关)。
结合A2,有 Var(ε) = σ²I。
这是Gauss-Markov定理要求OLS为BLUE的关键条件之一。
违反(异方差):OLS仍无偏,但标准误有偏,不是BLUE。
修复:稳健标准误(HC),WLS,变量变换。

A6 · Normality
误差正态性

ε ~ N(0, σ²I)(正态分布)。
在A1-A5下,OLS已是BLUE。A6额外保证有限样本下t检验和F检验严格成立。
大样本下由CLT可近似正态,A6可以不要求。
违反:小样本推断失效;大样本影响较小。

⚠ 重要区分: A1–A3是识别条件(β̂可以被计算出来);A4使OLS无偏;A4+A5使OLS成为BLUE;A6使精确推断成立。
02

Gauss-Markov 定理 & BLUE

Gauss-Markov 定理

在假设 A1–A5(线性、随机抽样、无完全多重共线性、E[ε|X]=0、同方差)下,OLS 估计量是 最优线性无偏估计量(BLUE:Best Linear Unbiased Estimator)

即:在所有线性无偏估计量中,OLS 的方差最小。

BLUE 的三个要求

B
Best(最优)

在同类估计量中方差最小,即最有效率(efficient)。

L
Linear(线性)

估计量是观测值y的线性函数:β̂ = Cy,其中C是某个矩阵。

UE
Unbiased(无偏)

E[β̂] = β,期望值等于真实参数。

OLS 估计量的方差

OLS估计量$\hat{\beta}_{OLS} = (X^\top X)^{-1}X^\top y$
同方差方差$\text{Var}(\hat{\beta}) = \sigma^2(X^\top X)^{-1}$
三明治形式$\text{Var}(\hat{\beta}) = (X^\top X)^{-1}\cdot[X^\top \Omega X]\cdot(X^\top X)^{-1}$,其中 $\Omega = \text{Var}(\varepsilon)$

OLS 的性质总结

违反假设无偏?一致?BLUE?标准误?
全部满足 A1-A5✓ 无偏✓ 一致✓ BLUE✓ 正确
仅违反同方差(A5)✓ 无偏✓ 一致✗ 非BLUE✗ 有偏
仅违反独立性(A2)✓ 无偏✓ 一致✗ 非BLUE✗ 有偏
违反外生性(A4)✗ 有偏✗ 不一致✗ 非BLUE✗ 错误
Example 1

证明 OLS 是线性无偏估计量

设 β̂ = (XᵀX)⁻¹Xᵀy,代入 y = Xβ + ε:

代入y$\hat{\beta} = (X^\top X)^{-1}X^\top(X\beta+\varepsilon) = \beta + (X^\top X)^{-1}X^\top\varepsilon$
取期望$E[\hat{\beta}\mid X] = \beta + (X^\top X)^{-1}X^\top \underbrace{E[\varepsilon\mid X]}_{=0\,(A4)} = \beta\quad\checkmark$
结论: OLS 在 A4 下是无偏的。无偏性 不需要 同方差假设 A5,只需要 A4。
Example 2

计算 OLS 的方差-协方差矩阵

偏差$\hat{\beta}-\beta = (X^\top X)^{-1}X^\top\varepsilon$
方差$\text{Var}(\hat{\beta}\mid X) = (X^\top X)^{-1}X^\top\,E[\varepsilon\varepsilon^\top\mid X]\,X(X^\top X)^{-1}$
代入同方差$=(X^\top X)^{-1}X^\top(\sigma^2 I)X(X^\top X)^{-1} = \sigma^2(X^\top X)^{-1}\quad\checkmark$
注意: σ² 用 s² = SSR/(n-k) 无偏估计,其中 k 为参数个数(包含截距)。
03

违反假设总览

违反假设结果(对OLS的影响)检验方法解决方案
A1 线性性 残差有系统非线性模式,估计不可靠 残差图(vs fitted values) 变换变量(log、平方根),加交叉项,使用非线性模型
A2 无自相关 标准误有偏,t/F检验失效;OLS仍无偏但非BLUE 残差时序图,ACF图,DW检验,BG检验 Newey-West稳健SE,ARIMA,GLS/FGLS,加滞后项
A3 无多重共线性 标准误膨胀,t检验失效(TypeII错误),系数符号可能错误 相关矩阵,VIF(>10或>5) Ridge回归,删除变量,PCA,增加样本量
A4 外生性 OLS有偏且不一致,标准误错误。增大样本无法改善 理论判断(经济逻辑),Hausman检验,过度识别检验 加回省略变量,工具变量(IV/2SLS),代理变量
A5 同方差 OLS无偏但非BLUE,标准误有偏,假设检验失效 残差vs拟合值图,BP检验,White检验 稳健标准误(HC0-HC3),WLS,对因变量取log
A6 正态性 有限样本t/F检验不严格有效;大样本下CLT渐近正态 残差Q-Q图,Jarque-Bera检验,Shapiro-Wilk检验 Bootstrap,Box-Cox变换,大样本依赖CLT
04

Autocorrelation(自相关)

自相关指误差项之间存在相关性:Cov(εᵢ, εⱼ) ≠ 0(i ≠ j)。在时间序列中极为常见。

后果: 标准误有偏(通常被低估),t/F检验失效;但OLS 仍然无偏,只是非BLUE(效率损失)。
笔记原文:"std. error biased, F test not working. Still unbiased, not efficient."

保证 Var(β̂) 的基础

无自相关$\text{Var}(\hat{\beta}) = \sigma^2(X^\top X)^{-1}$(仅在 $\text{Cov}(\varepsilon_i,\varepsilon_j)=0$ 时成立)
有自相关$\text{Var}(\hat{\beta})_{true} = (X^\top X)^{-1}X^\top\Omega X(X^\top X)^{-1} \neq \sigma^2(X^\top X)^{-1}$,其中 $E[\varepsilon\varepsilon^\top]=\sigma^2\Omega,\,\Omega\neq I$

AR(1) 过程(最常见)

AR(1)模型$\varepsilon_t = \rho\varepsilon_{t-1}+u_t,\quad |\rho|<1\text{(平稳条件)},\quad u_t\sim\text{iid}(0,\sigma_u^2)$
方差$\text{Var}(\varepsilon_t) = \dfrac{\sigma_u^2}{1-\rho^2}$
自协方差$\text{Cov}(\varepsilon_t,\varepsilon_{t-k}) = \rho^k\cdot\dfrac{\sigma_u^2}{1-\rho^2}$(相关性随lag指数衰减)

检测方法

检验 a — 残差时序图

Plot Residuals over Time

将残差 ε̂ₜ 对时间 t 作图。若存在明显的周期性模式或趋势,说明存在自相关。

判断标准: 随机散布于零周围 → 无自相关;有清晰的正负交替周期 → 负自相关;残差缓慢漂移 → 正自相关。
检验 b — ACF 图

Autocorrelation Function Plot

ACF(k) = Corr(ε̂ₜ, ε̂ₜ₋ₖ),绘制不同lag k下的自相关系数。若某个lag的竖线超出蓝色置信带(±1.96/√n),说明在该lag显著自相关。

AR(1)特征: ACF指数衰减,PACF在lag=1截尾。
MA(1)特征: ACF在lag=1截尾,PACF指数衰减。
检验 c — Durbin-Watson Test

DW检验(检验AR(1)自相关)

假设: H₀: ρ = 0(无自相关)vs. H₁: ρ ≠ 0

DW统计量$$DW = \frac{\sum_{t=2}^n(\hat{\varepsilon}_t-\hat{\varepsilon}_{t-1})^2}{\sum_{t=1}^n\hat{\varepsilon}_t^2} \approx 2(1-\hat{\rho})$$
DW值含义
DW ≈ 2无自相关(ρ ≈ 0)
DW < 1.5高正自相关(ρ > 0),εₜ与εₜ₋₁同向
DW > 2.5高负自相关(ρ < 0),εₜ与εₜ₋₁反向
0 ≤ DW ≤ 4完整范围(DW=0 → ρ=1,DW=4 → ρ=-1)
局限: DW只检验AR(1);有"不确定区间"(inconclusive zone);不适用于有滞后因变量的模型。
检验 d — Ljung-Box Q Test

Box-Ljung检验(联合检验多个lag)

假设: H₀: ρ₁ = ρ₂ = … = ρₖ = 0(前K个lag均无自相关)

Q统计量$Q = n(n+2)\displaystyle\sum_{k=1}^K\dfrac{\hat{\rho}_k^2}{n-k}\sim\chi^2(K)$($H_0$下)
若 $Q > \chi^2_{\alpha}(K)$,拒绝 $H_0$,存在自相关
优势: 同时检验多个lag;适合残差的自相关诊断(金融时间序列常用)。
检验 e — Breusch-Godfrey Test(BG检验)

BG检验(可检验高阶AR自相关,最推荐)

步骤:

  1. 第一步:OLS估计原模型,获得残差 ε̂ₜ
  2. 第二步:辅助回归
    将 ε̂ₜ 对原来所有 X 和滞后残差回归:
    $\hat{\varepsilon}_t = \alpha_0 + X'\alpha + \rho_1\hat{\varepsilon}_{t-1}+\rho_2\hat{\varepsilon}_{t-2}+\cdots+\rho_p\hat{\varepsilon}_{t-p}+u_t$
  3. 第三步:构造统计量
    $LM=(n-p)\cdot R^2\sim\chi^2(p)$($H_0:\rho_1=\cdots=\rho_p=0$下)
  4. 结论: 若 LM > χ²_α(p),拒绝H₀,存在p阶自相关。
优势 vs DW: ①可检验高阶AR(p>1);②可处理含滞后因变量的模型;③更一般化。

解决方案

方案1:Generalized Least Squares(GLS)

当 Var(ε) = σ²V(V为已知n×n正定矩阵),用Cholesky分解 V = KKᵀ 变换模型:

原模型$y=X\beta+\varepsilon,\quad \text{Var}(\varepsilon)=\sigma^2 V$($V$已知 $n\times n$ 正定矩阵)
Cholesky令 $V=KK^\top$,变换 $C=K^{-1}$,则 $\tilde{y}=Cy,\; \tilde{X}=CX,\; \tilde{\varepsilon}=C\varepsilon$
同方差验证$\text{Var}(\tilde{\varepsilon}\mid X) = C\cdot\sigma^2 V\cdot C^\top = \sigma^2 I\quad\checkmark$
GLS估计量$$\hat{\beta}_{GLS} = (\tilde{X}^\top\tilde{X})^{-1}\tilde{X}^\top\tilde{y} = (X^\top V^{-1}X)^{-1}X^\top V^{-1}y$$
GLS的BLUE性质

在 Var(ε) = σ²V(V已知)下,GLS估计量 β̂_GLS 是 BLUE。它的方差为:

$\text{Var}(\hat{\beta}_{GLS}) = \sigma^2(X^\top V^{-1}X)^{-1}$

方案2:FGLS(Feasible GLS)

实践中V通常未知。FGLS步骤:

  1. OLS估计,获得残差
  2. 用残差估计V的结构(例如,估计AR(1)中的ρ:ρ̂ = Σε̂ₜε̂ₜ₋₁/Σε̂²ₜ₋₁)
  3. 用V̂代替V,做GLS

方案3:Newey-West 稳健标准误(HAC)

NW方差$\widehat{\text{Var}}_{NW}(\hat{\beta}) = (X^\top X)^{-1}\hat{S}_{NW}(X^\top X)^{-1}$(不改变$\hat{\beta}$,只修正SE)
S_NW$\hat{S}_{NW} = \hat{\Gamma}_0 + \displaystyle\sum_{l=1}^L w_l(\hat{\Gamma}_l+\hat{\Gamma}_l^\top),\quad w_l=1-\dfrac{l}{L+1}$(Bartlett核)
lag-j自协方差$\hat{\Gamma}_j = \dfrac{1}{T}\displaystyle\sum_{t=j+1}^T \phi_t\phi_{t-j}^\top,\quad \phi_t=x_t u_t$
05

Multicollinearity(多重共线性)

当自变量之间存在近似(非完全)线性关系时,OLS依然无偏,但标准误膨胀。

后果(笔记原文): "variance increase, t test fail, hard to explain individual effect of each variable."
① 标准误膨胀 → t检验倾向于接受H₀(Type II Error,漏判)
② 系数估计不稳定,可能出现错误符号
③ 系数的经济学解释困难
注意:OLS仍然无偏且一致,只是效率损失。

检测:VIF(Variance Inflation Factor)

检验 — VIF

方差膨胀因子

步骤:

  1. 计算相关矩阵,初步判断自变量间相关性
  2. 对每个自变量 Xₖ,做辅助回归:
    $X_k = \beta_0+\beta_1 X_1+\cdots+\beta_{k-1}X_{k-1}+\beta_{k+1}X_{k+1}+\cdots+\beta_p X_p+u$
    从中得到 R²ₖ(该回归的决定系数)
  3. 计算VIF:
    $VIF_k = 1/(1-R_k^2)$
VIF值解读
VIF = 1完全无共线性(Xₖ与其他X正交)
1 < VIF < 5轻微共线性,通常可接受
5 < VIF < 10中度共线性,需要关注
VIF > 10严重共线性,需要处理
VIF → ∞完全共线性,(XᵀX)不可逆
直觉: VIFₖ 告诉你由于Xₖ与其他变量相关,其系数的方差被放大了多少倍。VIF=10意味着标准误膨胀了 √10 ≈ 3.16 倍。

条件数(Condition Number)

条件数$CN = \sqrt{\lambda_{\max}/\lambda_{\min}}$,其中 $\lambda$ 为 $X^\top X$ 的特征值
$CN > 30$:中度共线性;$CN > 100$:严重共线性

解决方案1:Ridge Regression(岭回归)

Solution — Ridge Regression

Ridge 回归的推导与性质

在OLS损失函数中加入L2惩罚项(λ||β||²),使 (XᵀX + λI) 在任何情况下都可逆:

目标函数$\hat{\beta}_{Ridge} = \arg\min_{\beta}\{\|y-X\beta\|^2 + \lambda\|\beta\|^2\},\quad\lambda>0$
FOC$-2X^\top(y-X\beta)+2\lambda\beta=0 \;\Rightarrow\; (X^\top X+\lambda I)\beta = X^\top y$
$$\hat{\beta}_{Ridge} = (X^\top X+\lambda I)^{-1}X^\top y$$
为何 (XᵀX + λI) 一定可逆?
XᵀX 是半正定矩阵(所有特征值 ≥ 0)。加上 λI 后,所有特征值变为 (λᵢ + λ) > 0(因为 λ > 0),因此 (XᵀX + λI) 是正定矩阵,必然可逆。✓

Ridge 的关键特性:
① 有偏估计(但方差更小):bias-variance tradeoff
② 将所有β均匀拉向0,但不会产生精确的0(无稀疏性)
③ 惩罚高的β,使高β降低(drag high β down to small β)
④ 截距项通常不惩罚

必须预处理: 在做Ridge前,对X和y做标准化(z-score standardization),使各变量的收缩量可比。

标准化X$\tilde{X}_{ij} = (X_{ij}-\bar{X}_j)/\text{std}(X_j)$(每列均值0,标准差1)
中心化y$\tilde{y}_i = y_i - \bar{y}$(截距不惩罚,center后可排除截距列)

λ 的选择: 通过交叉验证(cross-validation)选取最优λ。笔记提示:可根据VIF的变化来选λ——选使VIF降到阈值以下的最小λ。

解决方案2:PCA(主成分分析)

SVD$X = UDV^\top$,取前 $k$ 列,得分矩阵 $Z_k = XV_k = U_k D_k$
PCR$Z$ 的各列彼此正交,消除共线性;先对 $Z_k$ 回归,再转换回原始 $X$ 空间
Example — VIF计算

判断是否存在多重共线性

模型:y = β₀ + β₁x₁ + β₂x₂ + β₃x₃ + ε。计算各 VIF:

VIF₁$x_1$ 对 $x_2,x_3$ 回归:$R_1^2=0.95\Rightarrow VIF_1=1/(1-0.95)=20$ (严重!)
VIF₂$x_2$ 对 $x_1,x_3$ 回归:$R_2^2=0.6\Rightarrow VIF_2=1/(1-0.6)=2.5$(可接受)
VIF₃$x_3$ 对 $x_1,x_2$ 回归:$R_3^2=0.3\Rightarrow VIF_3=1/(1-0.3)=1.4$(无问题)
结论: x₁ 与其他变量存在严重共线性(VIF=20 >> 10)。考虑删除 x₁,或对 x₁ 做 Ridge 惩罚,或用 PCA 合并 x₁ 和与它相关的变量。
06

Heteroskedasticity(异方差)

异方差指 Var(εᵢ | Xᵢ) = σ²ᵢ(随观测值变化,而非常数σ²)。

后果(笔记原文): "std. error wrong, unbiased but no BLUE, 假设检验失败"
① OLS β̂ 仍然无偏(E[ε|X]=0仍满足)
② 但不是BLUE:有比OLS方差更小的线性无偏估计量(WLS)
③ 标准误有偏 → t/F检验无效

检测:Breusch-Pagan Test(BP检验)

检验 — Breusch-Pagan Test

BP检验步骤

  1. OLS估计原模型,获取残差 ε̂ᵢ
  2. 辅助回归: 将 ε̂²ᵢ 对所有自变量回归
    $\hat{\varepsilon}_i^2=\alpha_0+\alpha_1 x_{1i}+\cdots+\alpha_k x_{ki}+v_i$
  3. 统计量: LM = n·R² ~ χ²(k) 在 H₀: 同方差 下
H₀: α₁=…=αₖ=0(同方差)。若拒绝H₀,存在异方差。
检验 — White Test

White检验(更一般化)

辅助回归中加入所有自变量的平方项和交叉乘积项:

辅助回归$\hat{\varepsilon}_i^2 = \alpha_0 + \sum_j\alpha_j x_{ji} + \sum_{j,k}\alpha_{jk}x_{ji}^2 + \sum_{j\neq l}\alpha_{jl}x_{ji}x_{li} + v_i$
White检验不假定异方差的特定函数形式,更一般化,但自由度更多(检验力可能较低)。

WLS(Weighted Least Squares,加权最小二乘)

若已知 Var(εᵢ) = σ²hᵢ(如 hᵢ = xᵢ 或 hᵢ = x²ᵢ),用权重 wᵢ = 1/hᵢ 缩放:

Derivation — WLS

WLS推导

目标:找一组权重 wᵢ,使加权残差的方差同质化。

设定$\text{Var}(\varepsilon_i)=\sigma^2 h_i$,令 $w_i=1/h_i$,两边乘 $\sqrt{w_i}$:
变换$\sqrt{w_i}y_i = \sqrt{w_i}(\beta_0+\beta_1 x_{1i}+\cdots+\beta_k x_{ki})+\sqrt{w_i}\varepsilon_i$
同方差验证$\text{Var}(\sqrt{w_i}\varepsilon_i)=w_i\sigma^2 h_i = \sigma^2\quad\checkmark$
WLS估计量$$\hat{\beta}_{WLS} = \arg\min\sum_i w_i(y_i-X_i\beta)^2 = (X^\top WX)^{-1}X^\top Wy$$其中 $W=\text{diag}(w_1,\ldots,w_n)$
直觉: 对方差大的观测给予更小权重(信任度低),对方差小的给予更大权重(信任度高)。WLS在已知hᵢ时是BLUE。

GLS vs OLS+稳健标准误的比较

GLS / WLS(有先验知识)

  • 需要知道误差方差结构 Var(εᵢ) = σ²hᵢ
  • 更有效率(BLUE)
  • 对方差结构的误设定更敏感
  • 计算更复杂
  • 适合:误差结构有经济理论支撑时

OLS + 稳健标准误(HC)

  • 不需要误差结构的先验知识
  • 更稳健(对误设定不敏感)
  • 效率稍低但更实用
  • 应用计量经济学的标准做法
  • 适合:误差结构未知时(大多数场景)
HC0(White 1980)$\widehat{\text{Var}}_{HC0}(\hat{\beta}) = (X^\top X)^{-1}\!\left[\sum_i \hat{\varepsilon}_i^2 x_i x_i^\top\right]\!(X^\top X)^{-1}$
HC1HC0 $\times\, n/(n-k)$(小样本修正)
HC2用 $\hat{\varepsilon}_i^2/(1-h_{ii})$ 替代 $\hat{\varepsilon}_i^2$($h_{ii}$ 为帽子矩阵对角元素)
HC3用 $\hat{\varepsilon}_i^2/(1-h_{ii})^2$ 替代(最保守)
Example — 异方差检测与处理

工资回归中的异方差

设模型:wage = β₀ + β₁edu + β₂exp + ε。通常高教育高技能工人的工资方差更大。

WLS若 $\text{Var}(\varepsilon_i)\propto edu_i^2$,令 $w_i=1/edu_i^2$,WLS模型:$\dfrac{wage_i}{edu_i}=\beta_0\dfrac{1}{edu_i}+\beta_1+\beta_2\dfrac{exp_i}{edu_i}+\dfrac{\varepsilon_i}{edu_i}$
取对数$\ln(wage_i) = \beta_0+\beta_1 edu_i+\beta_2 exp_i+\varepsilon_i$(稳定方差的常用变换)
取对数是处理异方差最常用的方法之一,同时也将系数解释为弹性/半弹性。
07

Endogeneity(内生性)& Instrumental Variables

内生性:E[ε | X] ≠ 0,即 Cov(ε, X) ≠ 0。这使得OLS估计量有偏且不一致——即使样本量趋于无穷大,OLS也无法恢复真实参数。

后果(笔记): "Biased, Inconsistent, Std. Err Wrong"
这是OLS所有违反假设中最严重的情况——不能靠增大样本修复!

内生性的三大来源

Cause 1 — Omitted Variable(省略变量)

省略变量偏差(OVB)的完整推导

假设真实模型为:yᵢ = β₁x₁ᵢ + β₂x₂ᵢ + εᵢ,但研究者误设为:yᵢ = α₁x₁ᵢ + uᵢ(省略了 x₂)。

省略变量真实模型 $y=\beta_1 x_1+\beta_2 x_2+\varepsilon$,估计 $y=\alpha_1 x_1+u$
展开$\hat{\alpha}_1 = \beta_1 + \beta_2\cdot\hat{\delta}_{21} + \dfrac{\sum(x_{1i}-\bar{x}_1)\varepsilon_i}{\sum(x_{1i}-\bar{x}_1)^2}$
取期望$E[\hat{\alpha}_1] = \beta_1 + \beta_2\cdot\hat{\delta}_{21}$,其中 $\hat{\delta}_{21}=\dfrac{\text{Cov}(x_1,x_2)}{\text{Var}(x_1)}$
OVB$$\text{OVB} = \beta_2\cdot\frac{\text{Cov}(x_1,x_2)}{\text{Var}(x_1)}$$
β₂(省略变量对y的影响)Cov(x₁,x₂)(相关方向)偏差方向
正(+)正(+)正偏差(高估β₁)
正(+)负(−)负偏差(低估β₁)
负(−)正(+)负偏差(低估β₁)
负(−)负(−)正偏差(高估β₁)
任意0(正交)无偏差!
笔记例子: 收入回归中省略"个人背景"(personal background)。背景好的人收入高(β₂>0),且背景好的人可能受教育更多(Cov(edu, background)>0),导致教育的系数被高估。
Cause 2 — Simultaneity(联立性)

联立方程偏差

价格与需求同时决定:价格影响需求,需求也影响价格。无法用单一方程的OLS识别。

需求方程$Q = \alpha_0+\alpha_1 P+\alpha_2\text{Income}+\varepsilon_1$
供给方程$Q = \beta_0+\beta_1 P+\beta_2\text{Cost}+\varepsilon_2$
$P$ 是内生变量:$\text{Cov}(P,\varepsilon_1)\neq 0$,直接OLS估计需求方程 $\Rightarrow$ 偏差
需要用供给侧变量(成本、天气等)作为P的工具变量(IV)来识别需求曲线。
Cause 3 — Measurement Error(测量误差)

经典测量误差(Classical Errors-in-Variables)

真实模型:y = βX* + ε,但X*不可观测,观测到 X = X* + v(测量误差)。

代入$y=\beta(X-v)+\varepsilon = \beta X+(\varepsilon-\beta v)$,复合误差 $u=\varepsilon-\beta v$
内生性$\text{Cov}(X,u)=\text{Cov}(X^*+v,\varepsilon-\beta v)=-\beta\cdot\text{Var}(v)\neq 0$
衰减偏差$$\text{plim}\,\hat{\beta}_{OLS} = \beta\cdot\frac{\text{Var}(X^*)}{\text{Var}(X^*)+\text{Var}(v)} = \beta\cdot\lambda,\quad 0<\lambda<1$$
笔记例子: X 由调查(survey)采集 → 存在回答误差。

解决方案:工具变量(Instrumental Variables)

工具变量 Z 的两个必要条件

① 相关性(Relevance): Cov(Z, X) ≠ 0,Z与内生变量X相关。

② 排他性(Exclusion Restriction): Cov(Z, ε) = 0,Z只通过X影响y(不直接影响y)。

Derivation — IV Estimator

IV估计量的一致性证明

模型:y = βx + ε,工具变量 Z。

矩条件$\text{Cov}(Z,y)=\beta\cdot\text{Cov}(Z,x)+\underbrace{\text{Cov}(Z,\varepsilon)}_{=0}\;\Rightarrow\;\hat{\beta}_{IV}=\dfrac{\text{Cov}(Z,y)}{\text{Cov}(Z,x)}$
矩阵形式$$\hat{\beta}_{IV} = (Z^\top X)^{-1}Z^\top Y$$
一致性$\text{plim}\,\hat{\beta}_{IV} = \beta + \dfrac{\text{Cov}(Z,\varepsilon)}{\text{Cov}(Z,X)} = \beta\quad\checkmark$

2SLS(Two-Stage Least Squares)

2SLS 是最常用的IV方法,当有多个工具变量时(过度识别),比单纯IV更有效率。

Stage 1
X 对 Z 做OLS
X̂ = Z(ZᵀZ)⁻¹ZᵀX
= Pz·X
Stage 2
y 对 X̂ 做OLS
β̂_2SLS = (X̂ᵀX̂)⁻¹X̂ᵀy
等价形式
β̂_2SLS = (XᵀPzX)⁻¹XᵀPzy
Pz = Z(ZᵀZ)⁻¹Zᵀ
一致性
X̂ = Pz·X 与 ε 正交
Cov(X̂, ε) = 0 ✓
Example — IV in Practice

教育回报率的IV估计(Card 1995)

问题:收入对教育年限回归,但"能力"(ability)是省略变量,导致内生性。

模型$\ln(wage_i) = \beta_0+\beta_1 educ_i+\beta_2 ability_i+\varepsilon_i$;省略 $ability$ $\Rightarrow$ OVB(高估 $\beta_1$)
工具变量$Z=$ 是否在大学附近长大(proximity to college)
相关性 ✓$\text{Cov}(Z,educ)\neq 0$:住大学附近 $\Rightarrow$ 上大学成本低 $\Rightarrow$ 教育年限更多
排他性 ✓$\text{Cov}(Z,\varepsilon)=0$:地理位置不直接影响工资(假设!)
用2SLS估计:第一阶段用proximity预测educ,第二阶段用预测的educ估计工资方程。通常发现OLS高估教育回报(β₁_OLS > β₁_IV)。

Hausman 检验(判断内生性是否存在)

假设$H_0$:$X$ 外生(OLS和IV均一致);$H_1$:$X$ 内生(仅IV一致)
统计量$$H = (\hat{\beta}_{IV}-\hat{\beta}_{OLS})^\top[\text{Var}(\hat{\beta}_{IV})-\text{Var}(\hat{\beta}_{OLS})]^{-1}(\hat{\beta}_{IV}-\hat{\beta}_{OLS})\sim\chi^2(k)$$
08

OLS 系数完整推导

有截距的简单线性回归:y = α + βx + ε

目标:最小化 S = Σᵢ(yᵢ − α − βxᵢ)²

对α求导∂S/∂α = −2Σ(yᵢ − α − βxᵢ) = 0
→ Σyᵢ = nα + βΣxᵢ
化简ȳ = α + βx̄ → α̂ = ȳ − β̂x̄
对β求导∂S/∂β = −2Σxᵢ(yᵢ − α − βxᵢ) = 0
→ ΣxᵢYᵢ = αΣxᵢ + βΣxᵢ²
代入α̂ΣxᵢYᵢ = (ȳ − β̂x̄)·nx̄ + β̂Σxᵢ²
整理ΣxᵢYᵢ − nx̄ȳ = β̂(Σxᵢ² − nx̄²)
最终β̂ = Σ(xᵢ−x̄)(yᵢ−ȳ) / Σ(xᵢ−x̄)² = Cov(x,y) / Var(x)

无截距回归:y = βx + ε

目标:最小化 S = Σᵢ(yᵢ − βxᵢ)²

对β求导∂S/∂β = −2Σxᵢ(yᵢ − βxᵢ) = 0
化简ΣxᵢYᵢ = βΣxᵢ²
最终β̂ = ΣxᵢYᵢ / Σxᵢ²
注意:此处 σ̂² = (1/n)Σ(yᵢ − β̂xᵢ)² 是有偏的;实践中用 1/(n-1) 代替(笔记原文:"This is biased, in practice use 1/(n-1), R² unbiased")
Example — 矩阵形式推导

多元回归 OLS 矩阵推导

目标$S=(y-X\beta)^\top(y-X\beta)=y^\top y - 2\beta^\top X^\top y + \beta^\top X^\top X\beta$
梯度$\nabla_\beta S = -2X^\top y + 2X^\top X\beta = 0 \;\Rightarrow\; X^\top X\beta = X^\top y$(正则方程)
$$\hat{\beta} = (X^\top X)^{-1}X^\top y$$

β̂ 的抽样分布

抽样分布$\hat{\beta}\mid X \sim N(\beta,\,\sigma^2(X^\top X)^{-1})$(在 A1-A6 下)
t检验$t_k = (\hat{\beta}_k-\beta_{k,0})/\text{se}(\hat{\beta}_k)\sim t(n-K)$,$K$=参数个数(含截距)
F检验$F=\dfrac{(RSS_r-RSS_u)/q}{RSS_u/(n-K)}\sim F(q,n-K)$,$q$=约束个数
σ²无偏估计$s^2=RSS/(n-K)=\sum\hat{\varepsilon}_i^2/(n-K)$(MLE用$1/n$有偏,OLS用$1/(n-K)$无偏)
09

MLE 推导 & MLE vs OLS

在正态误差假设 ε ~ N(0, σ²) 下,OLS 等价于 MLE。

Derivation — MLE

最大似然估计推导(正态误差)

对数似然$\ell(\alpha,\beta,\sigma^2)=-\dfrac{n}{2}\ln(2\pi)-\dfrac{n}{2}\ln\sigma^2-\dfrac{1}{2\sigma^2}\displaystyle\sum_i(y_i-\alpha-\beta x_i)^2$
等价性最大化 $\ell$ w.r.t. $\alpha,\beta$ $\Leftrightarrow$ 最小化 $\sum(y_i-\alpha-\beta x_i)^2$ $\Rightarrow$ MLE $=$ OLS $\checkmark$
σ²的FOC$\dfrac{\partial\ell}{\partial\sigma^2}=-\dfrac{n}{2\sigma^2}+\dfrac{1}{2\sigma^4}\sum\hat{\varepsilon}_i^2=0$
MLE(有偏)$\hat{\sigma}^2_{MLE}=\dfrac{1}{n}\sum\hat{\varepsilon}_i^2$
OLS(无偏)$\hat{\sigma}^2_{OLS}=\dfrac{1}{n-K}\sum\hat{\varepsilon}_i^2=s^2$
关键结论(笔记原文同):
① MLE和OLS对β的估计完全相同(正态误差下)
② MLE的σ²估计是有偏的(分母n而非n-K),实践中用OLS的s²
Example — MLE vs OLS对比

两种方法的异同

性质OLSMLE(正态误差)
β̂ 估计值相同相同
β̂ 无偏性✓ 无偏✓ 无偏
σ² 估计s² = SSR/(n−K)(无偏)σ̂² = SSR/n(有偏)
需要正态假设不需要(BLUE性质不需要)需要
渐近性质有效率(若正态)渐近有效率
10

最优权重推导(WLS基础)

笔记中对"加权平均估计量的最优权重"有详细推导。这是WLS直觉的核心。

Derivation — Optimal Weights via Lagrangian

无偏估计量中方差最小的最优权重

已知 X₁, …, Xₙ 互相独立,E[Xᵢ] = μ,Var(Xᵢ) = σ²ᵢ(各不相同)。
构造线性估计量 μ̂ = Σwᵢxᵢ,求使 Var(μ̂) 最小的权重 wᵢ,约束 Σwᵢ = 1(无偏性)。

Lagrangian 推导过程

目标min Var(μ̂) = Σ wᵢ²σᵢ² s.t. Σwᵢ = 1
LagrangianL = Σwᵢ²σᵢ² + λ(Σwᵢ − 1)
FOC w.r.t. wᵢ∂L/∂wᵢ = 2wᵢσᵢ² + λ = 0 → wᵢ = −λ/(2σᵢ²)
代入约束Σwᵢ = −λ/2 · Σ(1/σᵢ²) = 1 → λ = −2/Σ(1/σᵢ²)
最优权重wᵢ* = (1/σᵢ²) / Σⱼ(1/σⱼ²)
最优权重与方差成反比——方差越大,权重越小(信任度越低)✓
最优方差Var_min(μ̂) = 1 / Σᵢ(1/σᵢ²)
WLS的直觉: WLS选择 wᵢ = 1/σᵢ²,正好是使加权估计量方差最小的最优权重。这也是为什么WLS在已知误差方差结构时是BLUE。
11

Regularization(正则化)

正则化在OLS目标函数中加入惩罚项,防止过拟合,处理多重共线性,实现特征选择。做正则化前必须对X和y做标准化(z-score),使各特征的收缩量可比。截距项通常不惩罚。

三种正则化方法对比

方法惩罚项目标函数特点适用场景
Ridge(L2) λΣβ²ⱼ ||y−Xβ||² + λ||β||² 均匀收缩所有β,无稀疏性;解析解 所有特征都有用;多重共线性严重
Lasso(L1) λΣ|βⱼ| ||y−Xβ||² + λΣ|βⱼ| 产生稀疏解(精确为0);自动特征选择 真实稀疏模型;特征选择
Elastic Net λ₁Σ|βⱼ|+λ₂Σβ²ⱼ ||y−Xβ||² + λ₁||β||₁ + λ₂||β||² L1+L2结合;稀疏+分组效应 相关特征 + 需要稀疏解
Derivation — Ridge 的解析解

Ridge 回归完整推导

$\hat{\beta}_{Ridge}=(X^\top X+\lambda I)^{-1}X^\top y$
有偏$E[\hat{\beta}_{Ridge}]=(X^\top X+\lambda I)^{-1}X^\top X\cdot\beta \neq \beta$($\lambda>0$ 时)
方差更小$\text{Var}(\hat{\beta}_{Ridge})=\sigma^2(X^\top X+\lambda I)^{-1}X^\top X(X^\top X+\lambda I)^{-1} \leq \text{Var}(\hat{\beta}_{OLS})$
Bias-Variance Tradeoff: λ越大 → 偏差越大,方差越小;λ=0 → 退化为OLS(无偏但可能方差大)。最优λ通过交叉验证选取。
Derivation — Lasso 特性分析

Lasso 为何产生稀疏解?

Lasso$\hat{\beta}_{Lasso}=\arg\min_\beta\{\|y-X\beta\|^2+\lambda\sum_j|\beta_j|\}$
次梯度($\beta_j\neq 0$)$-2X_j^\top(y-X\beta)+\lambda\cdot\text{sign}(\beta_j)=0$
次梯度($\beta_j=0$)$|2X_j^\top(y-X\beta)|\leq\lambda$(残差与 $X_j$ 的相关性 $\leq\lambda$)
软阈值解$\hat{\beta}_j=\text{sign}(\hat{z}_j)\cdot\max(|\hat{z}_j|-\lambda/2,\,0)$,$\hat{z}_j$为OLS解
几何直觉: Ridge的约束域是球形(光滑),最优点通常不在轴上;Lasso的约束域是菱形(有角),最优点容易在顶角处(即某些β=0)。这就是Lasso产生稀疏解的原因。
Example — Ridge vs OLS 数值比较

多重共线性下的表现

设 X = [x₁, x₂],其中 x₂ = x₁ + small noise(高度相关):

OLS$\hat{\beta}=[5,\,-4]$,se$=[10,\,10]$(标准误极大,$VIF_{x_1}=VIF_{x_2}=25$,严重共线性)
Ridge ($\lambda=1$)$\hat{\beta}_{Ridge}=[2.1,\,1.9]$,均匀收缩,稳定;从 $\lambda=0.01$ 增大到 $VIF<5$ 为止
Ridge虽然引入了偏差,但大幅降低了方差,总体MSE更小(通常)。这就是bias-variance tradeoff在实践中的体现。

λ 的选择

Cross-Validation(CV)

  • k折CV:对每个λ计算平均CV误差
  • 选择使CV误差最小的λ(或"one standard error rule")
  • 最常用方法

VIF导向(笔记方法)

  • 从小λ开始,计算Ridge估计后的各VIF
  • 增大λ直到所有VIF降到阈值(5或10)以下
  • 适合多重共线性的诊断场景
12

Quick Formula Reference

OLS Estimator
β̂ = (XᵀX)⁻¹Xᵀy
α̂ = ȳ − β̂x̄(简单回归)
β̂ = Cov(x,y)/Var(x)
GLS Estimator
β̂_GLS = (XᵀV⁻¹X)⁻¹XᵀV⁻¹y
Var(β̂_GLS) = σ²(XᵀV⁻¹X)⁻¹
WLS Estimator
β̂_WLS = (XᵀWX)⁻¹XᵀWy
W = diag(1/σ₁², …, 1/σₙ²)
wᵢ* = (1/σᵢ²)/Σ(1/σⱼ²)
IV Estimator
β̂_IV = (ZᵀX)⁻¹ZᵀY
2SLS: β̂ = (XᵀPzX)⁻¹XᵀPzy
Pz = Z(ZᵀZ)⁻¹Zᵀ
Ridge Estimator
β̂_R = (XᵀX + λI)⁻¹Xᵀy
有偏;(XᵀX+λI)总可逆
VIF
VIF_k = 1/(1 − R²_k)
阈值:>5 关注,>10 严重
Durbin-Watson
DW = Σ(ε̂ₜ−ε̂ₜ₋₁)²/Σε̂ₜ²
≈ 2(1−ρ̂)
DW≈2:无自相关
OVB
Bias = β₂·Cov(x₁,x₂)/Var(x₁)
= β₂·δ̂₂₁
Sampling Distribution
β̂ ~ N(β, σ²(XᵀX)⁻¹)
t = (β̂ₖ−β₀)/se(β̂ₖ) ~ t(n−K)
s² = SSR/(n−K)(无偏)
Attenuation Bias
plim β̂ = β·Var(X*)/(Var(X*)+Var(v))
测量误差 → 系数被低估
BG Test(自相关)
ε̂ₜ = α₀+Xα+Σρⱼε̂ₜ₋ⱼ+uₜ
LM = (n−p)·R² ~ χ²(p)
Projection Matrix H
H = X(XᵀX)⁻¹Xᵀ(对称、幂等)
ŷ=Hy, e=My, M=I−H
hᵢᵢ=leverage,tr(H)=k
σ̂² Unbiased
σ̂² = RSS/(n−k) = εᵀε/(n−k)
(n−k)σ̂²/σ² ~ χ²(n−k)
k=p+1(含截距)
t & R² Relationship
t = √[(n−2)R²/(1−R²)]
R² = t²/(t²+n−2)
(简单回归)
Confidence Interval
β̂ⱼ ± t^(α/2)_(n−k)·σ̂·√(XᵀX)⁻¹ⱼⱼ
ŷᵢ ± t^(α/2)_(n−k)·σ̂·√hᵢᵢ
Prediction Interval
y_new ± t^(α/2)_(n−k)·σ̂·√(1+hᵢᵢ)
Var(y_new−ŷ) = σ²(1+hᵢᵢ)
TSS = ESS + RSS
R² = ESS/TSS = 1−RSS/TSS
有截距:0≤R²≤1
无截距:用R²₀=‖ŷ‖²/‖y‖²
Soft Thresholding(Lasso)
β̂ = sign(y)·(|y|−λ)₊
正交设计:β̂ⱼ=sign(β̂ⱼ_OLS)·(|β̂ⱼ_OLS|−λ)₊
Ridge SVD Form
β̂_λ = V(D²+λI)⁻¹DUᵀy
β̃ⱼ = [dⱼ/(dⱼ²+λ)]·(uⱼᵀy)
ŷ_λ = U·diag[dⱼ²/(dⱼ²+λ)]·Uᵀy
Ridge Bias-Variance
Bias(β̃ⱼ) = −λ/(dⱼ²+λ)·β̃ⱼ*
Var(β̃ⱼ) = σ²dⱼ²/(dⱼ²+λ)²
vs OLS: Var=σ²/dⱼ²
Ridge vs PCR 权重
Ridge wⱼ = dⱼ²/(dⱼ²+λ)(连续)
PCR wⱼ = 1[j≤k](二元)
OLS wⱼ = 1(全保留)
AIC / BIC
AIC = IS Dev + 2·df
BIC = IS Dev + log(n)·df
BIC更节省参数(n>7时)

Linear Regression Complete Reference · Yuchen Yu · Princeton MFin · Oct 2025

13

矩阵形式完整推导

笔记Image 2完整展开了多元线性回归的矩阵推导,包括投影矩阵H、方差推导、σ²无偏估计,以及误差向量的分布。

矩阵表示

矩阵形式$\underbrace{y}_{n\times 1}=\underbrace{X}_{n\times(p+1)}\underbrace{\beta}_{(p+1)\times 1}+\underbrace{\varepsilon}_{n\times 1}$
展开$\begin{bmatrix}y_1\\\vdots\\y_n\end{bmatrix}=\begin{bmatrix}1&x_{11}&\cdots&x_{1p}\\\vdots&\vdots&&\vdots\\1&x_{n1}&\cdots&x_{np}\end{bmatrix}\begin{bmatrix}\beta_0\\\vdots\\\beta_p\end{bmatrix}+\begin{bmatrix}\varepsilon_1\\\vdots\\\varepsilon_n\end{bmatrix}$

投影矩阵 H(Hat Matrix)

投影矩阵$\hat{y}=X\hat{\beta}=X(X^\top X)^{-1}X^\top y=Hy$,其中 $H=X(X^\top X)^{-1}X^\top$
对称性$H=H^\top$
幂等性$H^2=H$(idempotent)
$\text{rank}(H)=k=p+1$,$\text{tr}(H)=k$
截距$H\cdot\mathbf{1}=\mathbf{1}$(含截距时 $\mathbf{1}\in\text{col}(X)$)
杠杆值$h_{ii}=x_i^\top(X^\top X)^{-1}x_i$(leverage ratio)
Derivation — ŷ 和 e 的正交性

残差与拟合值正交(垂直)

残差$e=y-\hat{y}=(I-H)y=My$,$M=I-H$(annihilator matrix)
M的性质$M=M^\top,\quad M^2=M,\quad MX=0,\quad HX=X$
正交证明$\hat{y}^\top e=(Hy)^\top(My)=y^\top HMy=y^\top H(I-H)y=y^\top(H-H^2)y=0\quad\checkmark$
几何直觉: ŷ = Hy 是y在col(X)上的投影,e = My是y垂直于col(X)的分量。两者天然正交。

β̂ 的期望与方差(完整推导)

期望:E[β̂] = β

代入E[β̂] = E[(XᵀX)⁻¹Xᵀy] = (XᵀX)⁻¹XᵀE[y]
由模型E[y] = E[Xβ + ε] = Xβ + E[ε|X] = Xβ
结论E[β̂] = (XᵀX)⁻¹XᵀXβ = β ✓

方差:Var(β̂) 的推导(笔记Image 2黄色高亮部分)

定义Var(β̂) = Var((XᵀX)⁻¹Xᵀy)
展开= (XᵀX)⁻¹Xᵀ · Var(y) · X(XᵀX)⁻¹ // Var(Ay) = A·Var(y)·Aᵀ
① 来自:若 y ~ N(μ, Σ),则 y = Xβ+ε ~ N(Xβ, BΣBᵀ),其中 y = Bx+c
Var(y)Var(y) = Var(Xβ+ε) = Var(ε) = σ²Iₙ // 同方差假设
代入= (XᵀX)⁻¹Xᵀ · σ²Iₙ · X(XᵀX)⁻¹
化简= σ²·(XᵀX)⁻¹XᵀX·(XᵀX)⁻¹
结论Var(β̂) = σ²(XᵀX)⁻¹
方差矩阵$\text{Var}(\hat{\beta})=\begin{bmatrix}\text{Var}(\hat{\beta}_0)&\text{Cov}(\hat{\beta}_1,\hat{\beta}_0)&\cdots\\\text{Cov}(\hat{\beta}_0,\hat{\beta}_1)&\text{Var}(\hat{\beta}_1)&\cdots\\\vdots&\vdots&\ddots\end{bmatrix}$
标准误$\text{se}(\hat{\beta})=\sigma\sqrt{(X^\top X)^{-1}}$;$\text{se}(\hat{\beta}_i)=\sigma\sqrt{[(X^\top X)^{-1}]_{ii}}$(取对角元)
简单回归$\text{se}(\hat{\beta})=\hat{\sigma}/\sqrt{\sum(x_i-\bar{x})^2}$

σ² 的无偏估计(笔记Image 2底部完整推导)

E[RSS|X] = (n−k)σ² → σ̂² = RSS/(n−k)

定义RSS = εᵀε = eᵀe, e = y−ŷ = (I−H)y = My
展开RSS = (My)ᵀ(My) = yᵀMᵀMy = yᵀM²y = yᵀMy // M幂等
代入模型= (Xβ+ε)ᵀM(Xβ+ε) = εᵀMε // 因为MX=0,HX=X
取期望E[RSS|X] = E[εᵀMε|X] = tr(M·E[εεᵀ|X]) = tr(Mσ²I) = σ²tr(M)
用矩阵迹的性质:E[aᵀAa] = tr(AΣ) + μᵀAμ,其中a~(μ,Σ)。这里μ=0。
计算tr(M)tr(M) = tr(I−H) = n − tr(H) = n − k // tr(H)=rank(H)=k
结论E[RSS|X] = (n−k)σ² → σ̂² = RSS/(n−k) = εᵀε/(n−k) (无偏)
其中 k = p+1,p为自变量个数(含截距)。分母 n−k 是自由度。

β̂ 和 σ̂² 的抽样分布

β̂分布$\hat{\beta}\mid X\sim N(\beta,\,\sigma^2(X^\top X)^{-1})$
ε分布$\varepsilon\mid X\sim N(0,\,\sigma^2 I_n)$
σ̂²分布$\dfrac{(n-k)\hat{\sigma}^2}{\sigma^2}\sim\chi^2(n-k)$
14

t统计量、置信区间与预测区间

χ² 分布与 t 分布回顾

χ²分布$X=z_1^2+z_2^2+\cdots+z_k^2,\; z_j\sim N(0,1)\;\Rightarrow\; X\sim\chi_k^2$;$E[X]=k,\;\text{Var}(X)=2k$
t分布$t=\bar{z}/\sqrt{V/n},\; V\sim\chi_n^2\;\Rightarrow\; t\sim t_n$

t 统计量(单个系数检验)

假设$H_0:\beta_j=\beta_{j,0}$
t统计量$t_j=\dfrac{\hat{\beta}_j-\beta_{j,0}}{\text{se}(\hat{\beta}_j)}\sim t(n-k)$($H_0$下)
标准误$\text{se}(\hat{\beta}_j)=\hat{\sigma}\cdot\sqrt{[(X^\top X)^{-1}]_{jj}}$,$\hat{\sigma}=\sqrt{RSS/(n-k)}$
Derivation — t统计量的矩阵形式(笔记Image 5)

从简单回归推导 t 统计量

设简单线性回归 yᵢ = β₀ + β₁xᵢ + εᵢ,定义:

记号$S_{xx}=\sum(x_i-\bar{x})^2,\;S_{xy}=\sum(x_i-\bar{x})(y_i-\bar{y}),\;S_{yy}=\sum(y_i-\bar{y})^2$
$t^2=\dfrac{\hat{\beta}_1^2}{\text{se}^2(\hat{\beta}_1)}=\dfrac{S_{xy}^2/S_{xx}^2}{\hat{\sigma}^2/S_{xx}}=\dfrac{S_{xy}^2}{S_{xx}\hat{\sigma}^2}$
代入$\hat{\sigma}^2=\dfrac{(1-R^2)S_{yy}}{n-2}$,$S_{xy}^2=r^2 S_{xx}S_{yy}$
结论$$t^2=\frac{(n-2)R^2}{1-R^2}\quad\Leftrightarrow\quad R^2=\frac{t^2}{t^2+n-2}$$
重要结论: t统计量与R²之间存在一一对应关系!简单回归中,知道其一就能算出另一个。

置信区间(Confidence Interval)

CI for β̂ⱼ$ ext{CI}(\hat{\beta}_j) = \hat{\beta}_j \pm t^{\alpha/2}_{n-p-1}\cdot\hat{\sigma}\cdot\sqrt{[(X^\top X)^{-1}]_{jj}}$
简单回归$\text{se}^2(\hat{\beta}_1)=\dfrac{\sigma^2}{\sum(x_i-\bar{x})^2}$,$\text{se}^2(\hat{\alpha})=\sigma^2\!\left[\dfrac{1}{n}+\dfrac{\bar{x}^2}{\sum(x_i-\bar{x})^2}\right]$

ŷ 的方差

Var(y)$\text{Var}(y)=\sigma^2 I_n$,$\varepsilon\sim N(0,\sigma^2 I_n)$
Var(ŷ)$\text{Var}(\hat{y})=H\cdot\sigma^2 I\cdot H^\top=\sigma^2 H\;\Rightarrow\;\hat{y}\sim N(X\beta,\,\sigma^2 H)$
Var(ŷᵢ)$\text{Var}(\hat{y}_i)=\sigma^2 x_i^\top(X^\top X)^{-1}x_i=\sigma^2 h_{ii}$($h_{ii}$为leverage)
Var(e)$\text{Var}(e)=\text{Var}(My)=M\cdot\sigma^2 I\cdot M^\top=\sigma^2 M$
CI vs PI — 核心区别

置信区间 vs 预测区间(笔记Image 3绿色高亮)

置信区间(CI): 对条件均值 E[y|x] = xβ 的不确定性

CI(条件均值)$\hat{y}_i \pm t^{\alpha/2}_{n-p-1}\cdot\hat{\sigma}\cdot\sqrt{x_i^\top(X^\top X)^{-1}x_i} = \hat{y}_i\pm t^{\alpha/2}_{n-p-1}\cdot\hat{\sigma}\cdot\sqrt{h_{ii}}$

预测区间(PI): 对新观测值 y_new 的不确定性(比CI宽!)

预测误差方差$\text{Var}(y_{new}-\hat{y}_{new})=\sigma^2 x_i^\top(X^\top X)^{-1}x_i+\sigma^2=\sigma^2(1+h_{ii})$
PI(新观测值)$$y_{new}\pm t^{\alpha/2}_{n-k}\cdot\hat{\sigma}\cdot\sqrt{1+h_{ii}}$$
关键区别:
CI的方差 = σ²hᵢᵢ(只有参数不确定性)
PI的方差 = σ²(1+hᵢᵢ)(参数不确定性 + 新误差项)
PI永远比CI宽。当n→∞时,CI→零宽度,PI→仍有σ²的宽度。
15

TSS / ESS / RSS & R²

三个平方和的定义

TSS — Total
总平方和

TSS = Σ(ȳᵢ − yᵢ)² = ‖yd‖²
总体偏离均值的程度(分母)
yc = y − ȳ·1ₙ

ESS — Explained
回归平方和

ESS = Σ(ŷᵢ − ȳ)² = ‖ŷ − ȳ1‖²
模型能解释的部分

RSS — Residual
残差平方和

RSS = Σ(ŷᵢ − yᵢ)² = Σêᵢ² = ‖e‖²
模型无法解释的误差

TSS = ESS + RSS 的证明(笔记Image 4完整证明)

关键性质:ŷ − ȳ·1 ⊥ y − ŷ(正交)

即"回归值偏离均值的部分"与"残差"互相垂直。

证明:ŷ − ȳ·1 ⊥ y − ŷ(笔记Image 4 Key Relationship of OLS)

已知ŷ = Hy, e = y−ŷ = My
H·1 = 1因H是投影矩阵,若含截距则1∈col(X),H把1投影到自身
ŷ − ȳ·1 = H(y − ȳ·1) // ȳ·1 = ȳ·H1 = H(ȳ·1)
内积(ŷ − ȳ·1)ᵀ·e = [H(y−ȳ·1)]ᵀ·My
展开= yᵀHᵀMy − ȳ·1ᵀHᵀMy = yᵀHMy − ȳ·1ᵀHMy
HM=0H·M = H(I−H) = H−H² = H−H = 0
结论(ŷ − ȳ·1)ᵀ·e = 0 ✓ 正交
注:M·1 = 0(若有截距),因为M·X=0,而1∈col(X)。
‖yc‖² = ‖ŷ−ȳ1‖² + ‖e‖² 即 TSS = ESS + RSS

R² — 决定系数

R²定义$R^2=1-\dfrac{RSS}{TSS}=\dfrac{ESS}{TSS}$
简单回归$R^2=\rho^2=\dfrac{\text{Cov}(x,y)^2}{\text{Var}(x)\cdot\text{Var}(y)}$
有截距时$R^2=\text{corr}(y,\hat{y})^2$
Key — R² 的解释

R² 的性质与注意事项(笔记Image 4)

  • 模型解释力: R²是模型解释的方差比例(proportion of variance explained by the model)
  • 分母理解: 分母= 仅回归β₀(截距模型)的RSS;分子= 实际模型的RSS
  • 负R²: 当拟合模型比样本均值还差时,R² < 0(含截距时样本内不会发生)
  • 含截距时: 0 ≤ R² ≤ 1(因为ESS, RSS ≥ 0,且TSS = ESS + RSS)
  • 样本外: OOS R² 可以 < 0,说明模型不如用均值预测
  • 多元回归: 添加任何变量都会增加(或不变)样本内R²,不可靠用于模型选择

含截距 vs 无截距的 R²(笔记Image 4-5)

有截距(With Intercept)

$\mathbf{1}_n\in\text{col}(X)$,$e\perp\text{col}(X)\Rightarrow e\perp\hat{y}$
$\sum e_i=0\Rightarrow\bar{e}=0\Rightarrow\bar{\hat{y}}=\bar{y}$
$\hat{y}-\bar{y}\mathbf{1}_n\in\text{col}(X)\cap\{\mathbf{1}_n\}^\perp$,$e\in\text{col}(X)^\perp$
$\|y_c\|^2=\|\hat{y}-\bar{y}\mathbf{1}_n\|^2+\|e\|^2\Rightarrow 0\leq R^2\leq 1$

无截距(Without Intercept)

$\|y\|^2=\|\hat{y}\|^2+\|e\|^2$(仍成立);但 $\|y_c\|^2\neq\|\hat{y}-\bar{y}\mathbf{1}\|^2+\|e\|^2$($\hat{y}-\bar{y}\mathbf{1}$ 不一定 ⊥ e

→ RSS 可能 > TSS(R² < 0)
→ ESS 可能 > TSS(R² > 1)

解决:用 Uncentered R²
R²₀ = ESS₀/TSS₀ = ‖ŷ‖²/‖y‖²
Example — R² 组间异质性例题(笔记Image 6)

R² 组间异质性可以极大改变总体 R²

题目: X, Y, Z 各组 size 1000,r² = 0.5,全部组合在一起,r² 的取值范围?

情形1(左图)各组均值分离 $\Rightarrow$ 组间方差主导TSS $\Rightarrow$ 合并后 $R^2 o 1$(远大于0.5)
情形2(右图)各组均值重叠但斜率方向相反 $\Rightarrow$ 合并后斜率互相抵消 $\Rightarrow$ $R^2 o 0$(甚至负)
结论(笔记原文红色): R² ∈ [0,1],和 0.5 无关。
组间异质性(between-group heterogeneity)可以极大改变总体R²。
这说明R²高度依赖数据的聚合方式,单独看某个组的R²与合并后的R²可以完全不同——这是辛普森悖论(Simpson's Paradox)的一个体现。
16

t 统计量的几何解释

笔记Image 5给出了t统计量与R²之间的精确代数关系,揭示了t检验的几何本质。

核心关系式(笔记Image 5完整推导)

推导$t^2=\dfrac{\hat{\beta}_1^2}{\text{se}^2}=\dfrac{S_{xy}^2/S_{xx}}{\hat{\sigma}^2}$,代入 $S_{xy}^2=r^2 S_{xx}S_{yy}$,$\hat{\sigma}^2=(1-R^2)S_{yy}/(n-2)$:
核心关系$$t = r\sqrt{\frac{n-2}{1-r^2}},\qquad R^2 = \frac{t^2}{t^2+n-2}$$

几何意义解读

t统计量的几何含义

  • R²的函数: t只取决于R²和样本量n,与β的大小无关
  • 夹角解释: 将数据中心化后,y和X可看作n维空间的向量。corr r = cos(θ),θ是两向量夹角
  • t大时: R²接近1,即y与ŷ几乎平行(夹角趋于0)
  • t=0时: R²=0,y与X垂直(夹角90°),X对预测y无贡献

向量分解视角(投影几何)

  • yc = ŷc + e: yc在col(X)上的正交分解
  • ‖ŷc‖/‖yc‖ = √R²: 投影长度比 = √R²
  • sin²θ = 1−R²: 残差方向的"距离"
  • t²∝ ‖ŷc‖²/‖e‖²: 解释方差与残差方差之比(经自由度修正)
  • F统计量: 多元回归中,F是所有方向上t²的推广
Example — 几何解释数值验证

用 R² 和 t 的对应关系做推断

设 n = 52(月度数据2年),简单回归中 R² = 0.25。

$n=52,\;R^2=0.25$:$t=\sqrt{50\times 0.25/0.75}=\sqrt{50/3}\approx 4.08$,临界值 $t_{0.025}(50)\approx 2.01$,显著
反推$t=2$ 时:$R^2=4/(4+50)\approx 7.4\%$($n=52$ 时仅需极低 $R^2$ 即可显著!)
直觉: 大样本中,即使R²很低,也可以统计显著——统计显著性≠经济显著性。这是金融实证研究中的常见误区。
17

Lasso 深度解析

来自期中Cheatsheet PDF的Lasso完整理论,包括软阈值推导、正交设计、约束等价、稀疏性的几何解释。

P1:惩罚形式 ⟺ 约束形式的等价性

约束形式$\min_\beta\;\tfrac{1}{2}\|y-X\beta\|^2\quad\text{s.t.}\quad\|\beta\|_1\leq\tau$
惩罚形式$\min_\beta\;\tfrac{1}{2}\|y-X\beta\|^2+\lambda\|\beta\|_1$
等价性对给定 $\tau$,约束解=惩罚解(在使约束active的 $\lambda$ 处);$\lambda\uparrow\Leftrightarrow\tau\downarrow$
约束何时紧(binding)? 若‖β̂_OLS‖₁ > τ,OLS不可行;由凸性和封闭可行集,最优点在边界‖β‖₁ = τ 上。

P2:软阈值(Soft-Thresholding)——1D情形完整推导

Derivation — Soft Thresholding

1维Lasso:min_β ½(y−β)² + λ|β|

分三种情况讨论(|β|在β=0处不可微):

Case 1β > 0:q'(β) = −(y−β) + λ = β − y + λ = 0 → β = y − λ
有效条件:β > 0 要求 y − λ > 0,即 y > λ
Case 2β < 0:q'(β) = −(y−β) − λ = β − y − λ = 0 → β = y + λ
有效条件:β < 0 要求 y + λ < 0,即 y < −λ
Case 3β = 0:当 |y| ≤ λ 时,β=0 是全局最小值(|β|的折点处两侧次梯度条件满足)
结论β̂ = sign(y)·(|y|−λ)₊ = S_λ(y)(软阈值算子)
软阈值算子$\hat{\beta}=\mathcal{S}_\lambda(y)=\text{sign}(y)\cdot(|y|-\lambda)_+ = \begin{cases}y-\lambda & y>\lambda\\0 & |y|\leq\lambda\\y+\lambda & y<-\lambda\end{cases}$
软阈值 vs 硬阈值(Hard Thresholding):
硬阈值:|β̂_OLS| ≤ λ → 设为0;|β̂_OLS| > λ → 保持原值(不压缩)
软阈值:|β̂_OLS| ≤ λ → 设为0;|β̂_OLS| > λ → 压缩λ(shrunk by λ,即"软")
软阈值是Lasso的解,硬阈值对应Best Subset。

P3:正交设计下的Lasso解(XᵀX = Iₚ)

正交设计$X^\top X=I_p\;\Rightarrow\;\hat{\beta}_{OLS}=X^\top y$,目标函数分解:$\tfrac{1}{2}\|y-X\beta\|^2=\tfrac{1}{2}\|\beta-\hat{\beta}_{OLS}\|^2+\text{const}$
分量独立Lasso $=\sum_j[\tfrac{1}{2}(\hat{\beta}_j^{OLS}-\beta_j)^2+\lambda|\beta_j|]$,逐分量可分离
$\hat{\beta}_j^{Lasso}=\text{sign}(\hat{\beta}_j^{OLS})\cdot(|\hat{\beta}_j^{OLS}|-\lambda)_+$
重要: 正交设计是唯一有解析解的情形。一般情形需要坐标下降(LARS算法)。

P4:尺度不变性问题

问题若 $\tilde{x}_j=cx_j$,则 $\tilde{\beta}_j=\beta_j/c$,惩罚 $\lambda|\tilde{\beta}_j|=\lambda|\beta_j|/c$,$c$大时被惩罚少
Lasso不是尺度不变的!必须先标准化
解决$\tilde{x}_j=(x_j-\bar{x}_j)/\text{std}(x_j)$(使所有列的惩罚可比)

P5:λ 的选择——K折交叉验证

  1. 对每个候选λ值: 将数据分为K个fold
  2. 对k=1,…,K: 在k-1个fold上拟合β̂^(-k)_λ,在第k个fold上计算验证MSE
  3. 平均CV误差: CV(λ) = (1/K)·Σₖ MSE_k
  4. 选取λ*: 使CV(λ)最小的λ(或"one-standard-error rule":选最大的λ使CV ≤ min_CV + 1·SE)
时间序列CV(笔记PDF):
滚动窗口(Rolling):训练集 [t₀−w, t₀],验证集 [t₀+1, t₀+h],滚动前进 t₀
扩展窗口(Expanding):训练集 [1, t],验证集 [t+1, t+h],增长 t
绝不能用未来数据训练(不能train on future data)。

Lasso路径(Regularization Path)

LARS路径从 $\lambda_{max}$($\hat{\beta}=0$)到 $\lambda=0$(OLS),路径分段线性;warm starts 使更新廉价
次梯度条件$\beta_j\neq 0$:$-X_j^\top(y-X\beta)+\lambda\cdot\text{sign}(\beta_j)=0$;$\beta_j=0$:$|X_j^\top(y-X\beta)|\leq\lambda$

Lasso稀疏性的几何解释

Lasso(L1球,菱形)

可行域 {‖β‖₁ ≤ τ} 是菱形(hypercube的对偶)。顶角在坐标轴上(如β₁=0或β₂=0的点)。OLS等高线椭圆从外向内扩张,最先碰到的往往是菱形的顶角——某个βⱼ = 0,产生精确零解(稀疏性)

Ridge(L2球,圆形)

可行域 {‖β‖₂ ≤ c} 是球形(光滑)。OLS等高线椭圆最先碰到球面的切点通常不在坐标轴上——不产生精确零解,只有收缩。这是Ridge不选择变量的几何原因。

三种正则化估计量对比(正交设计情形)

估计量公式(正交设计)类型稀疏性
Best Subset(大小K)β̂ⱼ_OLS · 1[|β̂ⱼ_OLS| ≥ |β̂_(K)_OLS|]硬阈值(binary)✓ 精确零
Ridgeβ̂ⱼ_OLS / (1+λ)均匀收缩✗ 无零
Lassosign(β̂ⱼ_OLS)·(|β̂ⱼ_OLS|−λ)₊软阈值✓ 精确零
PCR(前k个PC)β̂ⱼ_OLS · 1[j≤k]二元(按方向)✓(某方向)
18

Ridge 深度解析

P1:投影矩阵 H 的性质回顾

投影矩阵$H=X(X^\top X)^{-1}X^\top$:对称($H=H^\top$),幂等($H^2=H$)
SVD表示$X=UDV^\top$(全秩)$\Rightarrow$ $H=UU^\top$(投影到 $\text{col}(X)$)

P3:Ridge 的闭合解 & 约束等价性

目标函数$Q(\beta)=\|y-X\beta\|^2+\lambda\|\beta\|^2$
FOC$(X^\top X+\lambda I_p)\beta=X^\top y\;\Rightarrow\;\hat{\beta}_\lambda=(X^\top X+\lambda I_p)^{-1}X^\top y$($\lambda>0$ 保证正定可逆)
等价约束$\min_\beta\|y-X\beta\|^2$ s.t. $\|\beta\|^2\leq c$;$g(\lambda)=\|\hat{\beta}_\lambda\|^2$ 严格递减

P4:增广设计矩阵(Augmented Design)

增广设计$\tilde{X}=\begin{bmatrix}X\\\sqrt{\lambda}I_p\end{bmatrix}\in\mathbb{R}^{(T+p)\times p},\quad\tilde{y}=\begin{bmatrix}y\\0\end{bmatrix}$
等价$\|\tilde{y}-\tilde{X}\beta\|^2=\|y-X\beta\|^2+\lambda\|\beta\|^2\;\checkmark$;$\tilde{X}^\top\tilde{X}=X^\top X+\lambda I$

P5:Ridge 的 SVD 形式(最重要!)

Derivation — Ridge的SVD表示

通过奇异值分解理解Ridge的收缩机制

SVD$X=UDV^\top$(thin SVD),$d_1\geq\cdots\geq d_p>0$,$X^\top X=VD^2V^\top$
Ridge SVD形式$$\hat{\beta}_\lambda = V(D^2+\lambda I)^{-1}DU^\top y$$
逐分量$\tilde{\beta}_j=\dfrac{d_j}{d_j^2+\lambda}\cdot(u_j^\top y)$($V$基下),对比OLS:$\dfrac{1}{d_j}\cdot(u_j^\top y)$;收缩因子 $\dfrac{d_j^2}{d_j^2+\lambda}\in(0,1)$
收缩机制(PDF P5):
小奇异值 dⱼ ≪ √λ → sⱼ ≈ dⱼ/λ ≈ 0(强收缩:对应X的"弱"方向/多重共线方向)
大奇异值 dⱼ ≫ √λ → sⱼ ≈ 1/dⱼ(轻微收缩:对应X的"强"方向)
Ridge对条件数差(ill-conditioned)的方向收缩最强!

P6:Ridge 拟合值 = "软投影"(Soft Projection)

软投影$\hat{y}_\lambda=U\cdot\text{diag}\!\left[\dfrac{d_j^2}{d_j^2+\lambda}\right]\cdot U^\top y$
对比OLS(硬投影):权重$=1$;Ridge(软投影):权重 $w_j=d_j^2/(d_j^2+\lambda)\in(0,1)$;小$d_j$方向被强烈压缩

P7:Ridge 的偏差与方差(Bias-Variance分解)

Derivation — Bias-Variance Tradeoff

Ridge的Bias² + Variance vs OLS

偏差$\text{Bias}(\tilde{\beta}_j)=-\dfrac{\lambda}{d_j^2+\lambda}\tilde{\beta}_j^*$($\lambda>0$ 时有偏)
方差$\text{Var}(\tilde{\beta}_j)=\dfrac{\sigma^2 d_j^2}{(d_j^2+\lambda)^2}$(vs OLS:$\sigma^2/d_j^2$,Ridge始终更小)
MSE$MSE=\text{Bias}^2+\text{Var}$;$\lambda\uparrow\Rightarrow|\text{Bias}|\uparrow,\text{Var}\downarrow$;存在最优 $\lambda$ 使 MSE 最小
总结(PDF P7):
λ↑ → 偏差↑,方差↓,用偏差换方差(bias-variance tradeoff)
λ=0 → 退化为OLS(无偏,但方差最大)
λ→∞ → β̂→0(最大偏差,最小方差)
最优λ通过CV选取,使总MSE最小
19

PCR vs Ridge 对比

PCR和Ridge都是处理多重共线性/高维数据的降维方法,但机制不同。通过SVD视角可以清晰对比(来自PDF P8)。

SVD视角下的统一框架

统一框架$\hat{y}=U\cdot\text{diag}(w_j)\cdot U^\top y$,权重 $w_j$ 决定第 $j$ 个方向保留程度:
OLS$w_j=1$(全保留)
Ridge$w_j=d_j^2/(d_j^2+\lambda)\in(0,1)$(连续软收缩)
PCR$w_j=\mathbf{1}[j\leq k]$(二元硬截断)
特性RidgePCR
权重 wⱼdⱼ²/(dⱼ²+λ)(连续,软)1[j≤k](二元,硬)
类型软、连续(soft projection)硬、离散(hard thresholding by direction)
调参参数λ > 0(连续)k ∈ Z⁺(离散)
对小奇异值的处理强烈压缩(sⱼ≈dⱼ/λ≈0)完全丢弃(wⱼ=0 for j>k)
对大奇异值的处理轻微压缩(sⱼ≈1/dⱼ)完全保留(wⱼ=1)
解析解✓ 有(β̂=(XᵀX+λI)⁻¹Xᵀy)✓ 有(PCA+OLS)
适用场景所有方向都有一定信息量只有前k个PC有用,其余纯噪声
Example — PCR的计算过程

PCR步骤(PDF P8)

  1. SVD分解: X = UDVᵀ(thin SVD),取前k列得 Uₖ, Dₖ
  2. 得分矩阵: Zₖ = XVₖ = UₖDₖ,满足 ZₖᵀZₖ = Dₖ²
  3. 对Zₖ做OLS: ŷ_PCR = Zₖ(ZₖᵀZₖ)⁻¹Zₖᵀy = UₖDₖDₖ⁻²DₖUₖᵀy = UₖUₖᵀy
  4. 转换回原β: β̂_PCR = Vₖ(ZₖᵀZₖ)⁻¹Zₖᵀy
PCR ≠ 对PC做Ridge: PCR对前k个PC方向权重=1(完全保留),对后面权重=0(完全丢弃)。Ridge是连续过渡。PCR需要选离散的k,Ridge选连续的λ。

Bias-Variance:Ridge vs PCR

Ridge方差$\text{Var}(\tilde{\beta}_j^{Ridge})=\sigma^2 d_j^2/(d_j^2+\lambda)^2$(每个方向均被压缩)
PCR方差$\text{Var}(\tilde{\beta}_j^{PCR})=\sigma^2/d_j^2\;(j\leq k)$,$0\;(j>k)$(保留方向无偏,其余为0)

模型选择准则(PDF内容)

准则公式目标特点
AICIS Dev + 2·df预测(渐近OOS偏差)高维下df≈n时过拟合
BICIS Dev + log(n)·df模型选择(近似后验概率)n>7时比AIC更节省参数(log n > 2)
为什么两者会不一致? IS R²目标是解释X的方差;IC目标是一致地估计因子数;OOS目标是预测y;经济目标是找到可解释的风险源。不同目标 → 有限样本下不同的k选择。
20

Frisch-Waugh-Lovell(FWL)定理

笔记Page 1补充:OLS y~x 最小化Y方向竖直残差。OLS把X想像成无noise的;PCA x,y均有误差。在OLS中,一般 p < n(p < n/10有效经验);否则近以奇异,(XᵀX)⁻¹爆炸。

Frisch-Waugh-Lovell 定理(笔记Page 20)

设 Y ~ Zβz + Wβw + ε,Z ∈ ℝⁿˣᵏ 为控制变量,W ∈ ℝⁿˣᵐ 为关注变量。

令 Pz = Z(ZᵀZ)⁻¹Zᵀ,Mz = I − Pz,则:

① Y~Z 残差:fy = Mz·Y ② W~Z 残差:fw = Mz·W

fy ~ fw,β̂w = (WᵀMzW)⁻¹WᵀMzY = (fwᵀfw)⁻¹fwᵀfy

笔记中的直觉理解

证明(来自笔记Page 20)

正则方程$Z^\top(Y-Z\hat{\beta}_z-W\hat{\beta}_w)=0,\quad W^\top(Y-Z\hat{\beta}_z-W\hat{\beta}_w)=0$
代入消去由第一式代入第二式:$W^\top(I-P_z)(Y-W\hat{\beta}_w)=0\;\Rightarrow\;W^\top M_z Y=W^\top M_z W\hat{\beta}_w$
结论$$\hat{\beta}_w=(W^\top M_z W)^{-1}W^\top M_z Y=(f_w^\top f_w)^{-1}f_w^\top f_y\quad\checkmark$$
Example(笔记Page 20完整推导)

FWL 代数展开:Y ~ βz·Z + βw·W + ε

设已中心化。令 f = Cov(Y,Z)/Var(Z),γ = Cov(Z,W)/Var(Z),则:

残差$f_y=M_z Y=Y-\frac{\text{Cov}(Y,Z)}{\text{Var}(Z)}Z$,$f_w=M_z W=W-\frac{\text{Cov}(Z,W)}{\text{Var}(Z)}Z$
偏回归系数$\hat{\beta}_w=\dfrac{\text{Cov}(Y,W)-\frac{\text{Cov}(Y,Z)\text{Cov}(W,Z)}{\text{Var}(Z)}}{\text{Var}(W)-\frac{\text{Cov}(W,Z)^2}{\text{Var}(Z)}}$(多元回归偏回归系数的解析形式)
特殊情形:若 Z = 1ₙ(截距),Mz·Y = Y−ȳ,Mz·W = W−W̄,FWL退化为有截距回归等价于中心化后的无截距回归。
Example(笔记Page 32)FWL应用:βz = c?

Q: y ~ Xβ + βz·z + ε; y ~ Xβ + r, r = cz + u. 是否 β̂z = ĉ?

FWL$\hat{\beta}_z=(z^\top M_x z)^{-1}z^\top M_x y$;残差回归:$\hat{c}=(z^\top z)^{-1}z^\top M_x y$
关系$\hat{c}=\hat{\beta}_z\cdot\|M_x z\|^2/\|z\|^2\in[0,1]$
z⊥C(X)时$M_x z=z\;\Rightarrow\;\hat{c}=\hat{\beta}_z$
z∈C(X)时$M_x z=0\;\Rightarrow\;\hat{c}=0\neq\hat{\beta}_z$
结论(笔记Page 33):ĉ = β̂z · ‖Mxz‖²/‖z‖² ∈ [0,1],等于β̂z乘以一个收缩因子。只有当z与X正交时两者相等。
Example — 固定效应(FE)Within Estimator

面板数据:yᵢₜ = αᵢ + β·xᵢₜ + εᵢₜ

FE/Within估计$Z$=个体虚拟矩阵,FWL $\Rightarrow$ demean:$M_z y_{it}=y_{it}-\bar{y}_i$,$M_z x_{it}=x_{it}-\bar{x}_i$
结果$\hat{\beta}_{FE}=\dfrac{\sum_i\sum_t(x_{it}-\bar{x}_i)(y_{it}-\bar{y}_i)}{\sum_i\sum_t(x_{it}-\bar{x}_i)^2}$(无需构造大矩阵求逆)
21

se(β̂) 有/无截距的区别

性质有截距 y = α + βx + ε无截距 y = βx + ε
β̂ 公式Sxy/Sxx = Σ(xᵢ−x̄)(yᵢ−ȳ)/Σ(xᵢ−x̄)²ΣxᵢYᵢ/Σxᵢ²
se(β̂) 分母√Sxx = √Σ(xᵢ−x̄)²(中心化)√Σxᵢ²(原始,未中心化)
自由度σ̂² = RSS/(n−2)σ̂² = RSS/(n−1)
残差性质Σêᵢ = 0(保证)Σêᵢ ≠ 0(一般)
R² 定义标准R²,0≤R²≤1需用R²₀ = ‖ŷ‖²/‖y‖²
Example — x̄大时虚假精度

x = [100,101,102,103,104], x̄ = 102

数值$\sum x_i^2=52030,\;S_{xx}=10$
有截距$\text{se}(\hat{\beta})=\hat{\sigma}/\sqrt{10}$
无截距$\text{se}(\hat{\beta})=\hat{\sigma}/\sqrt{52030}$(小72倍!但这是虚假精度——若真实截距≠0则系数有偏)
无截距强迫回归线过原点,若真实截距≠0则产生有偏估计(OVB)。更小的se反而更危险。

β̂ 的总体矩形式(笔记Page 21)

总体形式$\beta=(X^\top X)^{-1}X^\top y$;总体中:$X^\top X\to\Sigma_{xx},\;X^\top y\to\Sigma_{xy}$
已中心化$\Sigma_{xx}=\text{Var}(X),\quad\Sigma_{xy}=\text{Cov}(X,y)$
未中心化$\Sigma_{xx}=E[(X-\mu_x)(X-\mu_x)^\top],\quad\Sigma_{xy}=E[(X_i-\mu_x)(y_i-\mu_y)]$
22

F 检验 & 高级专题

F 统计量

约束F检验$H_0: R\beta=r$($q$个约束):$F=\dfrac{(RSS_r-RSS_u)/q}{RSS_u/(n-k)}\sim F(q,n-k)$
全局F检验$F=\dfrac{R^2/k}{(1-R^2)/(n-k-1)}\sim F(k,n-k-1)$
Adj R²$\bar{R}^2=1-(1-R^2)\cdot\dfrac{n-1}{n-p-1}$

Moore-Penrose 伪逆(笔记Page 22)

SVD$X=U\Sigma V^\top$($X_{n\times m}$),伪逆 $X^+=U\Sigma^+ V^\top$($\Sigma^+$:非零奇异值取倒数后转置)
应用若 $X^\top X$ 奇异,$\hat{\beta}=X^+ y$(范数最小解,最不"夸张"的解)
局限没有平衡 bias-variance(不如Ridge稳健)

Online/Recursive OLS(笔记Page 24)

Online OLS$\hat{\beta}_t=\arg\min_\beta\sum_{i=1}^t(y_i-x_i^\top\beta)^2$(逐步更新)
Sherman-Morrison$(A+uv^\top)^{-1}=A^{-1}-\dfrac{A^{-1}uv^\top A^{-1}}{1+v^\top A^{-1}u}$(秩1更新,无需整体求逆)
分块OLS$X^\top X=\sum_i x_ix_i^\top$($p\times p$),$X^\top y=\sum_i x_iy_i$($p\times 1$);逐块累加,最后算一次 $(X^\top X)^{-1}X^\top y$

Ridge Feature复制定理(笔记Page 19)

Theorem — Ridge与特征复制

把X复制k份作为k个独立特征,Ridge的β如何变化?

设定原模型 $y=X\beta+\varepsilon$(Ridge $\lambda$);复制:$y=X\beta_1+X\beta_2+\cdots+X\beta_k+\varepsilon$(Ridge $\lambda$)
对称性$\beta_1=\cdots=\beta_k=b$,$\gamma=\sum\beta_j=kb$;$L(b)=\|y-X\gamma\|^2+(\lambda/k)\gamma^2$
等价$\lambda\to\lambda/k$(正则化减弱)$\Rightarrow\gamma>\hat{\beta}_{ridge}$;$k\to\infty:\gamma\to X^\top Y/X^\top X=\hat{\beta}_{OLS}$
Lasso的情况:Lasso会把k-1个β设为0,保留1个β(减少penalty),让Lasso极不稳定。所以Lasso对特征复制非常敏感。

Newey-West HAC 完整推导(笔记Page 9)

设定$y_t=x_t^\top\beta+u_t$;若存在异方差+自相关,真实方差:$\text{Var}(\hat{\beta})=(X^\top X)^{-1}\Omega(X^\top X)^{-1}$,$\Omega=\sum_{j=-\infty}^\infty\Gamma_j$
定义$\phi_t=x_t u_t$,$\Gamma_j=E[\phi_t\phi_{t-j}^\top]$;$\hat{\Gamma}_j=\frac{1}{T}\sum_{t=j+1}^T\phi_t\phi_{t-j}^\top$
NW估计$\hat{\Omega}_{NW}=\hat{\Gamma}_0+\sum_{j=1}^L w_j(\hat{\Gamma}_j+\hat{\Gamma}_j^\top)$,$w_j=1-\frac{j}{L+1}$(Bartlett核)
HAC方差$\widehat{\text{Var}}_{NW}(\hat{\beta})=(X^\top X)^{-1}\hat{\Omega}_{NW}(X^\top X)^{-1}$(HAC consistent)
23

笔记例题精选集

来自笔记Pages 25–33的全部例题,完整保留推导过程。

Q1(Page 25)

Y~X,X和Y iid正态,做线性回归,E[R²] = ?

真实R²=0,但样本R²>0(模型用了n个自由度)。

一元推导$T=\dfrac{R\sqrt{n-2}}{\sqrt{1-R^2}}\sim t(n-2)\;\Rightarrow\;R^2=\dfrac{T^2}{T^2+n-2}$
分布$T^2\sim F(1,n-2)$,由 $F\sim F(d_1,d_2)\Rightarrow\dfrac{d_1 F}{d_1 F+d_2}\sim\text{Beta}(d_1/2,d_2/2)$,故 $R^2\sim\text{Beta}(1/2,\frac{n-2}{2})$
一元结论$E[R^2]=\dfrac{1/2}{1/2+(n-2)/2}=\dfrac{1}{n-1}$
多元($\beta=0$)$F=\dfrac{R^2/k}{(1-R^2)/(n-k-1)}\sim F(k,n-k-1)\;\Rightarrow\;R^2\sim\text{Beta}(k/2,\frac{n-k-1}{2})\;\Rightarrow\;E[R^2]=\dfrac{k}{n-1}$
1) ~ Beta(k/2, (n−k−1)/2)
E[R²] = k/(n−1)
直觉:即使真实无关,样本内R²的期望随变量数k增加而增加,这正是为什么要用Adj R²和OOS R²来做模型选择。
Q2(Page 25-26)

OLS vs Ridge vs Lasso:feature复制k份,β如何变化?

OLS不可分辨各 $\beta_j$;$\gamma=\sum\beta_j=\beta_{ori}$,解不唯一
Ridge$\beta_1=\cdots=\beta_k=b$,$\gamma=kb\;\Rightarrow\;\lambda\to\lambda/k$,$\gamma>\hat{\beta}_{ridge}$(正则化减弱)
Lasso把 $k-1$ 个 $\beta$ 设为0,保留1个减少L1 penalty $\Rightarrow$ 结果极不稳定
数据复制(行,Page 26):OLS β不变;Ridge λ→λ/k×k²=λk(λ变大,正则化加强,β↓);Lasso同理λ→2λ,shrink↑,更多β=0。
Q3(Page 26)

y = β₀+β₁x+ε,β₁=1,R²=0.05。求 Var(y)/Var(x)=?

由β₁=1$\text{Cov}(x,y)/\text{Var}(x)=1\;\Rightarrow\;\text{Cov}(x,y)=\text{Var}(x)$
代入R²$R^2=\text{Cov}(x,y)^2/(\text{Var}(x)\cdot\text{Var}(y))=\text{Var}(x)/\text{Var}(y)=0.05$
结论$\text{Var}(y)/\text{Var}(x)=20$
β₁=1但R²仅0.05,说明y的大部分方差来自误差ε,而非x。系数显著≠R²高!
Q4(Page 26)

y~x → β₁,x~y → β₂,哪个斜率更大?

计算$\hat{\beta}_1=\text{Cov}(x,y)/\text{Var}(x)$,$\hat{\beta}_2=\text{Cov}(x,y)/\text{Var}(y)$
结论$\hat{\beta}_1/\hat{\beta}_2=\text{Var}(y)/\text{Var}(x)=1/\rho^2\geq 1\;\Rightarrow\;\hat{\beta}_1\geq\hat{\beta}_2$
两个回归斜率的几何均值 = √(β₁·β₂) = ρ(相关系数),两者乘积 = ρ²。
Q5(Page 26)

如何检验一枚硬币是否公平?

假设$H_0$:公平硬币,$X=\sum X_i$,$E[X]=N/2$,$\text{Var}(X)=N/4$,$\sigma=\sqrt{N}/2$
t统计量$t=(X-N/2)/(\sqrt{N}/2)$;若 $|t|>1.96$(2.575),95%(99%)置信拒绝 $H_0$
这是最简单的单比例z检验,等价于对伯努利随机变量做均值的t检验。
Q6(Page 26)

系数显著但样本内R²低,如何理解?

答案(笔记原话): coefficient means the trend(系数衡量的是趋势/方向);R² represents the scatter around the line(R²衡量的是数据围绕趋势线的散布程度)。
β₁显著 → x与y有稳定的线性关系(信噪比高)
R²低 → 误差方差大(x只能解释y方差的一小部分)
金融数据中极为常见:收益率有显著预测因子,但R²仍只有1-5%。
Q7(Page 27)重要!

Y~X,a. 使用样本A;b. 把A复制一份用合并样本。比较β̂和t。

β̂不变$\hat{\beta}_{new}=[(2X^\top)(2X)]^{-1}(2X^\top)(2Y)=(X^\top X)^{-1}X^\top Y=\hat{\beta}\;\checkmark$
σ̂²$RSS^*=2RSS$,$\hat{\sigma}^{*2}=2RSS/(2n-p)\approx\hat{\sigma}^2$(略小)
se变化$\sum(x_i-\bar{x})^2_{new}=2S_{xx}\;\Rightarrow\;\text{se}(\hat{\beta}^*)\approx\text{se}(\hat{\beta})/\sqrt{2}$
结论$\tilde{t}=t\cdot\sqrt{(2n-p)/(n-p)}\approx t\cdot\sqrt{2}$(增大 $\sqrt{2}$ 倍);复制 $m$ 次:$t_m=t\cdot\sqrt{m}$
⚠ 注意:复制数据 → t增大,看似更显著 → 这是虚假的!实际信息量没有增加。若沿列复制(特征复制)→ 完美多重共线性,根本无法做线性回归。
Q8(Page 27)

Y~X,给X加额外噪声。β̂会怎样变?

加X噪声$\hat{\beta}'=\dfrac{\text{Cov}(x^*+\eta,y)}{\text{Var}(x^*+\eta)}=\dfrac{\beta\sigma_x^2}{\sigma_x^2+\sigma_\eta^2}$
衰减偏差$|\hat{\beta}'|<|\hat{\beta}|$(系数被低估)
加Y噪声$\hat{\beta}''=\text{Cov}(X,y+\eta)/\text{Var}(X)=\hat{\beta}$(不变,只影响se)
向X加噪声 → 系数被低估(attenuation bias);向Y加噪声 → 系数不变,只是se增大。
Q9(Page 28)

Y~10X vs Y~X,R²有何区别?

计算$R^2=\dfrac{\text{Cov}(10x,y)^2}{\text{Var}(10x)\text{Var}(y)}=\dfrac{100\text{Cov}(x,y)^2}{100\text{Var}(x)\text{Var}(y)}=\rho^2$
结论$R^2$ 是尺度不变的(scale invariant),只取决于相关性,与变量的量纲无关
Q10(Page 28)重要!

已知 Corr(Y,X₁)>0,Corr(Y,X₂)=0,Corr(X₁,X₂)>0
① y = aX₁+ε;② y = b₁X₁+b₂X₂+ε,a与b₁的关系?

求b₂$\text{Cov}(Y,X_2)=0\;\Rightarrow\;b_1\text{Cov}(X_1,X_2)+b_2\text{Var}(X_2)=0\;\Rightarrow\;b_2=-b_1\cdot\dfrac{\text{Cov}(X_1,X_2)}{\text{Var}(X_2)}<0$
求a$a=\dfrac{\text{Cov}(Y,X_1)}{\text{Var}(X_1)}=b_1+b_2\cdot\dfrac{\text{Cov}(X_1,X_2)}{\text{Var}(X_1)}=b_1(1-\rho_{12}^2)
结论$b_2<0
直觉:OVB(省略X₂)让a高估了b₁,因为X₁部分"代替"了X₂的作用。多元回归中b₂为负(压制X₁的影响),使b₁>a。
Q11(Page 28)

y=a₁X₁+a₂X₂+ε vs y=b₁X₁+ε₁, ε₁=b₂X₂+ε₂,若a₁=b₁, a₂=b₂?

FWL公式$a_1=\dfrac{\text{Cov}(Y,X_1)-\text{Cov}(Y,X_2)\text{Cov}(X_1,X_2)/\text{Var}(X_2)}{\text{Var}(X_1)-\text{Cov}(X_1,X_2)^2/\text{Var}(X_2)}$
独立时若 $\text{Cov}(X_1,X_2)=0$:$a_1=b_1,\;a_2=b_2\;\checkmark$
相关时$\text{Cov}(X_1,X_2)\neq 0$:$a_1\neq b_1$(OVB)
Q12(Page 28)

应该总是选R²更高的模型吗?

不应该。需要考虑:
① Adjusted R² = 1 − (1−R²)·(n−1)/(n−p−1)(惩罚额外的X变量)
② OOS R²(样本外,防止过拟合)
③ AIC = 2k − 2ln(L),k=变量数,L=最大似然估计值(好的预测)
④ BIC = ln(n)·k − 2ln(L),n=样本量(好的解释,更严格)
AIC找高精度预测模型;BIC找真实简单模型(更倾向稀疏)
Q13(Page 29)

y = aX₁+ε,X₂ = 100X₁,y = bX₂+ε,a与b的关系?

计算$b=\dfrac{\text{Cov}(100X_1,y)}{\text{Var}(100X_1)}=\dfrac{100\text{Cov}(X_1,y)}{100^2\text{Var}(X_1)}=\dfrac{a}{100}$
结论$a=100b$
系数与变量单位成反比。X₂=100X₁时,一单位X₂的效应 = a/100 = b,这正是单位一致性。
Q14(Page 29)

CI(y) 与 PI(y) 的关系?

CI(均值)$\hat{y}_0\pm t^{\alpha/2}_{n-p}\cdot\hat{\sigma}\cdot\sqrt{\dfrac{1}{n}+\dfrac{(x_0-\bar{x})^2}{\sum(x_i-\bar{x})^2}}$
PI(新值)$\hat{y}_0\pm t^{\alpha/2}_{n-p}\cdot\hat{\sigma}\cdot\sqrt{1+\dfrac{1}{n}+\dfrac{(x_0-\bar{x})^2}{\sum(x_i-\bar{x})^2}}$
比较$PI>CI$;$n\to\infty$:CI宽度$ o 0$,PI宽度仍有 $\hat{\sigma}$ 下限
Q15(Page 29)

y = ax+ε,x = by+ε,a=1,b=?

由a=1$\text{Cov}(X,Y)/\text{Var}(X)=1\;\Rightarrow\;\text{Cov}(X,Y)=\text{Var}(X)$
求b$b=\text{Cov}(X,Y)/\text{Var}(Y)=\text{Var}(X)/\text{Var}(Y)=\rho^2\in[0,1]$
两个回归方向的斜率乘积 = ρ²(相关系数的平方),这正是R²的含义。两者相等(a=b)当且仅当ρ=1(完全相关)。
Q16(Page 30)贝叶斯推断

已知 Y = X+ε,X~N(0,1),ε~N(0,σ²),观测到Y,求X的估计

后验$P(X|Y)\propto P(Y|X)\cdot P(X)\propto\exp\!\left[-\frac{(y-x)^2}{2\sigma^2}-\frac{x^2}{2}\right]$
化简$\propto\exp\!\left[-\frac{1+\sigma^2}{2\sigma^2}\left(x-\frac{y}{1+\sigma^2}\right)^2\right]$
结论$X|Y\sim N\!\left(\dfrac{Y}{1+\sigma^2},\,\dfrac{\sigma^2}{1+\sigma^2}\right)$;$E[X|Y]=\dfrac{Y}{1+\sigma^2}$(贝叶斯收缩,即Ridge的贝叶斯解释)
直觉:当σ²→0(无测量误差):E[X|Y]→Y;当σ²→∞(纯噪声):E[X|Y]→0(先验均值)。这正是Ridge regression的贝叶斯解释!
Q17(Page 31)

回归 Y~X,已知X和Y在[0,1]上iid均匀,且X+Y>1,求β̂

设定$X,Y\sim\text{Uniform}[0,1]$独立,条件 $X+Y>1$,$P(X+Y>1)=1/2$
条件期望$E[X|X+Y>1]=\dfrac{\int_0^1\int_{1-x}^1 x\,dy\,dx}{1/2}=\dfrac{1/3}{1/2}=\dfrac{2}{3}$,同理 $E[Y|X+Y>1]=2/3$
E[XY]$E[XY|X+Y>1]=\dfrac{\int_0^1 x(1-(1-x)^2)/2\,dx}{1/2}=\dfrac{5/24}{1/2}=\dfrac{5}{12}$
结论$\hat{\beta}=\dfrac{E[XY]-E[X]E[Y]}{E[X^2]-E[X]^2}=\dfrac{5/12-4/9}{1/2-4/9}=-\dfrac{1}{2}$(负相关:约束下 $X$ 大则 $Y$ 小)
/ (1/2 − 4/9) = (−35/36) / (1/18) = −1/2
负相关:在X+Y>1的条件下,X大则Y倾向于小(受约束影响),因此斜率为负。
Q18(Page 31)

线性回归中,x复制,y改为[y; 0],β̂和t-stat会怎样变化?

结论$\hat{\beta}_{new}=(1/2)\hat{\beta}_{ori}$;$RSS^*=RSS+\frac{1}{2}\|\hat{y}\|^2$(增大),$\text{se}(\hat{\beta})\uparrow$,$t\downarrow$
附加了n个(x, 0)观测 → 把y向零拉,系数减半;se增大;t统计量减小。
Q19(Page 32)重要!

x,y iid,now xₜ* = (xₜ+xₜ₋₁)/2(滑动平均),y不变,新β̂和t-stat?

β̂不变$\hat{\beta}'=\dfrac{\text{Cov}(x_t^*,y_t)}{\text{Var}(x_t^*)}=\dfrac{\frac{1}{2}\text{Cov}(x_t,y_t)}{\frac{1}{2}\text{Var}(x_t)}=\hat{\beta}\;\checkmark$
t减小$\text{se}^2(\hat{\beta}')=\text{se}^2(\hat{\beta})\cdot(\hat{\beta}^2\sigma_x^2/\sigma^2+2)>\text{se}^2(\hat{\beta})$
结论$\tilde{t}=\dfrac{t}{\sqrt{2+\hat{\beta}^2\sigma_x^2/\sigma^2}}
n class="red">t̃ = β̂'/se(β̂') = t / √(2 + β̂²σ²x/σ²) < t(减小)
滑动平均引入了自相关(Corr(xₜ*, xₜ₊₁*) = 1/2),导致残差自相关,se增大,t减小——应该用Newey-West稳健标准误。
Q20(Page 32-33)FWL深化

y~Xβ+βz·z+ε,同时 y~Xβ+r,r=cz+u,证明 β̂z 与 ĉ 的关系

FWL$\hat{\beta}_z=(z^\top M_x z)^{-1}z^\top M_x y$;残差回归:$\hat{c}=(z^\top z)^{-1}z^\top M_x y$
关系$\hat{c}/\hat{\beta}_z=\|M_x z\|^2/\|z\|^2\in[0,1]$;$z\perp C(X)\Rightarrow\hat{c}=\hat{\beta}_z$;$z\in C(X)\Rightarrow\hat{c}=0\neq\hat{\beta}_z$
金融应用:z是某因子,X是已知控制变量。"残差因子定价"(先做r̂=Mxy,再回归r̂~z)与完整回归得到的βz不相等(除非z与X正交)。常见错误!
Q21(Page 33)

n对(yᵢ,xᵢ),t-stat为t₁;把每对做平均得(ȳᵢ',x̄ᵢ'),t-stat为t₂,比较?

β̂不变$\hat{\beta}'=\dfrac{\text{Cov}(x_t',y_t')}{\text{Var}(x_t')}=\dfrac{\frac{1}{2}\text{Cov}(X,Y)}{\frac{1}{2}\text{Var}(X)}=\hat{\beta}\;\checkmark$
t近似不变$\sigma^2$ 和 $\text{Var}(X)$ 按相同比例缩放,仍用旧方法计算 $\text{se}$ 时 $t$ 近乎不变
Q22(Page 28)模型比较

y=ax₁+ε vs y=b₁x₁+b₂x₂+ε,若b₂=0,则b₁=a?

证明$b_2=0\;\Rightarrow\;\min\sum(y-b_1x_1-b_2x_2)^2=\min\sum(y-b_1x_1)^2\;\Rightarrow\;b_1=a\;\checkmark$
FWL推论:若X₂对y无独立影响(β₂=0),多元回归中X₁的系数等于单元回归中的系数。这只在β₂=0时成立,β₂=0≠Corr(X₁,X₂)=0!
24

简单线性回归——带截距项完整推导

来自笔记 Simple_Linear_Regression.pdf 的完整、系统推导,使用 KaTeX 渲染所有公式。

模型设定

模型$y_i = \alpha + \beta x_i + \varepsilon_i, \quad i=1,2,\ldots,n$
假设$E[\varepsilon_i \mid X_i]=0, \quad \text{Var}(\varepsilon_i \mid X_i)=\sigma^2, \quad \varepsilon_i \sim N(0,\sigma^2)$
定义$\bar{x}=\dfrac{1}{n}\sum_{i=1}^n x_i, \quad \bar{y}=\dfrac{1}{n}\sum_{i=1}^n y_i$
定义$S_{xx}=\sum_{i=1}^n(x_i-\bar{x})^2, \quad S_{xy}=\sum_{i=1}^n(x_i-\bar{x})(y_i-\bar{y})$

OLS 推导——一阶条件

目标$\min_{\alpha,\beta}\; Q(\alpha,\beta)=\sum_{i=1}^n (y_i-\alpha-\beta x_i)^2$
FOC ①$\dfrac{\partial Q}{\partial \alpha}=-2\sum(y_i-\alpha-\beta x_i)=0 \;\Rightarrow\; \sum y_i = n\alpha + \beta\sum x_i$
$\Rightarrow\; \hat{\alpha}=\bar{y}-\hat{\beta}\bar{x}$ ——回归线必过点 $(\bar{x},\,\bar{y})$
FOC ②$\dfrac{\partial Q}{\partial \beta}=-2\sum x_i(y_i-\alpha-\beta x_i)=0 \;\Rightarrow\; \sum x_i y_i - \alpha\sum x_i - \beta\sum x_i^2=0$
代入 $\hat{\alpha}=\bar{y}-\hat{\beta}\bar{x}$:
$\sum x_i y_i - n\bar{x}\bar{y} + \hat{\beta}n\bar{x}^2 - \hat{\beta}\sum x_i^2 = 0$
$\hat{\beta}\!\left(\sum x_i^2 - n\bar{x}^2\right) = \sum x_i y_i - n\bar{x}\bar{y}$
注意:$\sum x_i^2 - n\bar{x}^2 = \sum(x_i-\bar{x})^2 = S_{xx}$;$\sum x_i y_i - n\bar{x}\bar{y}=\sum(x_i-\bar{x})(y_i-\bar{y})=S_{xy}$
结论$$\hat{\beta}=\frac{S_{xy}}{S_{xx}}=\frac{\sum_{i=1}^n(x_i-\bar{x})(y_i-\bar{y})}{\sum_{i=1}^n(x_i-\bar{x})^2} = \frac{\widehat{\text{Cov}}(x,y)}{\widehat{\text{Var}}(x)}, \qquad \hat{\alpha}=\bar{y}-\hat{\beta}\bar{x}$$

残差的三条性质

定义$\hat{\varepsilon}_i = y_i - \hat{y}_i = y_i - \hat{\alpha} - \hat{\beta}x_i$
性质①$\sum_{i=1}^n\hat{\varepsilon}_i = 0$  (由 $\alpha$ 的一阶条件)
性质②$\sum_{i=1}^n x_i\hat{\varepsilon}_i = 0$  (由 $\beta$ 的一阶条件)
性质③$\bar{\hat{y}} = \bar{y}$,即 $\dfrac{1}{n}\sum\hat{y}_i = \bar{y}$
证明③:$\hat{y}_i = \hat{\alpha}+\hat{\beta}x_i \Rightarrow \bar{\hat{y}} = \hat{\alpha}+\hat{\beta}\bar{x} = (\bar{y}-\hat{\beta}\bar{x})+\hat{\beta}\bar{x} = \bar{y}$ ✓

$\hat{\beta}$ 的无偏性与方差

关键恒等式$\sum(x_i-\bar{x})y_i = \sum(x_i-\bar{x})(y_i-\bar{y}) = S_{xy}$
(后一项 $-\bar{y}\sum(x_i-\bar{x})=0$,故两式相等)
展开$\hat{\beta}=\dfrac{\sum(x_i-\bar{x})y_i}{S_{xx}} = \dfrac{\sum(x_i-\bar{x})(\alpha+\beta x_i+\varepsilon_i)}{S_{xx}}$
由于 $\sum(x_i-\bar{x})\alpha=0$,$\sum(x_i-\bar{x})\beta x_i = \beta S_{xx}$:
$\hat{\beta} = \beta + \dfrac{\sum(x_i-\bar{x})\,\varepsilon_i}{S_{xx}}$
无偏性$E[\hat{\beta}\mid X] = \beta + \dfrac{\sum(x_i-\bar{x})\,E[\varepsilon_i\mid X]}{S_{xx}} = \beta$ ✓
关键:用到 $E[\varepsilon_i\mid X]=0$,而非 $\sum\hat{\varepsilon}_i=0$(样本中大概率成立,但不是假设)
方差$\text{Var}(\hat{\beta}\mid X)=\text{Var}\!\left(\dfrac{\sum(x_i-\bar{x})\varepsilon_i}{S_{xx}}\bigg|X\right) = \dfrac{1}{S_{xx}^2}\sum(x_i-\bar{x})^2\sigma^2 = \dfrac{\sigma^2}{S_{xx}}$
结论$$\boxed{\text{Var}(\hat{\beta}\mid X)=\frac{\sigma^2}{S_{xx}}}, \qquad \text{se}(\hat{\beta})=\sqrt{\frac{\sigma^2}{S_{xx}}}$$但需要估计 $\sigma$

$\sigma^2$ 的无偏估计:$s^2 = RSS/(n-2)$

定义$RSS = \sum_{i=1}^n\hat{\varepsilon}_i^2, \quad s^2=\dfrac{RSS}{n-2}$  (误差方差的无偏估计,自由度 $n-2$)
结论$$\widehat{\text{se}}(\hat{\beta}) = \sqrt{\frac{s^2}{S_{xx}}} = \sqrt{\frac{RSS/(n-2)}{S_{xx}}} = \sqrt{\frac{\sum\hat{\varepsilon}_i^2}{(n-2)\sum(x_i-\bar{x})^2}}$$

误差分解:TSS = ESS + RSS

定义$TSS=\sum(y_i-\bar{y})^2=S_{yy}, \quad RSS=\sum(y_i-\hat{y}_i)^2=\sum\hat{\varepsilon}_i^2, \quad ESS=\sum(\hat{y}_i-\bar{y})^2$
证明$y_i-\bar{y} = (y_i-\hat{y}_i)+(\hat{y}_i-\bar{y}) = \hat{\varepsilon}_i + (\hat{y}_i-\bar{y})$
$\sum(y_i-\bar{y})^2 = \sum\hat{\varepsilon}_i^2 + \sum(\hat{y}_i-\bar{y})^2 + 2\sum\hat{\varepsilon}_i(\hat{y}_i-\bar{y})$
关键$\sum\hat{\varepsilon}_i(\hat{y}_i-\bar{y}) = \sum\hat{\varepsilon}_i\cdot\hat{\beta}(x_i-\bar{x}) = \hat{\beta}\sum x_i\hat{\varepsilon}_i - \hat{\beta}\bar{x}\sum\hat{\varepsilon}_i = 0$
(利用性质①②:$\sum\hat{\varepsilon}_i=0$,$\sum x_i\hat{\varepsilon}_i=0$)
结论$$TSS = RSS + ESS$$
直觉:OLS是投影,$\hat{\varepsilon}_i\perp x_i$,$\hat{\varepsilon}_i\perp$常数项 → $\hat{\varepsilon}_i\perp$X的线性空间,而$\hat{y}_i-\bar{y}$是X的线性函数,故正交。
注意:若 no intercept,则 $\sum\hat{\varepsilon}_i=0$ 不一定成立,此分解不一定成立。

$R^2$ 与样本相关系数

定义$R^2 = \dfrac{ESS}{TSS} = 1 - \dfrac{RSS}{TSS}$   y的样本波动有多大比例被模型解释了
样本相关$r = \dfrac{\widehat{\text{Cov}}(x,y)}{\hat{\sigma}_x\hat{\sigma}_y} = \dfrac{\frac{1}{n}\sum(x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\frac{1}{n}\sum(x_i-\bar{x})^2}\cdot\sqrt{\frac{1}{n}\sum(y_i-\bar{y})^2}} = \dfrac{S_{xy}}{\sqrt{S_{xx}S_{yy}}}$
推导$\hat{y}_i-\bar{y} = \hat{\beta}(x_i-\bar{x})$  (利用 $\hat{\alpha}=\bar{y}-\hat{\beta}\bar{x}$)
$ESS=\sum(\hat{y}_i-\bar{y})^2=\hat{\beta}^2 S_{xx} = \dfrac{S_{xy}^2}{S_{xx}}$
$R^2 = \dfrac{ESS}{TSS} = \dfrac{S_{xy}^2/S_{xx}}{S_{yy}} = \dfrac{S_{xy}^2}{S_{xx}S_{yy}} = r^2$
结论$$\boxed{R^2 = r^2}$$
系数形式$\hat{\beta} = \dfrac{S_{xy}}{S_{xx}} = \dfrac{S_{xy}}{\sqrt{S_{xx}S_{yy}}}\cdot\dfrac{\sqrt{S_{yy}}}{\sqrt{S_{xx}}} = r\cdot\dfrac{S_y}{S_x}$
$S_y,\,S_x$ 分别为样本标准差,故 $\hat{\beta} = r\cdot S_y/S_x$

t 统计量的显式推导

t统计$t = \dfrac{\hat{\beta}-\beta_0}{\widehat{\text{se}}(\hat{\beta})}, \quad$ 令 $\beta_0=0$:$\quad t=\dfrac{\hat{\beta}}{\widehat{\text{se}}(\hat{\beta})}\sim t_{n-2}$
代入$\hat{\beta}=r\sqrt{S_{yy}/S_{xx}}, \quad \widehat{\text{se}}(\hat{\beta})=\sqrt{\dfrac{(1-r^2)S_{yy}}{(n-2)S_{xx}}}$
(由 $RSS = TSS-ESS = S_{yy} - r^2 S_{yy} = (1-r^2)S_{yy}$,$s^2=RSS/(n-2)$)
$t = r\sqrt{\dfrac{S_{yy}}{S_{xx}}}\cdot\sqrt{\dfrac{(n-2)S_{xx}}{(1-r^2)S_{yy}}} = r\sqrt{\dfrac{n-2}{1-r^2}}$
结论$$\boxed{t = r\sqrt{\frac{n-2}{1-r^2}}}, \qquad t^2 = \frac{r^2(n-2)}{1-r^2} = \frac{R^2(n-2)}{1-R^2}$$
反推$$R^2 = \frac{t^2}{t^2+n-2}$$

Adjusted $R^2$ 与 F 统计量

Adj R²$\bar{R}^2 = 1 - \dfrac{RSS/(n-2)}{TSS/(n-1)}$,自变量个数1,总参数个数2
F统计量$F = t^2$  (简单回归中 F 检验等价于 t 检验的平方)
一般F$F = \dfrac{R^2/k}{(1-R^2)/(n-k-1)} \sim F(k,\,n-k-1)$   ($k$=自变量个数)
25

简单线性回归——无截距项完整推导

模型与 OLS 估计

模型$y_i = \beta x_i + \varepsilon_i$
目标$\min_{\beta}\; Q(\beta)=\sum_{i=1}^n(y_i-\beta x_i)^2$
FOC$\dfrac{\partial Q}{\partial \beta}=-2\sum x_i(y_i-\beta x_i)=0 \;\Rightarrow\; \sum x_i y_i - \beta\sum x_i^2=0$
结论$$\hat{\beta}=\frac{\sum x_i y_i}{\sum x_i^2} \quad \text{(无中心化!)}$$

$\hat{\beta}$ 的无偏性与方差

展开$\hat{\beta}=\dfrac{\sum x_i y_i}{\sum x_i^2}=\dfrac{\sum x_i(\beta x_i+\varepsilon_i)}{\sum x_i^2}=\beta+\dfrac{\sum x_i\varepsilon_i}{\sum x_i^2}$
无偏性$E[\hat{\beta}\mid X]=\beta+\dfrac{\sum x_i\,E[\varepsilon_i\mid X]}{\sum x_i^2}=\beta$ ✓  (用到 $E[x_i\varepsilon_i\mid X]=0$)
方差$\text{Var}(\hat{\beta}\mid X)=\text{Var}\!\left(\dfrac{\sum x_i\varepsilon_i}{\sum x_i^2}\bigg|X\right)=\dfrac{1}{(\sum x_i^2)^2}\cdot\sum x_i^2\cdot\sigma^2=\dfrac{\sigma^2}{\sum x_i^2}$
结论$$\text{Var}(\hat{\beta}\mid X)=\frac{\sigma^2}{\sum x_i^2}, \qquad \text{se}(\hat{\beta})=\frac{\sigma}{\sqrt{\sum x_i^2}}$$
估计$\hat{\varepsilon}_i=y_i-\hat{\beta}x_i,\quad s^2=\dfrac{RSS}{n-1}$(无偏,仅损失1个自由度)
$$\widehat{\text{se}}(\hat{\beta})=\sqrt{\frac{s^2}{\sum x_i^2}}=\sqrt{\frac{RSS}{(n-1)\sum x_i^2}}$$

无截距时的残差性质

仍成立$\sum x_i\hat{\varepsilon}_i = 0$  (由 $\beta$ 一阶条件)
不再成立$\sum\hat{\varepsilon}_i \neq 0$  (一般情形)
R² 需修改原 $R^2 = 1-\dfrac{RSS}{TSS}=1-\dfrac{RSS}{\sum(y_i-\bar{y})^2}$ 不适用(分解不成立)
Uncentered$$\bar{R}^2_0 = 1-\frac{\sum(y_i-\hat{y}_i)^2}{\sum y_i^2}$$ 不再考虑均值影响,在和原点比较
26

有截距 vs 无截距——完整对比

笔记 Page 5 的完整比较表,所有公式用 KaTeX 渲染。

性质
有截距   $y_i=\alpha+\beta x_i+\varepsilon_i$
无截距   $y_i=\beta x_i+\varepsilon_i$
$\hat{\beta}$
$\hat{\beta}=\dfrac{S_{xy}}{S_{xx}}=\dfrac{\sum(x_i-\bar{x})(y_i-\bar{y})}{\sum(x_i-\bar{x})^2}$
$\hat{\beta}=\dfrac{\sum x_i y_i}{\sum x_i^2}$   无中心化
$\hat{\alpha}$
$\hat{\alpha}=\bar{y}-\hat{\beta}\bar{x}$
$\hat{\alpha}=0$(强制)
$\text{Var}(\hat{\beta}\mid X)$
$\dfrac{\sigma^2}{\sum(x_i-\bar{x})^2}=\dfrac{\sigma^2}{S_{xx}}$
$\dfrac{\sigma^2}{\sum x_i^2}$
$s^2$($\sigma^2$估计)
$s^2=\dfrac{RSS}{n-2}$   自由度 $n-2$
$s^2=\dfrac{RSS}{n-1}$   自由度 $n-1$
t 分布
$t\sim t_{n-2}$
$t\sim t_{n-1}$
$\sum\hat{\varepsilon}_i$
$\sum\hat{\varepsilon}_i=0$   (保证)
$\sum\hat{\varepsilon}_i\neq 0$   一般情形
$\sum x_i\hat{\varepsilon}_i$
$\sum x_i\hat{\varepsilon}_i=0$   (保证)
$\sum x_i\hat{\varepsilon}_i=0$   (保证)
$R^2$
$R^2=1-\dfrac{RSS}{TSS}=r_{xy}^2$   $\in[0,1]$
$\bar{R}^2_0=1-\dfrac{\sum(y_i-\hat{y}_i)^2}{\sum y_i^2}$   无中心化版本
TSS = ESS+RSS
成立  ($\sum\hat{\varepsilon}_i=0$ 保证正交)
不一定成立  ($\sum\hat{\varepsilon}_i\neq 0$)
$\hat{\beta}$ 与 $r$
$\hat{\beta}=r\cdot\dfrac{S_y}{S_x}$
无此关系(无中心化)
$t$ 与 $R^2$
$t=r\sqrt{\dfrac{n-2}{1-r^2}},\quad R^2=\dfrac{t^2}{t^2+n-2}$
使用无中心化 $\bar{R}^2_0$,关系不同
虚假精度陷阱:无截距时 $\sum x_i^2 \gg S_{xx}=\sum(x_i-\bar{x})^2$(当 $\bar{x}$ 很大时),导致 $\text{se}(\hat{\beta})$ 虚假地更小、t统计量虚假地更大。若真实模型有截距,强行去掉截距会产生偏差(OVB),更小的se反而更危险。
Example — 带截距 se(β̂) 的矩阵推导验证

从 $(X^\top X)^{-1}$ 推导 se(β̂₁) 和 se(α̂)

设计矩阵$X=\begin{bmatrix}1&x_1\\\vdots&\vdots\\1&x_n\end{bmatrix},\quad X^\top X=\begin{bmatrix}n&\sum x_i\\\sum x_i&\sum x_i^2\end{bmatrix}$
逆矩阵$(X^\top X)^{-1}=\dfrac{1}{nS_{xx}}\begin{bmatrix}\sum x_i^2&-\sum x_i\\-\sum x_i&n\end{bmatrix}$
分母 $= n\sum x_i^2-(\sum x_i)^2 = n\sum x_i^2-n^2\bar{x}^2 = n\cdot S_{xx}$
$\beta$ 对角元$[(X^\top X)^{-1}]_{22}=\dfrac{n}{nS_{xx}}=\dfrac{1}{S_{xx}}$   $\Rightarrow$   $\text{Var}(\hat{\beta})=\dfrac{\sigma^2}{S_{xx}}$ ✓
$\alpha$ 对角元$[(X^\top X)^{-1}]_{11}=\dfrac{\sum x_i^2}{nS_{xx}}=\dfrac{1}{n}+\dfrac{\bar{x}^2}{S_{xx}}$   $\Rightarrow$   $\text{Var}(\hat{\alpha})=\sigma^2\!\left(\dfrac{1}{n}+\dfrac{\bar{x}^2}{S_{xx}}\right)$
两个方差的矩阵推导与标量推导完全一致,这验证了 $\text{Var}(\hat{\beta})=\sigma^2(X^\top X)^{-1}$ 的一般公式在简单回归中的具体形式。
27

面经题:Y~X,iid normal,E[R²] = ?四种推导

X 和 Y 完全独立(iid 正态),理论上真实 $R^2=0$,但有限样本中存在随机拟合,样本 $R^2 > 0$。四种方法推导其期望值。

核心考点:这道题考察的是 $R^2$ 的样本偏差——即使无关变量也会虚增 $R^2$。这正是需要 Adjusted $R^2$、OOS $R^2$、AIC/BIC 等指标的根本原因。

方法一:F分布路径(最严格)

一元情形($Y \sim X$,单特征)。在 $H_0: \beta=0$ 下,t 统计量服从 $t(n-2)$,而 $R^2$ 与 $t^2$ 精确关联:

t-stat 与 R²$T = \dfrac{\hat\beta}{\text{se}(\hat\beta)} = \dfrac{R\sqrt{n-2}}{\sqrt{1-R^2}} \sim t(n-2)$,解得 $R^2 = \dfrac{T^2}{T^2 + n-2}$
分布转换$T^2 \sim F(1,\, n-2)$,令 $W = T^2$,则 $R^2 = \dfrac{W}{W + (n-2)}$
Beta 分布若 $W \sim F(d_1, d_2)$,则 $\dfrac{d_1 W}{d_1 W + d_2} \sim \text{Beta}\!\left(\dfrac{d_1}{2}, \dfrac{d_2}{2}\right)$
代入 $d_1=1,d_2=n-2$$R^2 = \dfrac{W}{W+(n-2)} \sim \text{Beta}\!\left(\dfrac{1}{2},\, \dfrac{n-2}{2}\right)$
期望公式$E[R^2] = \dfrac{a}{a+b} = \dfrac{1/2}{1/2 + (n-2)/2} = \dfrac{1}{n-1}$
一元结论:$E[R^2] = \dfrac{1}{n-1} \approx \dfrac{1}{n}$(大样本时两者几乎相同)。

方法一推广:k 个特征

多元情形($Y \sim X_1 + \cdots + X_k$,所有 $\beta = 0$)。F 统计量服从 $F(k, n-k-1)$:

F-stat$F = \dfrac{R^2/k}{(1-R^2)/(n-k-1)} \sim F(k,\, n-k-1)$
Beta 分布$R^2 \sim \text{Beta}\!\left(\dfrac{k}{2},\, \dfrac{n-k-1}{2}\right)$
多元结论$E[R^2] = \dfrac{k/2}{k/2 + (n-k-1)/2} = \dfrac{k}{n-1}$

方法二:自由度直觉法(最快)

OLS 把 $n$ 个数据点拟合一条有 $k+1$ 个参数(含截距)的直线/超平面,消耗了 $k+1$ 个自由度。即使 $y$ 与所有 $x$ 完全无关,仅凭随机性也能"解释"这 $k+1$ 个方向的方差。

自由度论证$k$ 个特征在 $n-1$ 个"有效"自由度(去掉均值后)中恰好占 $k$ 个,因此期望被解释比例 $= k/(n-1)$
更简洁近似当 $n$ 大时 $n-1 \approx n$,所以 $E[R^2] \approx k/n$(面试口答版本)
直觉:每个额外的特征(即使无关)平均"偷走"约 $1/n$ 的方差解释量。$k$ 个特征共偷走约 $k/n$。这也是 Adjusted $R^2$ 惩罚 $k$ 的直接动机。

方法三:Adjusted R² 逆推(面试答题路径)

Adjusted $R^2$ 的定义正好修正了这个偏差:

定义$\bar R^2 = 1 - \dfrac{RSS/(n-k-1)}{TSS/(n-1)} = 1 - \dfrac{n-1}{n-k-1}(1-R^2)$
零模型下当真实 $\beta = 0$ 时:$E\!\left[\dfrac{RSS}{n-k-1}\right] = \sigma^2 = E\!\left[\dfrac{TSS}{n-1}\right]$(均无偏估计 $\sigma^2$)
推出$E[\bar R^2] = 0$(Adjusted $R^2$ 在零模型下期望为 0,无偏)
反推$E[\bar R^2]=0 \;\Rightarrow\; 1-\dfrac{n-1}{n-k-1}(1-E[R^2])=0 \;\Rightarrow\; E[R^2] = \dfrac{k}{n-1}$
这条路径在面试中最优雅:先说"Adjusted $R^2$ 恰好修正了这个偏差(期望为 0)",再反推出 $E[R^2] = k/(n-1)$,展示了你对两个量之间关系的深刻理解。

方法四:几何路径(最有直觉)

在正态假设下,经过中心化后,$\hat y$(拟合值向量)是 $y$ 向 $k$ 维特征空间的投影。

$R^2$ 的几何定义$R^2 = \cos^2\theta$,其中 $\theta$ 是 $\tilde y = y - \bar y$ 与其投影 $\hat{\tilde y}$ 之间的夹角
独立时$y$ 是均匀分布在 $n-1$ 维球面上的方向(已中心化,去掉截距方向),特征空间占 $k$ 维
投影期望随机向量投影到 $k$ 维子空间的期望平方比例 $= k/(n-1)$(均匀分布性质)
几何结论$E[R^2] = E[\cos^2\theta] = \dfrac{k}{n-1}$
几何直觉:把 $y$ 想象成 $n-1$ 维空间里的随机方向(箭头),特征空间是 $k$ 维子空间。$R^2$ 就是这个随机箭头在子空间上投影的平方比例。均匀随机时,期望投影比例 $= k/(n-1)$,与子空间维度成正比。

四种方法汇总对比

方法一(严格)$T^2 \sim F(1,n-2) \Rightarrow R^2 \sim \text{Beta}(1/2,(n-2)/2) \Rightarrow E[R^2] = 1/(n-1)$;多元推广:$k/(n-1)$
方法二(直觉)$k$ 个无关特征"偷走" $k/(n-1)$ 比例的方差;大样本近似 $\approx k/n$
方法三(逆推)Adj $R^2$ 在零模型下期望 $=0$,反推 $E[R^2]=k/(n-1)$
方法四(几何)随机方向投影到 $k$ 维子空间的期望平方比例 $= k/(n-1)$
面试口答$E[R^2] \approx k/n$(一元:$1/n$);精确版:$k/(n-1)$
实际含义与 Adjusted R²: $$\bar R^2 = 1 - \frac{n-1}{n-k-1}(1-R^2) = R^2 - \frac{k(1-R^2)}{n-k-1}$$ Adjusted $R^2$ 恰好减去了这个偏差(近似),使得在零模型下 $E[\bar R^2]=0$。加入无关变量时 $R^2$ 一定不降,但 $\bar R^2$ 可能降低——这是做模型选择应用 $\bar R^2$ 而非 $R^2$ 的根本原因。
数值验证

n=100,k=5 的无关特征,E[R²] ≈ ?

精确值$E[R^2] = 5/(100-1) \approx 5.05\%$
近似值$E[R^2] \approx 5/100 = 5\%$
解读5个完全无关的特征,仅凭随机噪声就能"解释"约5%的y方差——用样本内$R^2$选模型是危险的
28

面经题:回归斜率——有/无截距时公式的区别

面经题9问 $Y \sim X$ 和 $X \sim Y$ 的斜率之积,公式用的是 $\hat\beta = \operatorname{Cov}/\operatorname{Var}$。这只在有截距时成立。

有截距:$y = \alpha + \beta x + \varepsilon$

最小化 $\sum(y_i - \alpha - \beta x_i)^2$,对 $\alpha$ 和 $\beta$ 分别求偏导:

$\partial/\partial\alpha = 0$$\sum(y_i - \alpha - \beta x_i) = 0 \;\Rightarrow\; \bar y = \alpha + \beta \bar x$(回归线过均值点)
$\partial/\partial\beta = 0$$\sum x_i(y_i - \alpha - \beta x_i) = 0$
联立解将 $\alpha = \bar y - \beta\bar x$ 代入第二方程:$\sum x_i(y_i - \bar y - \beta(x_i - \bar x)) = 0$
$\sum (x_i - \bar x)(y_i - \bar y) - \beta\sum(x_i-\bar x)^2 = 0$(利用 $\sum x_i(y_i-\bar y) = \sum(x_i-\bar x)(y_i-\bar y)$)
有截距公式$\hat\beta_{\text{with}} = \dfrac{\sum(x_i-\bar x)(y_i - \bar y)}{\sum(x_i-\bar x)^2} = \dfrac{S_{xy}}{S_{xx}} = \dfrac{\operatorname{Cov}(X,Y)}{\operatorname{Var}(X)}$

无截距:$y = \beta x + \varepsilon$(强制过原点)

最小化 $\sum(y_i - \beta x_i)^2$,只对 $\beta$ 求偏导:

$\partial/\partial\beta = 0$$-2\sum x_i(y_i - \beta x_i) = 0 \;\Rightarrow\; \sum x_i y_i = \beta \sum x_i^2$
无截距公式$\hat\beta_{\text{no}} = \dfrac{\sum x_i y_i}{\sum x_i^2} = \dfrac{E[XY]}{E[X^2]}$(样本均值版本)

关键区别:何时两者相等?

有截距分子$S_{xy} = \sum(x_i-\bar x)(y_i-\bar y) = \sum x_i y_i - n\bar x\bar y$
无截距分子$\sum x_i y_i = S_{xy} + n\bar x\bar y$(多出 $n\bar x\bar y$ 项)
有截距分母$S_{xx} = \sum(x_i-\bar x)^2 = \sum x_i^2 - n\bar x^2$
无截距分母$\sum x_i^2 = S_{xx} + n\bar x^2$(多出 $n\bar x^2$ 项)
相等条件当且仅当 $\bar x = 0$ 且 $\bar y = 0$ 时:$\hat\beta_{\text{no}} = \hat\beta_{\text{with}}$
结论:只有在 $\mathbb{E}[X] = \mathbb{E}[Y] = 0$ 的特殊情形下,有截距和无截距的斜率公式才一致。这也是为什么在均值为零的正态分布假设(如面经题9)下可以直接用 $\operatorname{Cov}/\operatorname{Var}$ ——数学上,当 $\bar x = \bar y = 0$ 时,无截距回归的 $\hat\beta = E[XY]/E[X^2] = \operatorname{Cov}(X,Y)/\operatorname{Var}(X)$,两式等价。

双向回归斜率之积:有截距 vs 无截距

有截距 $\times$$\hat\beta_1^{\text{with}} \cdot \hat\beta_2^{\text{with}} = \dfrac{\operatorname{Cov}(X,Y)}{\operatorname{Var}(X)} \cdot \dfrac{\operatorname{Cov}(X,Y)}{\operatorname{Var}(Y)} = \rho^2 \in [0,1]$
无截距 $\times$$\hat\beta_1^{\text{no}} \cdot \hat\beta_2^{\text{no}} = \dfrac{\sum x_i y_i}{\sum x_i^2} \cdot \dfrac{\sum x_i y_i}{\sum y_i^2} = \dfrac{(\sum x_i y_i)^2}{\sum x_i^2 \cdot \sum y_i^2}$
Cauchy-Schwarz由 Cauchy-Schwarz 不等式:$(\sum x_i y_i)^2 \leq \sum x_i^2 \cdot \sum y_i^2$,所以乘积 $\in [0,1]$
无截距结论乘积同样 $\in [0,1]$,等于"未中心化相关系数"的平方,但不等于 $R^2_{\text{with}}$

完整对比表

项目有截距无截距
模型$y = \alpha + \beta x + \varepsilon$$y = \beta x + \varepsilon$
$\hat\beta$ 公式$S_{xy}/S_{xx} = \operatorname{Cov}/\operatorname{Var}$$\sum x_iy_i / \sum x_i^2 = E[XY]/E[X^2]$
相等条件$\bar x = \bar y = 0$(均值为零)
$\beta_1\times\beta_2$$\rho^2 = R^2_{\text{with}} \in [0,1]$$(未中心化相关)^2 \in [0,1]$
$\hat\alpha$$\hat\alpha = \bar y - \hat\beta\bar x$不存在(强制 $\alpha=0$)
$R^2$ 定义$1 - RSS/TSS$,$TSS = \sum(y_i-\bar y)^2$$1 - \sum(y_i-\hat y_i)^2/\sum y_i^2$(无中心化!)
无截距的 $R^2$ 可以为负!无截距模型用的是未中心化的 TSS($\sum y_i^2$),若强行套用有截距的公式会得到错误结论。Python 的 sklearn 默认用中心化 TSS 计算 $R^2$,导致无截距时可能报出负值,就是这个原因。
面经题 9 的完整解答(有截距,均值可非零)

$Y \sim X$ 得 $\theta_1$,$X \sim Y$ 得 $\theta_2$,$\theta_1 \times \theta_2$ 的范围

正向回归$\theta_1 = \dfrac{\operatorname{Cov}(X,Y)}{\operatorname{Var}(X)} = \rho\dfrac{\sigma_Y}{\sigma_X}$
反向回归$\theta_2 = \dfrac{\operatorname{Cov}(X,Y)}{\operatorname{Var}(Y)} = \rho\dfrac{\sigma_X}{\sigma_Y}$
乘积$\theta_1 \times \theta_2 = \rho^2 \in [0,1]$,等于两次回归共同的 $R^2$
几何意义两条回归线夹角满足:两斜率的几何均值 $= \sqrt{\theta_1\theta_2} = |\rho|$(相关系数的绝对值)
为什么有截距时用 Cov/Var?有截距 OLS 的残差正交条件为 $\sum x_i e_i = 0$(等价于 $\sum(x_i-\bar x)e_i = 0$),这自然导出中心化版本的公式 $\hat\beta = S_{xy}/S_{xx} = \operatorname{Cov}(X,Y)/\operatorname{Var}(X)$,无论 $\bar x$ 是否为零都成立。

无截距时:残差正交条件为 $\sum x_i e_i = 0$(未中心化),导出 $\hat\beta = \sum x_iy_i/\sum x_i^2$,只有 $\bar x = 0$ 时才退化为 $\operatorname{Cov}/\operatorname{Var}$。
// Active nav highlight on scroll const sections = document.querySelectorAll('.section'); const navLinks = document.querySelectorAll('.sidebar a'); const observer = new IntersectionObserver((entries) => { entries.forEach(e => { if(e.isIntersecting) { navLinks.forEach(l => l.classList.remove('active')); const link = document.querySelector(`.sidebar a[href="#${e.target.id}"]`); if(link) link.classList.add('active'); } }); }, { threshold: 0.3 }); sections.forEach(s => observer.observe(s));