Linear Regression
完整笔记 & 参考手册
涵盖全部OLS假设、违反后果、诊断检验、推导过程、例题与解法——从BLUE到正则化。
六大经典假设
线性回归模型 y = Xβ + ε 成立依赖六个核心假设(CLM假设)。违反任意一个都有可预测的后果,且对应不同的修复方案。
模型在参数β上是线性的:y = Xβ + ε。
注意:变量可以非线性(log x, x²),只要参数是线性的即可。
违反:残差有系统性非线性模式,估计不可靠。
修复:对变量做变换(取log, 开方),加交叉项 x₁x₂,使用非线性模型。
观测值独立同分布,无自相关:Cov(εᵢ, εⱼ) = 0(i ≠ j)。
也称为"No Autocorrelation"假设。
违反:标准误有偏,F检验失效,OLS仍无偏但非BLUE。
修复:ARIMA,Newey-West稳健标准误,GLS。
无常数变量,X无精确线性关系,X满列秩(full rank),(XᵀX)可逆。
违反:(XᵀX)不可逆,β̂无法计算(完全共线性);或标准误膨胀(近似共线性)。
修复:Ridge回归,删除变量,PCA降维。
E[ε | X] = 0,即对任意可测函数g(X),E[g(X)·ε] = 0(正交条件)。
严格外生性:E[εᵢ | X₁,…,Xₙ] = 0
弱外生性:E[εᵢ | Xᵢ] = 0
违反(内生性):β̂有偏且不一致,标准误错误。
修复:IV/2SLS,加回省略变量。
Var(εᵢ | X) = σ²(常数,与i无关)。
结合A2,有 Var(ε) = σ²I。
这是Gauss-Markov定理要求OLS为BLUE的关键条件之一。
违反(异方差):OLS仍无偏,但标准误有偏,不是BLUE。
修复:稳健标准误(HC),WLS,变量变换。
ε ~ N(0, σ²I)(正态分布)。
在A1-A5下,OLS已是BLUE。A6额外保证有限样本下t检验和F检验严格成立。
大样本下由CLT可近似正态,A6可以不要求。
违反:小样本推断失效;大样本影响较小。
Gauss-Markov 定理 & BLUE
在假设 A1–A5(线性、随机抽样、无完全多重共线性、E[ε|X]=0、同方差)下,OLS 估计量是 最优线性无偏估计量(BLUE:Best Linear Unbiased Estimator)。
即:在所有线性无偏估计量中,OLS 的方差最小。
BLUE 的三个要求
在同类估计量中方差最小,即最有效率(efficient)。
估计量是观测值y的线性函数:β̂ = Cy,其中C是某个矩阵。
E[β̂] = β,期望值等于真实参数。
OLS 估计量的方差
OLS 的性质总结
| 违反假设 | 无偏? | 一致? | BLUE? | 标准误? |
|---|---|---|---|---|
| 全部满足 A1-A5 | ✓ 无偏 | ✓ 一致 | ✓ BLUE | ✓ 正确 |
| 仅违反同方差(A5) | ✓ 无偏 | ✓ 一致 | ✗ 非BLUE | ✗ 有偏 |
| 仅违反独立性(A2) | ✓ 无偏 | ✓ 一致 | ✗ 非BLUE | ✗ 有偏 |
| 违反外生性(A4) | ✗ 有偏 | ✗ 不一致 | ✗ 非BLUE | ✗ 错误 |
证明 OLS 是线性无偏估计量
设 β̂ = (XᵀX)⁻¹Xᵀy,代入 y = Xβ + ε:
计算 OLS 的方差-协方差矩阵
违反假设总览
| 违反假设 | 结果(对OLS的影响) | 检验方法 | 解决方案 |
|---|---|---|---|
| A1 线性性 | 残差有系统非线性模式,估计不可靠 | 残差图(vs fitted values) | 变换变量(log、平方根),加交叉项,使用非线性模型 |
| A2 无自相关 | 标准误有偏,t/F检验失效;OLS仍无偏但非BLUE | 残差时序图,ACF图,DW检验,BG检验 | Newey-West稳健SE,ARIMA,GLS/FGLS,加滞后项 |
| A3 无多重共线性 | 标准误膨胀,t检验失效(TypeII错误),系数符号可能错误 | 相关矩阵,VIF(>10或>5) | Ridge回归,删除变量,PCA,增加样本量 |
| A4 外生性 | OLS有偏且不一致,标准误错误。增大样本无法改善 | 理论判断(经济逻辑),Hausman检验,过度识别检验 | 加回省略变量,工具变量(IV/2SLS),代理变量 |
| A5 同方差 | OLS无偏但非BLUE,标准误有偏,假设检验失效 | 残差vs拟合值图,BP检验,White检验 | 稳健标准误(HC0-HC3),WLS,对因变量取log |
| A6 正态性 | 有限样本t/F检验不严格有效;大样本下CLT渐近正态 | 残差Q-Q图,Jarque-Bera检验,Shapiro-Wilk检验 | Bootstrap,Box-Cox变换,大样本依赖CLT |
Autocorrelation(自相关)
自相关指误差项之间存在相关性:Cov(εᵢ, εⱼ) ≠ 0(i ≠ j)。在时间序列中极为常见。
笔记原文:"std. error biased, F test not working. Still unbiased, not efficient."
保证 Var(β̂) 的基础
AR(1) 过程(最常见)
检测方法
Plot Residuals over Time
将残差 ε̂ₜ 对时间 t 作图。若存在明显的周期性模式或趋势,说明存在自相关。
Autocorrelation Function Plot
ACF(k) = Corr(ε̂ₜ, ε̂ₜ₋ₖ),绘制不同lag k下的自相关系数。若某个lag的竖线超出蓝色置信带(±1.96/√n),说明在该lag显著自相关。
MA(1)特征: ACF在lag=1截尾,PACF指数衰减。
DW检验(检验AR(1)自相关)
假设: H₀: ρ = 0(无自相关)vs. H₁: ρ ≠ 0
| DW值 | 含义 |
|---|---|
| DW ≈ 2 | 无自相关(ρ ≈ 0) |
| DW < 1.5 | 高正自相关(ρ > 0),εₜ与εₜ₋₁同向 |
| DW > 2.5 | 高负自相关(ρ < 0),εₜ与εₜ₋₁反向 |
| 0 ≤ DW ≤ 4 | 完整范围(DW=0 → ρ=1,DW=4 → ρ=-1) |
Box-Ljung检验(联合检验多个lag)
假设: H₀: ρ₁ = ρ₂ = … = ρₖ = 0(前K个lag均无自相关)
BG检验(可检验高阶AR自相关,最推荐)
步骤:
- 第一步:OLS估计原模型,获得残差 ε̂ₜ
- 第二步:辅助回归
将 ε̂ₜ 对原来所有 X 和滞后残差回归:
$\hat{\varepsilon}_t = \alpha_0 + X'\alpha + \rho_1\hat{\varepsilon}_{t-1}+\rho_2\hat{\varepsilon}_{t-2}+\cdots+\rho_p\hat{\varepsilon}_{t-p}+u_t$ - 第三步:构造统计量
$LM=(n-p)\cdot R^2\sim\chi^2(p)$($H_0:\rho_1=\cdots=\rho_p=0$下) - 结论: 若 LM > χ²_α(p),拒绝H₀,存在p阶自相关。
解决方案
方案1:Generalized Least Squares(GLS)
当 Var(ε) = σ²V(V为已知n×n正定矩阵),用Cholesky分解 V = KKᵀ 变换模型:
在 Var(ε) = σ²V(V已知)下,GLS估计量 β̂_GLS 是 BLUE。它的方差为:
方案2:FGLS(Feasible GLS)
实践中V通常未知。FGLS步骤:
- OLS估计,获得残差
- 用残差估计V的结构(例如,估计AR(1)中的ρ:ρ̂ = Σε̂ₜε̂ₜ₋₁/Σε̂²ₜ₋₁)
- 用V̂代替V,做GLS
方案3:Newey-West 稳健标准误(HAC)
Multicollinearity(多重共线性)
当自变量之间存在近似(非完全)线性关系时,OLS依然无偏,但标准误膨胀。
① 标准误膨胀 → t检验倾向于接受H₀(Type II Error,漏判)
② 系数估计不稳定,可能出现错误符号
③ 系数的经济学解释困难
注意:OLS仍然无偏且一致,只是效率损失。
检测:VIF(Variance Inflation Factor)
方差膨胀因子
步骤:
- 计算相关矩阵,初步判断自变量间相关性
- 对每个自变量 Xₖ,做辅助回归:
$X_k = \beta_0+\beta_1 X_1+\cdots+\beta_{k-1}X_{k-1}+\beta_{k+1}X_{k+1}+\cdots+\beta_p X_p+u$从中得到 R²ₖ(该回归的决定系数) - 计算VIF:
$VIF_k = 1/(1-R_k^2)$
| VIF值 | 解读 |
|---|---|
| VIF = 1 | 完全无共线性(Xₖ与其他X正交) |
| 1 < VIF < 5 | 轻微共线性,通常可接受 |
| 5 < VIF < 10 | 中度共线性,需要关注 |
| VIF > 10 | 严重共线性,需要处理 |
| VIF → ∞ | 完全共线性,(XᵀX)不可逆 |
条件数(Condition Number)
解决方案1:Ridge Regression(岭回归)
Ridge 回归的推导与性质
在OLS损失函数中加入L2惩罚项(λ||β||²),使 (XᵀX + λI) 在任何情况下都可逆:
XᵀX 是半正定矩阵(所有特征值 ≥ 0)。加上 λI 后,所有特征值变为 (λᵢ + λ) > 0(因为 λ > 0),因此 (XᵀX + λI) 是正定矩阵,必然可逆。✓
Ridge 的关键特性:
① 有偏估计(但方差更小):bias-variance tradeoff
② 将所有β均匀拉向0,但不会产生精确的0(无稀疏性)
③ 惩罚高的β,使高β降低(drag high β down to small β)
④ 截距项通常不惩罚
必须预处理: 在做Ridge前,对X和y做标准化(z-score standardization),使各变量的收缩量可比。
λ 的选择: 通过交叉验证(cross-validation)选取最优λ。笔记提示:可根据VIF的变化来选λ——选使VIF降到阈值以下的最小λ。
解决方案2:PCA(主成分分析)
判断是否存在多重共线性
模型:y = β₀ + β₁x₁ + β₂x₂ + β₃x₃ + ε。计算各 VIF:
Heteroskedasticity(异方差)
异方差指 Var(εᵢ | Xᵢ) = σ²ᵢ(随观测值变化,而非常数σ²)。
① OLS β̂ 仍然无偏(E[ε|X]=0仍满足)
② 但不是BLUE:有比OLS方差更小的线性无偏估计量(WLS)
③ 标准误有偏 → t/F检验无效
检测:Breusch-Pagan Test(BP检验)
BP检验步骤
- OLS估计原模型,获取残差 ε̂ᵢ
- 辅助回归: 将 ε̂²ᵢ 对所有自变量回归
$\hat{\varepsilon}_i^2=\alpha_0+\alpha_1 x_{1i}+\cdots+\alpha_k x_{ki}+v_i$ - 统计量: LM = n·R² ~ χ²(k) 在 H₀: 同方差 下
White检验(更一般化)
辅助回归中加入所有自变量的平方项和交叉乘积项:
WLS(Weighted Least Squares,加权最小二乘)
若已知 Var(εᵢ) = σ²hᵢ(如 hᵢ = xᵢ 或 hᵢ = x²ᵢ),用权重 wᵢ = 1/hᵢ 缩放:
WLS推导
目标:找一组权重 wᵢ,使加权残差的方差同质化。
GLS vs OLS+稳健标准误的比较
GLS / WLS(有先验知识)
- 需要知道误差方差结构 Var(εᵢ) = σ²hᵢ
- 更有效率(BLUE)
- 对方差结构的误设定更敏感
- 计算更复杂
- 适合:误差结构有经济理论支撑时
OLS + 稳健标准误(HC)
- 不需要误差结构的先验知识
- 更稳健(对误设定不敏感)
- 效率稍低但更实用
- 应用计量经济学的标准做法
- 适合:误差结构未知时(大多数场景)
工资回归中的异方差
设模型:wage = β₀ + β₁edu + β₂exp + ε。通常高教育高技能工人的工资方差更大。
Endogeneity(内生性)& Instrumental Variables
内生性:E[ε | X] ≠ 0,即 Cov(ε, X) ≠ 0。这使得OLS估计量有偏且不一致——即使样本量趋于无穷大,OLS也无法恢复真实参数。
这是OLS所有违反假设中最严重的情况——不能靠增大样本修复!
内生性的三大来源
省略变量偏差(OVB)的完整推导
假设真实模型为:yᵢ = β₁x₁ᵢ + β₂x₂ᵢ + εᵢ,但研究者误设为:yᵢ = α₁x₁ᵢ + uᵢ(省略了 x₂)。
| β₂(省略变量对y的影响) | Cov(x₁,x₂)(相关方向) | 偏差方向 |
|---|---|---|
| 正(+) | 正(+) | 正偏差(高估β₁) |
| 正(+) | 负(−) | 负偏差(低估β₁) |
| 负(−) | 正(+) | 负偏差(低估β₁) |
| 负(−) | 负(−) | 正偏差(高估β₁) |
| 任意 | 0(正交) | 无偏差! |
联立方程偏差
价格与需求同时决定:价格影响需求,需求也影响价格。无法用单一方程的OLS识别。
经典测量误差(Classical Errors-in-Variables)
真实模型:y = βX* + ε,但X*不可观测,观测到 X = X* + v(测量误差)。
解决方案:工具变量(Instrumental Variables)
① 相关性(Relevance): Cov(Z, X) ≠ 0,Z与内生变量X相关。
② 排他性(Exclusion Restriction): Cov(Z, ε) = 0,Z只通过X影响y(不直接影响y)。
IV估计量的一致性证明
模型:y = βx + ε,工具变量 Z。
2SLS(Two-Stage Least Squares)
2SLS 是最常用的IV方法,当有多个工具变量时(过度识别),比单纯IV更有效率。
X̂ = Z(ZᵀZ)⁻¹ZᵀX
= Pz·X
β̂_2SLS = (X̂ᵀX̂)⁻¹X̂ᵀy
Pz = Z(ZᵀZ)⁻¹Zᵀ
Cov(X̂, ε) = 0 ✓
教育回报率的IV估计(Card 1995)
问题:收入对教育年限回归,但"能力"(ability)是省略变量,导致内生性。
Hausman 检验(判断内生性是否存在)
OLS 系数完整推导
有截距的简单线性回归:y = α + βx + ε
目标:最小化 S = Σᵢ(yᵢ − α − βxᵢ)²
无截距回归:y = βx + ε
目标:最小化 S = Σᵢ(yᵢ − βxᵢ)²
多元回归 OLS 矩阵推导
β̂ 的抽样分布
MLE 推导 & MLE vs OLS
在正态误差假设 ε ~ N(0, σ²) 下,OLS 等价于 MLE。
最大似然估计推导(正态误差)
① MLE和OLS对β的估计完全相同(正态误差下)
② MLE的σ²估计是有偏的(分母n而非n-K),实践中用OLS的s²
两种方法的异同
| 性质 | OLS | MLE(正态误差) |
|---|---|---|
| β̂ 估计值 | 相同 | 相同 |
| β̂ 无偏性 | ✓ 无偏 | ✓ 无偏 |
| σ² 估计 | s² = SSR/(n−K)(无偏) | σ̂² = SSR/n(有偏) |
| 需要正态假设 | 不需要(BLUE性质不需要) | 需要 |
| 渐近性质 | 有效率(若正态) | 渐近有效率 |
最优权重推导(WLS基础)
笔记中对"加权平均估计量的最优权重"有详细推导。这是WLS直觉的核心。
无偏估计量中方差最小的最优权重
已知 X₁, …, Xₙ 互相独立,E[Xᵢ] = μ,Var(Xᵢ) = σ²ᵢ(各不相同)。
构造线性估计量 μ̂ = Σwᵢxᵢ,求使 Var(μ̂) 最小的权重 wᵢ,约束 Σwᵢ = 1(无偏性)。
Lagrangian 推导过程
Regularization(正则化)
正则化在OLS目标函数中加入惩罚项,防止过拟合,处理多重共线性,实现特征选择。做正则化前必须对X和y做标准化(z-score),使各特征的收缩量可比。截距项通常不惩罚。
三种正则化方法对比
| 方法 | 惩罚项 | 目标函数 | 特点 | 适用场景 |
|---|---|---|---|---|
| Ridge(L2) | λΣβ²ⱼ | ||y−Xβ||² + λ||β||² | 均匀收缩所有β,无稀疏性;解析解 | 所有特征都有用;多重共线性严重 |
| Lasso(L1) | λΣ|βⱼ| | ||y−Xβ||² + λΣ|βⱼ| | 产生稀疏解(精确为0);自动特征选择 | 真实稀疏模型;特征选择 |
| Elastic Net | λ₁Σ|βⱼ|+λ₂Σβ²ⱼ | ||y−Xβ||² + λ₁||β||₁ + λ₂||β||² | L1+L2结合;稀疏+分组效应 | 相关特征 + 需要稀疏解 |
Ridge 回归完整推导
Lasso 为何产生稀疏解?
多重共线性下的表现
设 X = [x₁, x₂],其中 x₂ = x₁ + small noise(高度相关):
λ 的选择
Cross-Validation(CV)
- k折CV:对每个λ计算平均CV误差
- 选择使CV误差最小的λ(或"one standard error rule")
- 最常用方法
VIF导向(笔记方法)
- 从小λ开始,计算Ridge估计后的各VIF
- 增大λ直到所有VIF降到阈值(5或10)以下
- 适合多重共线性的诊断场景
Quick Formula Reference
α̂ = ȳ − β̂x̄(简单回归)
β̂ = Cov(x,y)/Var(x)
Var(β̂_GLS) = σ²(XᵀV⁻¹X)⁻¹
W = diag(1/σ₁², …, 1/σₙ²)
wᵢ* = (1/σᵢ²)/Σ(1/σⱼ²)
2SLS: β̂ = (XᵀPzX)⁻¹XᵀPzy
Pz = Z(ZᵀZ)⁻¹Zᵀ
有偏;(XᵀX+λI)总可逆
阈值:>5 关注,>10 严重
≈ 2(1−ρ̂)
DW≈2:无自相关
= β₂·δ̂₂₁
t = (β̂ₖ−β₀)/se(β̂ₖ) ~ t(n−K)
s² = SSR/(n−K)(无偏)
测量误差 → 系数被低估
LM = (n−p)·R² ~ χ²(p)
ŷ=Hy, e=My, M=I−H
hᵢᵢ=leverage,tr(H)=k
(n−k)σ̂²/σ² ~ χ²(n−k)
k=p+1(含截距)
R² = t²/(t²+n−2)
(简单回归)
ŷᵢ ± t^(α/2)_(n−k)·σ̂·√hᵢᵢ
Var(y_new−ŷ) = σ²(1+hᵢᵢ)
有截距:0≤R²≤1
无截距:用R²₀=‖ŷ‖²/‖y‖²
正交设计:β̂ⱼ=sign(β̂ⱼ_OLS)·(|β̂ⱼ_OLS|−λ)₊
β̃ⱼ = [dⱼ/(dⱼ²+λ)]·(uⱼᵀy)
ŷ_λ = U·diag[dⱼ²/(dⱼ²+λ)]·Uᵀy
Var(β̃ⱼ) = σ²dⱼ²/(dⱼ²+λ)²
vs OLS: Var=σ²/dⱼ²
PCR wⱼ = 1[j≤k](二元)
OLS wⱼ = 1(全保留)
BIC = IS Dev + log(n)·df
BIC更节省参数(n>7时)
Linear Regression Complete Reference · Yuchen Yu · Princeton MFin · Oct 2025
矩阵形式完整推导
笔记Image 2完整展开了多元线性回归的矩阵推导,包括投影矩阵H、方差推导、σ²无偏估计,以及误差向量的分布。
矩阵表示
投影矩阵 H(Hat Matrix)
残差与拟合值正交(垂直)
β̂ 的期望与方差(完整推导)
期望:E[β̂] = β
方差:Var(β̂) 的推导(笔记Image 2黄色高亮部分)
σ² 的无偏估计(笔记Image 2底部完整推导)
E[RSS|X] = (n−k)σ² → σ̂² = RSS/(n−k)
β̂ 和 σ̂² 的抽样分布
t统计量、置信区间与预测区间
χ² 分布与 t 分布回顾
t 统计量(单个系数检验)
从简单回归推导 t 统计量
设简单线性回归 yᵢ = β₀ + β₁xᵢ + εᵢ,定义:
置信区间(Confidence Interval)
ŷ 的方差
置信区间 vs 预测区间(笔记Image 3绿色高亮)
置信区间(CI): 对条件均值 E[y|x] = xβ 的不确定性
预测区间(PI): 对新观测值 y_new 的不确定性(比CI宽!)
CI的方差 = σ²hᵢᵢ(只有参数不确定性)
PI的方差 = σ²(1+hᵢᵢ)(参数不确定性 + 新误差项)
PI永远比CI宽。当n→∞时,CI→零宽度,PI→仍有σ²的宽度。
TSS / ESS / RSS & R²
三个平方和的定义
TSS = Σ(ȳᵢ − yᵢ)² = ‖yd‖²
总体偏离均值的程度(分母)
yc = y − ȳ·1ₙ
ESS = Σ(ŷᵢ − ȳ)² = ‖ŷ − ȳ1‖²
模型能解释的部分
RSS = Σ(ŷᵢ − yᵢ)² = Σêᵢ² = ‖e‖²
模型无法解释的误差
TSS = ESS + RSS 的证明(笔记Image 4完整证明)
即"回归值偏离均值的部分"与"残差"互相垂直。
证明:ŷ − ȳ·1 ⊥ y − ŷ(笔记Image 4 Key Relationship of OLS)
R² — 决定系数
R² 的性质与注意事项(笔记Image 4)
- 模型解释力: R²是模型解释的方差比例(proportion of variance explained by the model)
- 分母理解: 分母= 仅回归β₀(截距模型)的RSS;分子= 实际模型的RSS
- 负R²: 当拟合模型比样本均值还差时,R² < 0(含截距时样本内不会发生)
- 含截距时: 0 ≤ R² ≤ 1(因为ESS, RSS ≥ 0,且TSS = ESS + RSS)
- 样本外: OOS R² 可以 < 0,说明模型不如用均值预测
- 多元回归: 添加任何变量都会增加(或不变)样本内R²,不可靠用于模型选择
含截距 vs 无截距的 R²(笔记Image 4-5)
有截距(With Intercept)
无截距(Without Intercept)
→ RSS 可能 > TSS(R² < 0)
→ ESS 可能 > TSS(R² > 1)
解决:用 Uncentered R²:
R²₀ = ESS₀/TSS₀ = ‖ŷ‖²/‖y‖²
R² 组间异质性可以极大改变总体 R²
题目: X, Y, Z 各组 size 1000,r² = 0.5,全部组合在一起,r² 的取值范围?
组间异质性(between-group heterogeneity)可以极大改变总体R²。
这说明R²高度依赖数据的聚合方式,单独看某个组的R²与合并后的R²可以完全不同——这是辛普森悖论(Simpson's Paradox)的一个体现。
t 统计量的几何解释
笔记Image 5给出了t统计量与R²之间的精确代数关系,揭示了t检验的几何本质。
核心关系式(笔记Image 5完整推导)
几何意义解读
t统计量的几何含义
- R²的函数: t只取决于R²和样本量n,与β的大小无关
- 夹角解释: 将数据中心化后,y和X可看作n维空间的向量。corr r = cos(θ),θ是两向量夹角
- t大时: R²接近1,即y与ŷ几乎平行(夹角趋于0)
- t=0时: R²=0,y与X垂直(夹角90°),X对预测y无贡献
向量分解视角(投影几何)
- yc = ŷc + e: yc在col(X)上的正交分解
- ‖ŷc‖/‖yc‖ = √R²: 投影长度比 = √R²
- sin²θ = 1−R²: 残差方向的"距离"
- t²∝ ‖ŷc‖²/‖e‖²: 解释方差与残差方差之比(经自由度修正)
- F统计量: 多元回归中,F是所有方向上t²的推广
用 R² 和 t 的对应关系做推断
设 n = 52(月度数据2年),简单回归中 R² = 0.25。
Lasso 深度解析
来自期中Cheatsheet PDF的Lasso完整理论,包括软阈值推导、正交设计、约束等价、稀疏性的几何解释。
P1:惩罚形式 ⟺ 约束形式的等价性
P2:软阈值(Soft-Thresholding)——1D情形完整推导
1维Lasso:min_β ½(y−β)² + λ|β|
分三种情况讨论(|β|在β=0处不可微):
硬阈值:|β̂_OLS| ≤ λ → 设为0;|β̂_OLS| > λ → 保持原值(不压缩)
软阈值:|β̂_OLS| ≤ λ → 设为0;|β̂_OLS| > λ → 压缩λ(shrunk by λ,即"软")
软阈值是Lasso的解,硬阈值对应Best Subset。
P3:正交设计下的Lasso解(XᵀX = Iₚ)
P4:尺度不变性问题
P5:λ 的选择——K折交叉验证
- 对每个候选λ值: 将数据分为K个fold
- 对k=1,…,K: 在k-1个fold上拟合β̂^(-k)_λ,在第k个fold上计算验证MSE
- 平均CV误差: CV(λ) = (1/K)·Σₖ MSE_k
- 选取λ*: 使CV(λ)最小的λ(或"one-standard-error rule":选最大的λ使CV ≤ min_CV + 1·SE)
滚动窗口(Rolling):训练集 [t₀−w, t₀],验证集 [t₀+1, t₀+h],滚动前进 t₀
扩展窗口(Expanding):训练集 [1, t],验证集 [t+1, t+h],增长 t
绝不能用未来数据训练(不能train on future data)。
Lasso路径(Regularization Path)
Lasso稀疏性的几何解释
Lasso(L1球,菱形)
可行域 {‖β‖₁ ≤ τ} 是菱形(hypercube的对偶)。顶角在坐标轴上(如β₁=0或β₂=0的点)。OLS等高线椭圆从外向内扩张,最先碰到的往往是菱形的顶角——某个βⱼ = 0,产生精确零解(稀疏性)。
Ridge(L2球,圆形)
可行域 {‖β‖₂ ≤ c} 是球形(光滑)。OLS等高线椭圆最先碰到球面的切点通常不在坐标轴上——不产生精确零解,只有收缩。这是Ridge不选择变量的几何原因。
三种正则化估计量对比(正交设计情形)
| 估计量 | 公式(正交设计) | 类型 | 稀疏性 |
|---|---|---|---|
| Best Subset(大小K) | β̂ⱼ_OLS · 1[|β̂ⱼ_OLS| ≥ |β̂_(K)_OLS|] | 硬阈值(binary) | ✓ 精确零 |
| Ridge | β̂ⱼ_OLS / (1+λ) | 均匀收缩 | ✗ 无零 |
| Lasso | sign(β̂ⱼ_OLS)·(|β̂ⱼ_OLS|−λ)₊ | 软阈值 | ✓ 精确零 |
| PCR(前k个PC) | β̂ⱼ_OLS · 1[j≤k] | 二元(按方向) | ✓(某方向) |
Ridge 深度解析
P1:投影矩阵 H 的性质回顾
P3:Ridge 的闭合解 & 约束等价性
P4:增广设计矩阵(Augmented Design)
P5:Ridge 的 SVD 形式(最重要!)
通过奇异值分解理解Ridge的收缩机制
小奇异值 dⱼ ≪ √λ → sⱼ ≈ dⱼ/λ ≈ 0(强收缩:对应X的"弱"方向/多重共线方向)
大奇异值 dⱼ ≫ √λ → sⱼ ≈ 1/dⱼ(轻微收缩:对应X的"强"方向)
Ridge对条件数差(ill-conditioned)的方向收缩最强!
P6:Ridge 拟合值 = "软投影"(Soft Projection)
P7:Ridge 的偏差与方差(Bias-Variance分解)
Ridge的Bias² + Variance vs OLS
λ↑ → 偏差↑,方差↓,用偏差换方差(bias-variance tradeoff)
λ=0 → 退化为OLS(无偏,但方差最大)
λ→∞ → β̂→0(最大偏差,最小方差)
最优λ通过CV选取,使总MSE最小
PCR vs Ridge 对比
PCR和Ridge都是处理多重共线性/高维数据的降维方法,但机制不同。通过SVD视角可以清晰对比(来自PDF P8)。
SVD视角下的统一框架
| 特性 | Ridge | PCR |
|---|---|---|
| 权重 wⱼ | dⱼ²/(dⱼ²+λ)(连续,软) | 1[j≤k](二元,硬) |
| 类型 | 软、连续(soft projection) | 硬、离散(hard thresholding by direction) |
| 调参参数 | λ > 0(连续) | k ∈ Z⁺(离散) |
| 对小奇异值的处理 | 强烈压缩(sⱼ≈dⱼ/λ≈0) | 完全丢弃(wⱼ=0 for j>k) |
| 对大奇异值的处理 | 轻微压缩(sⱼ≈1/dⱼ) | 完全保留(wⱼ=1) |
| 解析解 | ✓ 有(β̂=(XᵀX+λI)⁻¹Xᵀy) | ✓ 有(PCA+OLS) |
| 适用场景 | 所有方向都有一定信息量 | 只有前k个PC有用,其余纯噪声 |
PCR步骤(PDF P8)
- SVD分解: X = UDVᵀ(thin SVD),取前k列得 Uₖ, Dₖ
- 得分矩阵: Zₖ = XVₖ = UₖDₖ,满足 ZₖᵀZₖ = Dₖ²
- 对Zₖ做OLS: ŷ_PCR = Zₖ(ZₖᵀZₖ)⁻¹Zₖᵀy = UₖDₖDₖ⁻²DₖUₖᵀy = UₖUₖᵀy
- 转换回原β: β̂_PCR = Vₖ(ZₖᵀZₖ)⁻¹Zₖᵀy
Bias-Variance:Ridge vs PCR
模型选择准则(PDF内容)
| 准则 | 公式 | 目标 | 特点 |
|---|---|---|---|
| AIC | IS Dev + 2·df | 预测(渐近OOS偏差) | 高维下df≈n时过拟合 |
| BIC | IS Dev + log(n)·df | 模型选择(近似后验概率) | n>7时比AIC更节省参数(log n > 2) |
Frisch-Waugh-Lovell(FWL)定理
笔记Page 1补充:OLS y~x 最小化Y方向竖直残差。OLS把X想像成无noise的;PCA x,y均有误差。在OLS中,一般 p < n(p < n/10有效经验);否则近以奇异,(XᵀX)⁻¹爆炸。
设 Y ~ Zβz + Wβw + ε,Z ∈ ℝⁿˣᵏ 为控制变量,W ∈ ℝⁿˣᵐ 为关注变量。
令 Pz = Z(ZᵀZ)⁻¹Zᵀ,Mz = I − Pz,则:
① Y~Z 残差:fy = Mz·Y ② W~Z 残差:fw = Mz·W
fy ~ fw,β̂w = (WᵀMzW)⁻¹WᵀMzY = (fwᵀfw)⁻¹fwᵀfy
笔记中的直觉理解
- 想要W对Y的影响:① Y~Z,fy 减去Z对Y的影响;② W~Z,fw 减去Z对W的影响;③ fy ~ fw,如同标准OLS
- 偏回归系数的含义:β̂w = "在控制Z之后,W对Y的净效应"
证明(来自笔记Page 20)
FWL 代数展开:Y ~ βz·Z + βw·W + ε
设已中心化。令 f = Cov(Y,Z)/Var(Z),γ = Cov(Z,W)/Var(Z),则:
Q: y ~ Xβ + βz·z + ε; y ~ Xβ + r, r = cz + u. 是否 β̂z = ĉ?
面板数据:yᵢₜ = αᵢ + β·xᵢₜ + εᵢₜ
se(β̂) 有/无截距的区别
| 性质 | 有截距 y = α + βx + ε | 无截距 y = βx + ε |
|---|---|---|
| β̂ 公式 | Sxy/Sxx = Σ(xᵢ−x̄)(yᵢ−ȳ)/Σ(xᵢ−x̄)² | ΣxᵢYᵢ/Σxᵢ² |
| se(β̂) 分母 | √Sxx = √Σ(xᵢ−x̄)²(中心化) | √Σxᵢ²(原始,未中心化) |
| 自由度 | σ̂² = RSS/(n−2) | σ̂² = RSS/(n−1) |
| 残差性质 | Σêᵢ = 0(保证) | Σêᵢ ≠ 0(一般) |
| R² 定义 | 标准R²,0≤R²≤1 | 需用R²₀ = ‖ŷ‖²/‖y‖² |
x = [100,101,102,103,104], x̄ = 102
β̂ 的总体矩形式(笔记Page 21)
F 检验 & 高级专题
F 统计量
Moore-Penrose 伪逆(笔记Page 22)
Online/Recursive OLS(笔记Page 24)
Ridge Feature复制定理(笔记Page 19)
把X复制k份作为k个独立特征,Ridge的β如何变化?
Newey-West HAC 完整推导(笔记Page 9)
笔记例题精选集
来自笔记Pages 25–33的全部例题,完整保留推导过程。
Y~X,X和Y iid正态,做线性回归,E[R²] = ?
真实R²=0,但样本R²>0(模型用了n个自由度)。
E[R²] = k/(n−1)
OLS vs Ridge vs Lasso:feature复制k份,β如何变化?
y = β₀+β₁x+ε,β₁=1,R²=0.05。求 Var(y)/Var(x)=?
y~x → β₁,x~y → β₂,哪个斜率更大?
如何检验一枚硬币是否公平?
系数显著但样本内R²低,如何理解?
β₁显著 → x与y有稳定的线性关系(信噪比高)
R²低 → 误差方差大(x只能解释y方差的一小部分)
金融数据中极为常见:收益率有显著预测因子,但R²仍只有1-5%。
Y~X,a. 使用样本A;b. 把A复制一份用合并样本。比较β̂和t。
Y~X,给X加额外噪声。β̂会怎样变?
Y~10X vs Y~X,R²有何区别?
已知 Corr(Y,X₁)>0,Corr(Y,X₂)=0,Corr(X₁,X₂)>0
① y = aX₁+ε;② y = b₁X₁+b₂X₂+ε,a与b₁的关系?
y=a₁X₁+a₂X₂+ε vs y=b₁X₁+ε₁, ε₁=b₂X₂+ε₂,若a₁=b₁, a₂=b₂?
应该总是选R²更高的模型吗?
① Adjusted R² = 1 − (1−R²)·(n−1)/(n−p−1)(惩罚额外的X变量)
② OOS R²(样本外,防止过拟合)
③ AIC = 2k − 2ln(L),k=变量数,L=最大似然估计值(好的预测)
④ BIC = ln(n)·k − 2ln(L),n=样本量(好的解释,更严格)
AIC找高精度预测模型;BIC找真实简单模型(更倾向稀疏)
y = aX₁+ε,X₂ = 100X₁,y = bX₂+ε,a与b的关系?
CI(y) 与 PI(y) 的关系?
y = ax+ε,x = by+ε,a=1,b=?
已知 Y = X+ε,X~N(0,1),ε~N(0,σ²),观测到Y,求X的估计
回归 Y~X,已知X和Y在[0,1]上iid均匀,且X+Y>1,求β̂
线性回归中,x复制,y改为[y; 0],β̂和t-stat会怎样变化?
x,y iid,now xₜ* = (xₜ+xₜ₋₁)/2(滑动平均),y不变,新β̂和t-stat?
y~Xβ+βz·z+ε,同时 y~Xβ+r,r=cz+u,证明 β̂z 与 ĉ 的关系
n对(yᵢ,xᵢ),t-stat为t₁;把每对做平均得(ȳᵢ',x̄ᵢ'),t-stat为t₂,比较?
y=ax₁+ε vs y=b₁x₁+b₂x₂+ε,若b₂=0,则b₁=a?
简单线性回归——带截距项完整推导
来自笔记 Simple_Linear_Regression.pdf 的完整、系统推导,使用 KaTeX 渲染所有公式。
模型设定
OLS 推导——一阶条件
残差的三条性质
$\hat{\beta}$ 的无偏性与方差
$\sigma^2$ 的无偏估计:$s^2 = RSS/(n-2)$
误差分解:TSS = ESS + RSS
注意:若 no intercept,则 $\sum\hat{\varepsilon}_i=0$ 不一定成立,此分解不一定成立。
$R^2$ 与样本相关系数
t 统计量的显式推导
Adjusted $R^2$ 与 F 统计量
简单线性回归——无截距项完整推导
模型与 OLS 估计
$\hat{\beta}$ 的无偏性与方差
无截距时的残差性质
有截距 vs 无截距——完整对比
笔记 Page 5 的完整比较表,所有公式用 KaTeX 渲染。
从 $(X^\top X)^{-1}$ 推导 se(β̂₁) 和 se(α̂)
面经题:Y~X,iid normal,E[R²] = ?四种推导
X 和 Y 完全独立(iid 正态),理论上真实 $R^2=0$,但有限样本中存在随机拟合,样本 $R^2 > 0$。四种方法推导其期望值。
方法一:F分布路径(最严格)
一元情形($Y \sim X$,单特征)。在 $H_0: \beta=0$ 下,t 统计量服从 $t(n-2)$,而 $R^2$ 与 $t^2$ 精确关联:
方法一推广:k 个特征
多元情形($Y \sim X_1 + \cdots + X_k$,所有 $\beta = 0$)。F 统计量服从 $F(k, n-k-1)$:
方法二:自由度直觉法(最快)
OLS 把 $n$ 个数据点拟合一条有 $k+1$ 个参数(含截距)的直线/超平面,消耗了 $k+1$ 个自由度。即使 $y$ 与所有 $x$ 完全无关,仅凭随机性也能"解释"这 $k+1$ 个方向的方差。
方法三:Adjusted R² 逆推(面试答题路径)
Adjusted $R^2$ 的定义正好修正了这个偏差:
方法四:几何路径(最有直觉)
在正态假设下,经过中心化后,$\hat y$(拟合值向量)是 $y$ 向 $k$ 维特征空间的投影。
四种方法汇总对比
n=100,k=5 的无关特征,E[R²] ≈ ?
面经题:回归斜率——有/无截距时公式的区别
面经题9问 $Y \sim X$ 和 $X \sim Y$ 的斜率之积,公式用的是 $\hat\beta = \operatorname{Cov}/\operatorname{Var}$。这只在有截距时成立。
有截距:$y = \alpha + \beta x + \varepsilon$
最小化 $\sum(y_i - \alpha - \beta x_i)^2$,对 $\alpha$ 和 $\beta$ 分别求偏导:
无截距:$y = \beta x + \varepsilon$(强制过原点)
最小化 $\sum(y_i - \beta x_i)^2$,只对 $\beta$ 求偏导:
关键区别:何时两者相等?
双向回归斜率之积:有截距 vs 无截距
完整对比表
sklearn 默认用中心化 TSS 计算 $R^2$,导致无截距时可能报出负值,就是这个原因。
$Y \sim X$ 得 $\theta_1$,$X \sim Y$ 得 $\theta_2$,$\theta_1 \times \theta_2$ 的范围
无截距时:残差正交条件为 $\sum x_i e_i = 0$(未中心化),导出 $\hat\beta = \sum x_iy_i/\sum x_i^2$,只有 $\bar x = 0$ 时才退化为 $\operatorname{Cov}/\operatorname{Var}$。