Math-08.泛化与正则-02.偏差方差分解

本页讲解偏差-方差分解(bias-variance decomposition)——理解欠拟合与过拟合的数学语言。

段末注释偏差(bias)度量模型平均预测与真值的偏离(欠拟合倾向);方差(variance)度量模型对训练集抽样波动的敏感程度(过拟合倾向)。

系列入口00.系列规划 | 前置:01 总论


1. 分解(回归设定)(D2–D3)

图 1 Bias vs Variance

对平方损失,在固定 $x$ 处:

$$
\mathbb{E}[(y - \hat{f}(x))^2] = \underbrace{(\mathbb{E}[\hat{f}(x)] - f(x))^2}{\text{Bias}^2} + \underbrace{\mathbb{E}[(\hat{f}(x)-\mathbb{E}[\hat{f}(x)])^2]}{\text{Variance}} + \sigma^2_{\mathrm{noise}}
$$

含义
Bias² 模型类太简单,系统性错
Variance 模型对训练样本太敏感
噪声 数据固有不可约误差

泛化误差 ≈ Bias² + Variance + Noise。


2. 模型容量权衡(D3)

图 2 容量增大:偏差降、方差升

容量 Bias Variance 例子
线性回归、浅树
随机森林(适度深度)
深神经网络、高阶多项式

正则化集成更多数据 主要降 Variance更复杂特征/模型Bias


3. 跨领域诊断(D7)

图 3 领域中的偏差-方差

领域 高偏差(欠拟合)信号 高方差(过拟合)信号
房价预测 线性模型无法刻画非线性区位 深度模型记住个别豪宅标价
语音关键词检测 模板匹配漏掉口音变化 小样本微调过拟合说话人
基因表达聚类 簇数过少合并生物学亚型 簇数过多分裂噪声波动
欺诈检测 规则太粗漏检新型欺诈 对历史欺诈 ID 记忆过具体
机器翻译 小 n-gram 语言模型流畅度差 小语料微调翻译记忆训练句

4. 与数据量的关系(D6)

  • $n$ 小:优先控方差(正则、简单模型、CV)
  • $n$ 大:可用高容量模型降偏差
  • 特征 $p$ 大、$n$ 小:高方差风险 → 03 L1/L202/20 特征选择

5. 局限(D8)

图 4 局限

注意 说明
分类任务 分解形式不同,直觉仍适用
深网过参数化 测试误差可再降(见 20 Double Descent
相关样本 有效 $n$ 小于名义 $n$

6. 小结

调模型 = 在 Bias²Variance 间找平衡。下一篇:03 L1/L2 正则化

系列导航01 总论 | 07 集成

-------------本文结束感谢您的阅读-------------