本页讲解偏差-方差分解(bias-variance decomposition)——理解欠拟合与过拟合的数学语言。
段末注释:偏差(bias)度量模型平均预测与真值的偏离(欠拟合倾向);方差(variance)度量模型对训练集抽样波动的敏感程度(过拟合倾向)。
1. 分解(回归设定)(D2–D3)

对平方损失,在固定 $x$ 处:
$$
\mathbb{E}[(y - \hat{f}(x))^2] = \underbrace{(\mathbb{E}[\hat{f}(x)] - f(x))^2}{\text{Bias}^2} + \underbrace{\mathbb{E}[(\hat{f}(x)-\mathbb{E}[\hat{f}(x)])^2]}{\text{Variance}} + \sigma^2_{\mathrm{noise}}
$$
| 项 | 含义 |
|---|---|
| Bias² | 模型类太简单,系统性错 |
| Variance | 模型对训练样本太敏感 |
| 噪声 | 数据固有不可约误差 |
泛化误差 ≈ Bias² + Variance + Noise。
2. 模型容量权衡(D3)

| 容量 | Bias | Variance | 例子 |
|---|---|---|---|
| 低 | 高 | 低 | 线性回归、浅树 |
| 中 | 中 | 中 | 随机森林(适度深度) |
| 高 | 低 | 高 | 深神经网络、高阶多项式 |
正则化、集成、更多数据 主要降 Variance;更复杂特征/模型 降 Bias。
3. 跨领域诊断(D7)

| 领域 | 高偏差(欠拟合)信号 | 高方差(过拟合)信号 |
|---|---|---|
| 房价预测 | 线性模型无法刻画非线性区位 | 深度模型记住个别豪宅标价 |
| 语音关键词检测 | 模板匹配漏掉口音变化 | 小样本微调过拟合说话人 |
| 基因表达聚类 | 簇数过少合并生物学亚型 | 簇数过多分裂噪声波动 |
| 欺诈检测 | 规则太粗漏检新型欺诈 | 对历史欺诈 ID 记忆过具体 |
| 机器翻译 | 小 n-gram 语言模型流畅度差 | 小语料微调翻译记忆训练句 |
4. 与数据量的关系(D6)
- $n$ 小:优先控方差(正则、简单模型、CV)
- $n$ 大:可用高容量模型降偏差
- 特征 $p$ 大、$n$ 小:高方差风险 → 03 L1/L2、02/20 特征选择
5. 局限(D8)

| 注意 | 说明 |
|---|---|
| 分类任务 | 分解形式不同,直觉仍适用 |
| 深网过参数化 | 测试误差可再降(见 20 Double Descent) |
| 相关样本 | 有效 $n$ 小于名义 $n$ |
6. 小结
调模型 = 在 Bias² 与 Variance 间找平衡。下一篇:03 L1/L2 正则化。