本页介绍大模型时代的泛化现象:Scaling laws 与 Double Descent——补充经典 02 偏差方差 框架。
段末注释:Scaling laws(缩放定律)经验表明语言模型 loss 随参数量 $N$、数据量 $D$、算力 $C$ 呈幂律下降;Double Descent(双下降)指测试误差随模型容量先升后降的第二段下降。
系列入口:00.系列规划 | 前置:02 偏差方差、Math-05/10 语言模型
1. 经典 U 形 vs Double Descent(D1–D3)

| 阶段 | 容量 | 测试误差 |
|---|---|---|
| 经典 | 小→中 | U 形(过拟合峰) |
| 插值阈值 | 恰拟合 train | 误差峰值 |
| 过参数化 | 远大于 $n$ | 可再降(双下降第二段) |
过参数化深网仍可泛化,与 VC 维经典界并不矛盾——隐式正则(SGD、结构)起作用。
2. Scaling Laws(D3)

经验(语言建模,示意):
$$
L(N) \propto N^{-\alpha_N}, \quad L(D) \propto D^{-\alpha_D}
$$
| 变量 | 含义 |
|---|---|
| $N$ | 非嵌入参数量 |
| $D$ | 训练 token 数 |
| $C$ | 训练算力 |
Chinchilla 结论(定性):给定算力,存在最优 $N$–$D$ 配比,数据往往应比早期 GPT-3 尺度更充分。
3. 跨领域启示(D7)

| 领域 | 现象 | 实践 |
|---|---|---|
| 大语言模型 | 预训练 loss 随规模平滑降 | 按预算选 $N,D$ 配比 |
| 视觉基础模型 | ViT 数据/模型同步放大 | 自监督预训练 + 微调 |
| 蛋白语言模型 | 序列数据增大提升下游 | ESM 类模型 scaling |
| 科学 ML | 小数据不适用纯 scaling | 仍依赖正则、CV、物理先验 |
| 表格数据 | 增大宽深 MLP 收益有限 | 树模型 + 集成仍强 |
| 边缘部署 | 大模型不可 scale | 蒸馏、量化缩小 $N$ |
4. 与 Math-08 其他篇关系(D6)
| 经典工具 | 大模型语境 |
|---|---|
| L2 / weight decay | 仍用 AdamW(03) |
| Dropout | 预训练常用;微调有时减小 |
| 早停 | 预训练步数由 scaling 预算定;微调仍早停 |
| CV | 预训练不需;下游小任务仍要 |
5. 局限(D8)

| 注意 | 说明 |
|---|---|
| 幂律外推 | 数据/算力边界未知 |
| 下游任务 | 预训练 loss↓ ≠ 所有任务↑ |
| 双下降非万能 | 小数据 tabular 仍 U 形 |
| 环境成本 | scaling 与业务 ROI 权衡 |
6. 小结
Math-08 泛化与正则 系列:经典 偏差-方差 + 正则 + CV 仍是工程基石;Scaling / Double Descent 解释大模型独特行为。