Math-08.泛化与正则-20.ScalingLaws与DoubleDescent

本页介绍大模型时代的泛化现象:Scaling lawsDouble Descent——补充经典 02 偏差方差 框架。

段末注释Scaling laws(缩放定律)经验表明语言模型 loss 随参数量 $N$、数据量 $D$、算力 $C$ 呈幂律下降;Double Descent(双下降)指测试误差随模型容量先升后降的第二段下降。

系列入口00.系列规划 | 前置:02 偏差方差Math-05/10 语言模型


1. 经典 U 形 vs Double Descent(D1–D3)

图 1 测试误差双下降示意

阶段 容量 测试误差
经典 小→中 U 形(过拟合峰)
插值阈值 恰拟合 train 误差峰值
过参数化 远大于 $n$ 可再降(双下降第二段)

过参数化深网仍可泛化,与 VC 维经典界并不矛盾——隐式正则(SGD、结构)起作用。


2. Scaling Laws(D3)

图 2 loss ~ N^{-alpha}

经验(语言建模,示意):

$$
L(N) \propto N^{-\alpha_N}, \quad L(D) \propto D^{-\alpha_D}
$$

变量 含义
$N$ 非嵌入参数量
$D$ 训练 token 数
$C$ 训练算力

Chinchilla 结论(定性):给定算力,存在最优 $N$–$D$ 配比,数据往往应比早期 GPT-3 尺度更充分


3. 跨领域启示(D7)

图 3 Scaling 思想迁移

领域 现象 实践
大语言模型 预训练 loss 随规模平滑降 按预算选 $N,D$ 配比
视觉基础模型 ViT 数据/模型同步放大 自监督预训练 + 微调
蛋白语言模型 序列数据增大提升下游 ESM 类模型 scaling
科学 ML 小数据不适用纯 scaling 仍依赖正则、CV、物理先验
表格数据 增大宽深 MLP 收益有限 树模型 + 集成仍强
边缘部署 大模型不可 scale 蒸馏、量化缩小 $N$

4. 与 Math-08 其他篇关系(D6)

经典工具 大模型语境
L2 / weight decay 仍用 AdamW(03
Dropout 预训练常用;微调有时减小
早停 预训练步数由 scaling 预算定;微调仍早停
CV 预训练不需;下游小任务仍要

5. 局限(D8)

图 4 勿过度 extrapolate

注意 说明
幂律外推 数据/算力边界未知
下游任务 预训练 loss↓ ≠ 所有任务↑
双下降非万能 小数据 tabular 仍 U 形
环境成本 scaling 与业务 ROI 权衡

6. 小结

Math-08 泛化与正则 系列:经典 偏差-方差 + 正则 + CV 仍是工程基石;Scaling / Double Descent 解释大模型独特行为。

系列导航00 规划 | 01 总论

-------------本文结束感谢您的阅读-------------