读 Transformer / ProteinMPNN / 微调脚本时,同一批词会反复出现:Dropout、LayerNorm、学习率、warmup、weight decay、梯度裁剪、temperature。它们不是「再叠一层网络」,而是开关与剂量:决定信息怎么流、梯度怎么走、生成时多随机。本系列按一个要点一篇写清作用、机制、经验值、落点和案例,目标是宏观选型直觉,不是从零推导整个优化器。
段末注释:超参(hyperparameter) 指训练前指定、通常不由反向传播直接学习的量(如 Dropout 比率 (p)、学习率);与权重 (W) 相对。

1. 本系列解决什么问题
| 读架构文时常卡住的问题 | 本系列怎么答 |
|---|---|
| 这个参数是权重吗?训练时改、推理时还在吗? | 先分清可学习权重 vs 训练开关 vs 推理采样 |
| 默认 0.1 从哪来?大模型为什么有时是 0? | 给经验表和适用规模,不给唯一最优 |
| 同一名字在 HuggingFace / 论文 / 训练脚本里各叫什么 | 对照常见字段,减少对不上号 |
不覆盖:完整模型结构、数据集工程、评测协议——那些仍走本目录的 5001 / 5020 / 5040 线。
2. 每篇固定结构
| 章节 | 读者应带走的东西 |
|---|---|
| 作用 | 它在优化目标里补哪一块(正则、稳定、多样性…) |
| 功能 / 机制 | 张量上具体做了什么;训练 vs 推理是否同一套 |
| 默认经验值 | 常见默认、何时加大/关掉、和谁耦合 |
| 整体应用 | 架构里插在哪、训练脚本哪几个开关、推理是否还生效 |
| 使用案例 | 1–2 个可核对的实现(官方默认或本仓库已有模型) |
3. 三条链上的要点地图
| 链 | 典型要点 | 一句话 |
|---|---|---|
| 架构设计 | Dropout、LayerNorm / RMSNorm、残差缩放 | 层内信息怎么混合、怎么归一 |
| 训练 | 学习率与 warmup、weight decay、梯度裁剪、label smoothing | 步长、约束、防炸、防过拟合 |
| 推理 | temperature、top-(k) / top-(p)、(少见)MC Dropout | 解码随机性;默认应关掉训练期随机层 |
一篇可以跨两条链:Dropout 主要是架构位 + 训练开关,推理默认关闭。
4. 已收录 / 规划
| 编号 | 要点(名称:一句话功能) | 状态 |
|---|---|---|
| 01 | Dropout:训练时随机失活,抑制过拟合 | 已写 |
| 02 | LayerNorm:稳住激活尺度,让深层可训 | 已写 |
| 03 | RMSNorm:无均值归一,LLaMA 系默认 | 已写 |
| 04 | Weight decay:惩罚过大权重 | 已写 |
| 05 | 学习率与 warmup:控制步长,前期爬坡防炸 | 已写 |
| 06 | 梯度裁剪:限制单步更新幅度 | 规划 |
| 07 | Label smoothing:软化独热标签 | 规划 |
| 08 | Temperature / top-(k) / top-(p):推理时调节采样随机性 | 规划 |
后续按阅读主线追加,不预先堆空文。
5. 和邻近系列的关系
| 系列 | 侧重 |
|---|---|
| 本系列(算法要点) | 单参数/单机制的宏观认知与经验值 |
| 5003 架构长文 | 某个模型的数据流、层堆叠、损失 |
| 5003.LLM 概念解析 | 病理现象(专家坍缩、过平滑) |
| 5020 模型优化 | RAG / 微调 / PEFT 选型 |
交叉引用只在「需要对上某模型默认」时出现;正文尽量自洽。