大模型算法要点:开关与剂量的宏观导读

读 Transformer / ProteinMPNN / 微调脚本时,同一批词会反复出现:Dropout、LayerNorm、学习率、warmup、weight decay、梯度裁剪、temperature。它们不是「再叠一层网络」,而是开关与剂量:决定信息怎么流、梯度怎么走、生成时多随机。本系列按一个要点一篇写清作用、机制、经验值、落点和案例,目标是宏观选型直觉,不是从零推导整个优化器。

段末注释:超参(hyperparameter) 指训练前指定、通常不由反向传播直接学习的量(如 Dropout 比率 (p)、学习率);与权重 (W) 相对。

图 1 算法要点落在三条链上:架构设计 / 训练 / 推理


1. 本系列解决什么问题

读架构文时常卡住的问题 本系列怎么答
这个参数是权重吗?训练时改、推理时还在吗? 先分清可学习权重 vs 训练开关 vs 推理采样
默认 0.1 从哪来?大模型为什么有时是 0? 经验表和适用规模,不给唯一最优
同一名字在 HuggingFace / 论文 / 训练脚本里各叫什么 对照常见字段,减少对不上号

不覆盖:完整模型结构、数据集工程、评测协议——那些仍走本目录的 5001 / 5020 / 5040 线。


2. 每篇固定结构

章节 读者应带走的东西
作用 它在优化目标里补哪一块(正则、稳定、多样性…)
功能 / 机制 张量上具体做了什么;训练 vs 推理是否同一套
默认经验值 常见默认、何时加大/关掉、和谁耦合
整体应用 架构里插在哪、训练脚本哪几个开关、推理是否还生效
使用案例 1–2 个可核对的实现(官方默认或本仓库已有模型)

3. 三条链上的要点地图

典型要点 一句话
架构设计 Dropout、LayerNorm / RMSNorm、残差缩放 层内信息怎么混合、怎么归一
训练 学习率与 warmup、weight decay、梯度裁剪、label smoothing 步长、约束、防炸、防过拟合
推理 temperature、top-(k) / top-(p)、(少见)MC Dropout 解码随机性;默认应关掉训练期随机层

一篇可以跨两条链:Dropout 主要是架构位 + 训练开关,推理默认关闭。


4. 已收录 / 规划

编号 要点(名称:一句话功能) 状态
01 Dropout:训练时随机失活,抑制过拟合 已写
02 LayerNorm:稳住激活尺度,让深层可训 已写
03 RMSNorm:无均值归一,LLaMA 系默认 已写
04 Weight decay:惩罚过大权重 已写
05 学习率与 warmup:控制步长,前期爬坡防炸 已写
06 梯度裁剪:限制单步更新幅度 规划
07 Label smoothing:软化独热标签 规划
08 Temperature / top-(k) / top-(p):推理时调节采样随机性 规划

后续按阅读主线追加,不预先堆空文。


5. 和邻近系列的关系

系列 侧重
本系列(算法要点) 单参数/单机制的宏观认知与经验值
5003 架构长文 某个模型的数据流、层堆叠、损失
5003.LLM 概念解析 病理现象(专家坍缩、过平滑)
5020 模型优化 RAG / 微调 / PEFT 选型

交叉引用只在「需要对上某模型默认」时出现;正文尽量自洽。

-------------本文结束感谢您的阅读-------------