学习率与 warmup:控制步长,前期爬坡防炸
学习率 η 控制每步更新幅度;warmup 前期从近 0 爬到峰值,再接余弦/线性衰减。覆盖公式、BERT / LLaMA / 微调 / LoRA 经验值,以及与 Post-LN、batch size 的耦合。
Weight decay:每步把过大权重拉向零
Weight decay:每步把权重按比例拉向零,抑制过大 W。AdamW 为解耦实现。对照 L2、Dropout,以及 BERT 0.01 / LLaMA 0.1、Norm 层排除。
RMSNorm:无均值归一,LLaMA 系默认
RMSNorm:只用均方根缩放、通常不减均值、无偏置 β。LLaMA / Qwen 等 Decoder 默认;训练推理同一公式。对照 LayerNorm、ε 与 Pre-Norm 位置。
LayerNorm:稳住激活尺度,让深层可训
LayerNorm:对每个 token 的隐向量去均值、除标准差,再仿射;稳住激活尺度,让残差堆叠可训。覆盖公式、ε、Pre-LN / Post-LN、BERT / GPT-2 / ProteinMPNN。
Dropout:训练时随机失活,抑制过拟合
Dropout:训练时按比率 p 随机把激活置零,抑制过拟合;推理默认关闭。覆盖反向 Dropout、经验比率,以及 BERT / GPT-2 / LLaMA / ProteinMPNN / LoRA 落点。
Needleman-Wunsch算法
Needleman–Wunsch 全局两两序列比对:问题定义、评分、二次动态规划递推、填表与回溯、完整数值例;对照 Smith–Waterman / Gotoh,以及 Biopython、EMBOSS、parasail 等社区实现。