Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

继续预训练 CPT 与领域适配

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
何时做继续预训练、CPT 与 SFT 的顺序、数据规模与 loss 监控,及领域模型(生物/酶等)实践要点。
阅读全文 »

Adapter 合并、多 LoRA 与续训

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
LoRA adapter 的 merge_and_unload、多 adapter 切换、SFT 续训与 DPO 衔接、以及 Ollama/vLLM 部署前的导出要点。
阅读全文 »

PEFT 方法横向对比:LoRA、AdaLoRA、DoRA、IA³

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
主流 PEFT 方法的机制差异、参数量、效果与工程选型建议,帮助在 LoRA 之外做有依据的替代选择。
阅读全文 »

QLoRA 与量化微调

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
QLoRA 4bit 基座 + LoRA 的原理要点、BitsAndBytesConfig 配置、显存估算及 CUDA/ROCm 兼容注意。
阅读全文 »

偏好数据构造:chosen/rejected 与质量要点

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
DPO/ORPO 所需的偏好对数据来源、构造方法、chosen-rejected 质量要求及 TRL 数据格式示例。
阅读全文 »

微调数据清洗与质量控制

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
SFT 微调前的数据清洗流程:去重、长度过滤、格式合规、标签一致性、毒性/PII 处理及质量抽检清单。
阅读全文 »

微调数据格式与 Chat Template

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
SFT 微调三种数据格式(text / messages / prompt-completion)、chat template 机制、completion_only_loss 与训练推理一致性的工程要点。
阅读全文 »

LoRA 原理与工程配置

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
LoRA 低秩适配的直观原理、LoraConfig 关键参数、target_modules 选型、学习率与 rank 消融,及与 SFTTrainer 集成的常见踩坑。
阅读全文 »

偏好对齐路线选型:DPO、GRPO、RLHF 与一步对齐

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
对比 DPO、ORPO、KTO、GRPO 与经典 RLHF 的数据要求、工程复杂度、适用场景与 TRL Trainer 映射,帮助 SFT 之后选对齐路线。
阅读全文 »

微调技术路线系列导读

发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
LLM 微调技术路线系列入口:后训练阶段划分、PEFT/对齐/数据/工程模块索引,以及与工具详解、评估指标、Math 理论系列的阅读分工。
阅读全文 »
‹1…212223…104›

1034 日志
49 分类
917 标签
© 2026 Ben-air
已有人访问 | 总访问次