Adapter 合并、多 LoRA 与续训
LoRA adapter 的 merge_and_unload、多 adapter 切换、SFT 续训与 DPO 衔接、以及 Ollama/vLLM 部署前的导出要点。
微调数据格式与 Chat Template
SFT 微调三种数据格式(text / messages / prompt-completion)、chat template 机制、completion_only_loss 与训练推理一致性的工程要点。
偏好对齐路线选型:DPO、GRPO、RLHF 与一步对齐
对比 DPO、ORPO、KTO、GRPO 与经典 RLHF 的数据要求、工程复杂度、适用场景与 TRL Trainer 映射,帮助 SFT 之后选对齐路线。