微调数据格式与 Chat Template
SFT 微调三种数据格式(text / messages / prompt-completion)、chat template 机制、completion_only_loss 与训练推理一致性的工程要点。
偏好对齐路线选型:DPO、GRPO、RLHF 与一步对齐
对比 DPO、ORPO、KTO、GRPO 与经典 RLHF 的数据要求、工程复杂度、适用场景与 TRL Trainer 映射,帮助 SFT 之后选对齐路线。
Math-09.特征预处理与变换-10.Pipeline与泄漏防范
发表于
|
分类于
知识
sklearn Pipeline、ColumnTransformer、CV 内 fit、预处理泄漏案例与工程最佳实践。