pass@k 详解 发表于 2026-06-24 | 分类于 LLM , 开发 说明 pass@k 在代码生成与多采样任务中的含义、无偏估计公式、与 pass@1 的区别及在微调评估中的用法与局限。 阅读全文 »
BERTScore 详解 发表于 2026-06-24 | 分类于 LLM , 开发 说明 BERTScore 基于语义嵌入的 P/R/F1 计算方式、与 BLEU/ROUGE 的差异、在 LLM 生成评估中的适用场景与局限。 阅读全文 »
Invalid 预测率详解 发表于 2026-06-24 | 分类于 LLM , 开发 说明生成式微调中 Invalid 预测率的定义、解析规则设计、与 Accuracy/F1 的关系及在格式约束任务中的诊断价值。 阅读全文 »
Math-08.泛化与正则-05.EarlyStopping与验证集 发表于 2026-06-24 | 分类于 知识 Early stopping 原理、验证集监控、checkpoint 策略及在深度训练与微调中的用法。 阅读全文 »
Math-08.泛化与正则-04.Dropout与数据增强 发表于 2026-06-24 | 分类于 知识 Dropout 机制、数据增强作为隐式正则、及在视觉、语音、文本中的典型增强策略。 阅读全文 »
微调评估指标系列导读 发表于 2026-06-24 | 分类于 LLM , 开发 梳理 LLM 监督微调中常用的训练监控指标与任务级评估指标,按训练过程、分类任务、开放生成、专项指标四类组织,各篇自包含公式、代码与局限说明。 阅读全文 »
交叉熵损失(eval_loss)详解 发表于 2026-06-24 | 分类于 LLM , 开发 说明 SFT 微调中 eval_loss 的直观含义、计算公式、在训练监控中的用法及与任务指标的区别与局限。 阅读全文 »
困惑度(Perplexity)详解 发表于 2026-06-24 | 分类于 LLM , 开发 说明 Perplexity 的定义、与交叉熵损失的关系、在语言模型微调评估中的解读方式及局限。 阅读全文 »
Token 准确率(mean_token_accuracy)详解 发表于 2026-06-24 | 分类于 LLM , 开发 说明 TRL SFTTrainer 记录的 mean_token_accuracy 的含义、计算方式、适用场景及与 eval_loss、任务 accuracy 的区别。 阅读全文 »