集成与Bagging 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 机器学习 , 数学基础 Bagging、随机森林、Boosting 与泛化关系:如何通过集成降方差提升泛化。 阅读全文 »
交叉验证 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 机器学习 , 数学基础 k-fold 交叉验证、分层与分组 CV、方差估计及泄漏防范;与 Math-01 检验的衔接。 阅读全文 »
pass@k 详解 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 说明 pass@k 在代码生成与多采样任务中的含义、无偏估计公式、与 pass@1 的区别及在微调评估中的用法与局限。 阅读全文 »
BERTScore 详解 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 说明 BERTScore 基于语义嵌入的 P/R/F1 计算方式、与 BLEU/ROUGE 的差异、在 LLM 生成评估中的适用场景与局限。 阅读全文 »
Invalid 预测率详解 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 说明生成式微调中 Invalid 预测率的定义、解析规则设计、与 Accuracy/F1 的关系及在格式约束任务中的诊断价值。 阅读全文 »
EarlyStopping与验证集 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 机器学习 , 数学基础 Early stopping 原理、验证集监控、checkpoint 策略及在深度训练与微调中的用法。 阅读全文 »
Dropout与数据增强 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 机器学习 , 数学基础 Dropout 机制、数据增强作为隐式正则、及在视觉、语音、文本中的典型增强策略。 阅读全文 »
微调评估指标系列导读 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 梳理 LLM 监督微调中常用的训练监控指标与任务级评估指标,按训练过程、分类任务、开放生成、专项指标四类组织,各篇自包含公式、代码与局限说明。 阅读全文 »
交叉熵损失(eval_loss)详解 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 说明 SFT 微调中 eval_loss 的直观含义、计算公式、在训练监控中的用法及与任务指标的区别与局限。 阅读全文 »
困惑度(Perplexity)详解 发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 说明 Perplexity 的定义、与交叉熵损失的关系、在语言模型微调评估中的解读方式及局限。 阅读全文 »