Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

集成与Bagging

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 机器学习 , 数学基础
Bagging、随机森林、Boosting 与泛化关系:如何通过集成降方差提升泛化。
阅读全文 »

交叉验证

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 机器学习 , 数学基础
k-fold 交叉验证、分层与分组 CV、方差估计及泄漏防范;与 Math-01 检验的衔接。
阅读全文 »

pass@k 详解

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
说明 pass@k 在代码生成与多采样任务中的含义、无偏估计公式、与 pass@1 的区别及在微调评估中的用法与局限。
阅读全文 »

BERTScore 详解

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
说明 BERTScore 基于语义嵌入的 P/R/F1 计算方式、与 BLEU/ROUGE 的差异、在 LLM 生成评估中的适用场景与局限。
阅读全文 »

Invalid 预测率详解

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
说明生成式微调中 Invalid 预测率的定义、解析规则设计、与 Accuracy/F1 的关系及在格式约束任务中的诊断价值。
阅读全文 »

EarlyStopping与验证集

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 机器学习 , 数学基础
Early stopping 原理、验证集监控、checkpoint 策略及在深度训练与微调中的用法。
阅读全文 »

Dropout与数据增强

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 机器学习 , 数学基础
Dropout 机制、数据增强作为隐式正则、及在视觉、语音、文本中的典型增强策略。
阅读全文 »

微调评估指标系列导读

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
梳理 LLM 监督微调中常用的训练监控指标与任务级评估指标,按训练过程、分类任务、开放生成、专项指标四类组织,各篇自包含公式、代码与局限说明。
阅读全文 »

交叉熵损失(eval_loss)详解

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
说明 SFT 微调中 eval_loss 的直观含义、计算公式、在训练监控中的用法及与任务指标的区别与局限。
阅读全文 »

困惑度(Perplexity)详解

发表于 2026-06-24 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调
说明 Perplexity 的定义、与交叉熵损失的关系、在语言模型微调评估中的解读方式及局限。
阅读全文 »
‹1…242526…104›

1034 日志
49 分类
917 标签
© 2026 Ben-air
已有人访问 | 总访问次