00.范式-机器学习算法介绍

本文件是 02.开发-20.MachineLearn算法介绍类文章的作者侧写作规范。
目标:让「有简单数学基础的从业者」读完能建立正确直觉、知道何时能用/何时别用,而不是背公式。
正式对外的算法正文,禁止出现对本地其他文件包括本文件或「按范式写作」的任何引用(见「绝对禁区」)。

本文会随样例稿迭代;改结构时先改本文件,再回写样例,保持「范式 → 样例」单向一致。

命名约定

算法专篇文件名优先沿用目录既有编号体系:

1
1201.机器学习-算法-{算法名}.md
字段 约束 说明
前缀编号 沿用系列号 1201 表示经典算法;集成/强化学习用既有 1204/1205
算法名 常用中文或通行英文 专有名词保留英文大小写(如 XGBoostK-Means
配图目录 .md 同名 ./1201.机器学习-算法-{算法名}/fig-xx-*.png

硬性:文件名、目录名、图片文件名均不得含空格。 需要分隔时用 -_(如 Logistic回归K-Means聚类logistic-fig01-sigmoid-gate.png)。正文叙述里专有名词可保留空格(如「Logistic 回归」),与路径无关。

同系列其他文类(特征工程、神经网络、概念)各自编号,不硬塞进「算法」模板;本范式只管单算法介绍

读者与语气

读者:有高中级数学直觉(函数、概率、对数、向量加减乘积即可),未必熟悉凸优化或测度论。他们要的是:这算法解决什么问题、核心在算什么、参数怎么读、坑在哪。

语气

  • 深入浅出:先直觉与比喻,再给最小必要公式,再给可运行片段。
  • 像同事讲题,不像教材目录;允许「你可以把 xxx 想成…」。
  • 真诚划边界:适用与不适用对等写,禁止「万能 / 最佳 / 必会」。
  • 直接讲清楚即可,不要用「说人话 / 给普通人讲」这类自我标榜式措辞(见下方表达禁区)。

与「工具推荐」范式的差异:算法文不追求口语聊天体;要有具体问题场景、诚实的局限、无空泛开场,但措辞保持专业克制,禁止降智腔与营销腔。

核心写法原则

  1. 一条主线:全文只讲清「输入 → 中间量 → 输出决策 → 决策依据/算法原理」这一条链路;枝节用小标题或段末注释挂上,不抢戏。
  2. 比喻服务理解:每个难点最多一个主比喻,比喻后立刻对应回公式符号,避免比喻漂移,同时比喻尽可能是数据化的示例。
  3. 公式可跳读:关键式单独成行;周围用一句话说明「符号是啥、式子在算啥」。
  4. 缩写体例:首次用「中文全称(英文全称,缩写)」;同段末可用引用块短注;后文只用缩写。
  5. 配图默认科普漫画风:复杂概念配 1 张示意;图注写清「在讲哪一步」。
  6. 样例数字要算得过,且头对头走完全程:手算例子必须可复核;禁止只演示「算 $\alpha$」「算一次距离」等单阶段切片。必须从特征与标签(或无监督输入)落到最终预测/分配结果;每步更新方向与拟合目标须符合该算法真实训练逻辑(见 §4.4),禁止为凑整数而反写流向。手算新增或改动后须完成 §4.5 两轮确认(算术 + 原理)。避免夸张到概率≈1 却装作「大约」的假例子。

绝对禁区

正文元写作禁令(硬性)

算法正文中禁止:

  1. 「结构见范式」「按本目录模板」「详见 00.范式…」等作者侧提示
  2. 把命名约定、目录规划写进读者可见正文
  3. 为凑结构而互引「请先读上一篇算法」——确需前置知识时,用一两句简短说明补齐,或外链权威资料

外部论文、官方文档、sklearn 手册可以链。

表达禁区

  1. 教科书空开场:「在当今…快速发展的时代」「随着机器学习的兴起」
  2. 套话堆砌:「首先…其次…最后」「综上所述」「值得注意的是」「让我们来看看」
  3. 高频踩雷词(与工具文一致):「说白了」「意味着什么?」「这意味着」「本质上」「换句话说」「不可否认」
  4. 编造「比如有一次客户…」的虚假故事;没有真实业务案例就用公开可复核的教学设定(考试通过、垃圾邮件、医疗阴阳性等)并标明是示意
  5. 降智 / 自我标榜腔(硬性,算法文特有加强)——正文与小标题均禁止出现,包括但不限于:
    • 「说人话」「人话版」「人话解释」「给普通人」「写给小白」「零基础也能懂」
    • 「通俗易懂地讲」「大白话就是」「保姆级」「手把手从零」
    • 「干货满满」「一文搞懂」「彻底掌握」「赋能」「闭环」等空响营销词
    • 把章节命名成「人话定位」——统一用 「一句话定位」

推荐结构(可裁剪,顺序建议固定)

新稿默认按下列骨架。监督/无监督/生成类算法可删节,但 场景切入 / 一句话定位 / 适用与不适用(三维+例子) / 核心链路 / 手算完整实例(头对头) / 小结 建议保留。

0. 场景切入(开场)

用一个具体二选一或可量化的问题开场(通过/不通过、买/不买、簇 A/簇 B)。
一两句点出:为什么「直接线性回归」或「拍脑袋阈值」不够用。

1. 一句话定位(可并入开场末)

先用表钉住「是什么」,再用一小段出现背景钉住「何时、为解决什么而来」。

1.1 定位表(必有)

三行说清:

维度 写什么
学习范式 监督 / 无监督 / …
输入 → 输出 特征 → 概率 / 类别 / 簇编号 / …
在优化什么 一句话目标(损失、间隔、似然、邻域投票等)

缩写首次出现按体例展开。

1.2 出现背景(必有,紧接定位表)

在定位表后写 2~4 句短说明(可用小标题 **出现背景**,勿写成史料长文),必须覆盖:

  1. 时间与文献:算法提出 / 关键论文发表的大致年份;有文献则给出可核对引用(作者、题名或会议/期刊、年)。
    • 开源库可写「开源约xxxx,论文 xxxx」。
    • 古典方法若无单一「发明文」,写清奠基文献或通行教科书出处,并注明「长期沿用」。
  2. 当时要解决的问题:相对出现当时的主流做法,它主要补哪块短板(一两句,禁止空泛「提高精度」)。

示意格式(粘贴后改写,勿照抄):

1
**出现背景**:……(年)由 …… 提出(文献:……)。当时 ……(旧方法痛点),该方法旨在 ……(它补的那一块)。

文献的完整条目可放文末「参考文献」;此处用短引即可,与文末一致。

2. 直觉与比喻(难点前置)

对 1~3 个核心难点各给一个比喻,并配图(可选):

常见难点类型 比喻方向(示例,可替换)
把分数压成概率 缓坡闸门、软开关
间隔 / 边界 最宽安全通道
距离 / 邻域 找最近的邻居投票
似然 / 损失 「解释这批观测有多顺口」

比喻后必须落回符号:$z$、$p$、$\beta$ 等。

3. 核心链路(公式最小集)

按计算顺序写,而不是按教科书章节名堆砌:

  1. 特征如何合成中间量(线性打分、距离、树路径…)
  2. 中间量如何变成可解释输出(Sigmoid、Softmax、硬分配…)
  3. 参数如何从数据得到(闭式解 / 迭代优化 / 懒学习无训练)
  4. 如何从输出做决策(阈值、argmax、簇标签)

每个子节:简短直觉 → 公式 → 一句「读参数时看什么」。

4. 手算完整实例(硬性:头对头走完全程)

禁止只给某一中间量的「量级示意」(例如只算一轮 $\alpha$、只算一次距离、只写一次梯度更新)。
手算节必须是同一批小数据上的完整实例:从特征收集到最终预测/分配,读者可逐步复核,并据此理解整段算法逻辑。

4.1 必须覆盖的阶段(按顺序写,可合并小节但不可缺环)

阶段 写什么 验收
A. 问题与原始表 场景一句话 + 完整样本表(每个样本的特征取值 + 标签/无监督目标);样本数宜小(常见 3~8 行),特征维数宜少(常见 1~3 维) 读者能指着某行说「这是样本 $i$」
B. 初始化 权重 / 中心 / 参数初值 / 邻域设定等——算法第一步要用的量,全部给出数值 与核心链路公式中的符号一一对应
C. 训练过程 按算法真实步骤写出中间量(打分、错误率、残差、距离、簇分配等),每个关键公式代入本例数字 任取一步可手算复核
D. 得到可部署对象 最终留下什么:$\beta$、${\alpha_m,h_m}$、簇中心、树规则等;用表或短列表钉死 预测节只引用这里的对象,不另起炉灶
E. 预测 / 推断 至少对 1 个训练内样本复核 + 1 个新样本(或留出样本) 走完决策;写出中间分与最终类别/数值/簇号 说清「新样本不需要哪些训练期量」(如 AdaBoost 的 $w_i$ 仅训练用)

数字要朴素:中间结果以手算或心算量级为宜;需要开方/对数时,可保留 2~3 位小数并注明近似。

4.2 迭代类算法:至少明确展示 2 轮

下列情形视为方法设计含迭代(Boosting 轮次、EM、K-Means 轮、梯度下降步、坐标下降等),手算实例至少完整写出 2 轮(或 2 步)

  1. 第 1 轮:输入状态 → 本轮更新 → 更新后的状态(权重/参数/分配)
  2. 第 2 轮:承接上一轮状态 → 再更新 → 再得到状态
  3. 然后进入 D / E:用(至少)这两轮得到的对象做合成预测或最终分配

只写「第 $m$ 轮公式 + 一个 $\epsilon$ 代入」而不写出第 2 轮状态如何变——不合格
若完整收敛需要很多轮,教学实例可在第 2 轮后停止,并一句说明「实装会继续到 $M$ / 收敛;此处为展示逻辑截断」。

懒学习(如 KNN)无显式训练迭代:跳过「多轮」,但 A → 距离表 → 投票/加权 → E 对新点预测 仍须头对头完整。
闭式解(如部分线性模型):无迭代则写清「一次算参 → 代入预测」,仍须含 A 与 E。

4.3 推荐排版

  • 同一张样本表贯穿全文实例,勿中途换数据。
  • 每一轮用小标题 **第 1 轮** / **第 2 轮**,轮内用短表列出「样本 | 关键中间量 | 对错或残差 | 更新后权重/归属」。
  • 预测节单独成段,公式与数字并排,例如先写 $H(x)=\mathrm{sign}(\sum_m \alpha_m h_m(x))$,再代入本例的 $\alpha_1,\alpha_2$ 与 $h_1(x),h_2(x)$。
  • 若另附代码,代码须能复现同一张表上的结论,或明确写「代码用公开数据集,与手算表无关」。

4.4 训练逻辑与流向保真(硬性,防误导)

手算示例的每一步更新,必须与该算法真实训练时的目标与方向一致;允许省略工程细节(直方图实现、有序提升全量、GPU 等),禁止为凑整数而改写更新方向、拟合目标或决策规则。

生成与自检时逐条核对:

  1. 拟合目标对:本轮树/参数在拟合什么(残差、负梯度、加权分类误差、分布参数得分等),表中数字必须由该目标算出,不能拿「看起来像标签」的量顶替。
  2. 更新方向对:叶值 / 步长 / 权重增减必须沿损失下降或算法规定方向;若多数样本残差绝对值逐轮变大,先怀疑示例写反,再查是否选用了劣分裂(劣分裂须显式说明,且整体损失仍应不增或说明截断原因)。
  3. 依赖流向对:写清本轮读哪些量、写出哪些量;冻结量勿每轮偷改;预测禁用的训练期量(如 $w_i$)不得混进推理。
  4. 符号语义对:$y$、编码特征 $\phi$、预测 $F$、残差 $r$ 等禁止混用;叶值必须由本轮目标导出(如残差均值 / 正则叶公式),禁止「示意 ±0.2」这类与目标无关的常数。
  5. 前后可对账:每轮后可用平方残差和、加权误差、似然等一句点明「相对上轮是否改善」;若教学截断导致个别点变差,须说明整体指标走势。
  6. 勿过度精简特征性训练:手算可为小数据、浅基学习器,但须保留该算法在真实训练中的特征性参数与迭代形态。禁止为图省事长期冻结本应被学习的核心量(例如 NGBoost 只提升 $\mu$ 却把 $\sigma$ 写死为 $1$ 且不说明),以致读者看不到真实应用中的参数训练过程;若必须截断,须在正文标明截断点,且截断不得抹掉该算法相对近邻方法的主差异。

后续每写一篇新手算或改动手算数字,发布前必做 §4.5 的两轮确认;不得只写完一遍就交差。

4.5 手算完成后的两轮确认(硬性)

手算示例新增或改动后,必须完成下面两轮确认;任一轮未过 → 不得定稿。两轮目的不同,禁止用「感觉对」合并成一轮。

第 1 轮确认:算术与表间一致性(算得对)

离开正文叙述,仅用样本表与公式独立重算一遍(可用纸笔或一次性脚本,但结果须与正文表逐格对照):

  1. 初始化量:全局均值、先验、$F_0$、权重初值等是否由本表直接算出(禁止随手整数顶替,如把 $\bar y=4/3$ 写成 $1$)。
  2. 每一轮:中间量(残差/得分/权重/距离等)→ 叶值或更新量 → 更新后状态,逐步代入可复核。
  3. 预测节:训练内复核与新样本路径所用阈值、叶值、编码与 C/D 钉死的对象一致。
  4. 若迭代类展示了 2 轮:第 2 轮输入必须严格等于第 1 轮输出,禁止两轮表各写各的。

第 2 轮确认:算法核心原理保真(讲得对)

在数字已对齐的前提下,对照该篇核心链路再审一遍示例是否在演示真问题,而不是数字碰巧自洽的假流程:

  1. 示例是否突出本算法相对近邻方法的关键差异(如 CatBoost 的有序 $\phi$、LightGBM 的 bin 边界、NGBoost 的分布参数、AdaBoost 的权重更新)。
  2. 拟合目标与更新规则是否仍是算法本体(残差均值 / 自然梯度 / 加权误差等),无「示意常数」「拍脑袋阈值」且未说明来源。
  3. 树/ stump 若有切分:阈值或候选是否按算法规则选出(或显式写出候选比较);禁止无来源的魔法数。
  4. 读者按表示例走完后,应能复述「这一步在优化什么、下一轮输入是什么」——若只能感到「数字在变」而不能对应原理,示例不合格,须重写数据或步骤。
  5. 是否保留了真实训练中的特征性参数迭代(见 §4.4 第 6 条);若有冻结,是否已标明且未抹掉主差异。

记录建议(作者侧):在当日 AutoLogDate 或草稿备注中简记「手算两轮确认:算术过 / 原理过」;未记视同未做。

4.6 反例(作者自检时对照)

不合格写法 为何不合格
只给 $\epsilon=0.25\Rightarrow\alpha\approx0.55$ 缺样本表、缺弱学习器、缺权重更新、缺第 2 轮、缺预测
只写「对 $x$ 算到三个邻居」却无邻居的特征与标签表 读者无法复核距离与投票
训练写很全,预测一句「取 sign 即可」 未展示新样本如何得到最终类别;易误解训练期权重是否还要用
残差提升却按「特征高低」随意给 ±叶值,不取叶内残差均值 更新方向与 GBDT/Boosting 训练逻辑相反,读者会以为越训残差越大是正常现象
为凑整数把学习率、叶值符号写反,或把 $y$ 当残差拟合 数字好看但流向错误,属于误导性示例
全局均值等初始化未用本表重算(如 $\bar y$ 随手写成整数) 算术未过第 1 轮确认;读者会失去对全文数字的信任
数字自洽但未演示关键机制(有序编码、bin、分布参数等被跳过) 算术或可通过,原理未过第 2 轮确认
为「好看」冻结本应学习的核心参数(如 NGBoost 固定 $\sigma=1$ 只抬均值) 过度精简,无法反映真实应用中的多参数训练与迭代

5. 适用 / 不适用

硬性:不得只写笼统的「适合中小数据 / 不适合复杂任务」。必须按下面三维逐条标注;每一维都要同时给出「适用边界」「不适用边界」,且各举一个具体例子(教学示意即可,禁止空泛形容词堆砌)。

5.1 三维分别指什么

维度 写什么 常见检查点
特征 输入 $X$ 长什么样才合理 类型(数值/类别/文本/图像)、尺度与标准化、缺失、维数、线性可分性 / 是否可定义有意义距离、交互是否极强
训练目标 标签 $y$(或无监督目标)要什么形态、输出要什么 二分类 / 多分类 / 回归 / 聚类;要不要概率;要不要系数或规则解释;代价是否不对称
训练数据 样本集合有什么约束 样本量相对维数、类别平衡、噪声与异常值、是否需全量驻留内存、分布是否稳定

无监督算法没有「标签 $y$」时:训练目标一行改为写「要发现的结构」(如簇、密度、降维坐标),仍须给适用/不适用各一例。

5.2 正文推荐表(直接可粘贴改写)

默认用一张表六行(三维 × 适用/不适用)。列固定为:

1
| 维度 | 判定 | 要求或边界(写清条件) | 具体例子(帮助对照) |

填写约束:

  1. 要求或边界:用可核对的条件句(「特征需…」「标签应…」「样本量大约…」),避免「比较合适」「效果不好」这类无法对照的话。
  2. 具体例子:一个可想象的业务或教学场景 + 为什么符合/不符合该行条件;每行一个,不要多行共用同一个空例子。
  3. 适用与不适用成对出现:同一维度两行对照,读者能一眼看到「踩线在哪」。

示意(作者填写时换成当前算法,下表仅示范格式,勿照抄进正文当事实):

维度 判定 要求或边界(写清条件) 具体例子(帮助对照)
特征 适用 例:…
特征 不适用 例:…
训练目标 适用 例:…
训练目标 不适用 例:…
训练数据 适用 例:…
训练数据 不适用 例:…

若某维对当前算法几乎无约束,仍保留该行,写明「无额外硬约束」并给一个「为何仍建议看一眼」的轻量例子,避免读者误以为该维可以忽略。

5.3 可选:三维速查列表

表格之外可用三条加粗小标题复述(特征 / 训练目标 / 训练数据),每条下各 1 句适用 + 1 句不适用;例子仍以表内为准,列表不重复展开长故事。

6. 优缺点与常见坑

优点不超过 5 条;缺点与坑要对着写(如:可解释性强 ↔ 非线性弱)。
坑优先写从业者真会踩的:特征未标准化、阈值死守 0.5、把概率当确定、共线性、类别极度不平衡。

7. 最小可运行示例 + 重要配置参数(推荐;有主流库时建议必写)

本节两块缺一不可(有可运行库时):跑通代码 + 实务配置表。不展开大段工程脚手架。

7.1 基础可运行代码

  • sklearn / 官方库 10~40 行即可;注释写清输入、输出、示例里出现的关键参数。
  • 若与上文手算表不是同一数据,文末一句注明「与手算表无关」。

7.2 重要配置参数(硬性,紧接代码)

在代码后用小标题 ### 重要配置参数(或 ### 7.2 …),用一张表列出该模型在真实训练中最常拧的参数(一般 4~8 个,宁精勿滥;禁止把官方全部超参抄进正文)。

表头固定为:

1
| 参数(库内常用名) | 训练中的作用与影响 | 参考起点 / 常用范围 | 配置指导 |

填写约束:

  1. 作用与影响:写清拧大/拧小会怎样(欠拟合、过拟合、变慢、更稳、更偏某类等),禁止只写「控制复杂度」这类空话。
  2. 参考起点:给可执行的默认起点或区间(如 learning_rate∈[0.01,0.1]);注明「视数据而定」。
  3. 配置指导:何时优先动它、常与谁联动(如树棵数 ↔ 学习率)、是否建议早停/交叉验证。
  4. 参数名与正文所用库一致(sklearn / xgboost / lightgbm / catboost 等);同一概念多库异名可在格内括注。
  5. 系列概述文可不写本节;单算法专篇有主流实现时建议必写。

8. 和近邻算法怎么挑(可选)

2~4 个对照(如 Logistic vs 线性回归 vs SVM vs 树模型),按条件选型,不排名踩一捧一。

9. 小结

3~5 条子弹:链路回顾 + 何时优先用 + 最易踩的一个坑。语气收束,不用「综上所述」。

10. 参考文献(可选)

论文 / 教材章节 / 官方文档。宁缺毋滥。

数学与符号约定

  • 全文公式用 LaTeX:行内 $...$,独立 $$...$$
  • 概率写 $P(y=1\mid x)$;参数统一用 $\beta$ 或 $\mathbf{w}$,文内选定一种后不混用。
  • 向量加粗:$\mathbf{x}$;标量普通。
  • 首次出现的符号用一句话定义;不要默认读者记得「GLM」「MLE」全称。

配图约定

  • 默认科普漫画 / 扁平示意,少用纯抽象渐变。
  • 生成方式(硬性):用文生图关键词调用大模型出图;禁止用 Python/PIL/matplotlib 等代码绘图充当正式插图。
  • 提示词须写清:构图、左右/时间线结构、必须可读的中文文案、科普漫画风格、白底或柔和底。
  • 文件名:{算法短名}-fig{序号}-{英文短义}.png(或 .svg);禁止空格,词间用 -
  • 正文引用:![图注](./同名目录/文件名);路径中的目录名同样无空格。
  • 一张图只承载一个教学点;图注说明「对应文中第几步」。
  • 若生成图中文糊字/乱码,优化关键词后重新文生图,不要改用代码重绘凑合。

质量自检清单

  • 第二节为「一句话定位」:含定位表 + 出现背景(时间/文献 + 当时要解决的问题)
  • 无「说人话 / 给普通人 / 小白 / 零基础也能懂」等降智腔与空响营销词
  • 开场是具体问题,无宏大叙事
  • 正文无「见范式 / 结构说明见」类句子
  • 难点有比喻,且比喻已映射回符号
  • 公式最小集完整
  • 手算完整实例:同一张样本表贯穿;含 A 原始表 → B 初始化 → C 训练 → D 可部署对象 → E 预测(含至少 1 个新样本或留出样本)
  • 数字可逐步复核;无「只演示单阶段量级」的切片示例
  • 若算法含迭代:至少明确写出 2 轮状态如何更新,再进入预测
  • 训练逻辑保真:拟合目标、更新方向、量依赖流向与真实训练一致;叶值/步长由本轮目标导出,无「示意常数」顶替;整体损失/残差指标走势可解释
  • 手算两轮确认:第 1 轮算术与表间一致性独立重算通过;第 2 轮对照核心链路确认示例能反映算法关键原理(含特征性参数的真实迭代,无不当冻结)
  • 预测节写清哪些量仅训练期使用(避免把 $w_i$ 等误当成推理输入)
  • 有适用与不适用;且按特征 / 训练目标 / 训练数据三维成对标注
  • 三维每一行都有可核对条件 + 独立具体例子
  • 缩写体例符合项目约定
  • 配图路径相对正文可解析;图注清楚
  • .md / 配图目录 / 图片文件名均无空格
  • 有「最易踩的坑」至少一条
  • 代码(若有)可独立跑通或明确依赖;若与手算表无关须注明
  • 重要配置参数表:4~8 个关键参数;含作用影响、参考起点、配置指导

迭代记录(作者备注)

版本 日期 变更
v0.1 2026-07-29 初版:结构骨架 + 禁区 + 与工具范式边界;样例对齐 Logistic回归重写稿
v0.2 2026-07-29 命名硬性:文件/目录/图片名禁止空格;样例改名为 Logistic回归
v0.3 2026-07-29 第二样例:KNN 专篇按骨架重写;文件名收束为 1201.机器学习-算法-KNN.md
v0.4 2026-07-29 「适用/不适用」强制三维(特征/训练目标/训练数据)+ 每行具体例子;回写 Logistic、KNN
v0.5 2026-07-29 「人话定位」统一为「一句话定位」;禁止说人话/给普通人等降智腔措辞
v0.6 2026-07-29 Boosting 四篇按骨架回写:AdaBoost / GBDT / XGBoost / LightGBM;修正文件名空格与拼写
v0.7 2026-07-29 增补 CatBoost、NGBoost;Boosting 专篇按发展顺序重编号 1→6
v0.8 2026-07-29 「一句话定位」必含出现背景:发表时间/文献 + 当时要解决的问题;回写已对齐样例
v0.9 2026-07-29 增补系列概述体裁:Boosting-0.概述 横向对比六法脉络与短板链
v1.0 2026-07-29 手算节升级为头对头完整实例(特征表→预测);迭代类至少展示 2 轮;自检清单同步
v1.1 2026-07-29 配图硬性:大模型文生图;禁止 Python 代码绘图充当正式插图
v1.2 2026-07-30 §7 增补「重要配置参数」表(作用影响 / 参考起点 / 配置指导);回写已对齐专篇
v1.3 2026-07-30 手算硬性:训练逻辑与流向保真(拟合目标/更新方向/依赖流);禁示意叶值误导;自检清单同步;回写 CatBoost 残差 stump
v1.4 2026-07-30 手算新增/改动后强制两轮确认(算术一致性 + 核心原理保真);自检清单与反例同步
v1.5 2026-07-30 手算禁止过度精简特征性参数训练;回写 NGBoost 联立提升 $\mu$ 与 $\log\sigma$

后续若发现某类算法(如无监督、强化学习)骨架不够用,在本表追加「裁剪规则」,避免为特例推翻主骨架。

系列概述体裁(裁剪规则)

当同一族算法 ≥3 篇专篇时,可增 {系列}-0.概述.md:以发展脉络 + 横向对比 + 选型速查为主,不重复专篇公式推导;定位表与出现背景写「这一族」而非单个算法;专篇索引表可列文件名。单算法专篇仍禁止互引「见范式」。

-------------本文结束感谢您的阅读-------------