Math-07.贝叶斯推断-02.MLE与MAP

本页讲解 MLE(maximum likelihood estimation,最大似然估计)与 MAP(maximum a posteriori,最大后验估计)——贝叶斯与经典 ML 的交汇点。

段末注释MLE 求 $\hat{\theta}{\mathrm{MLE}} = \arg\max\theta p(D \mid \theta)$;MAP 求 $\hat{\theta}{\mathrm{MAP}} = \arg\max\theta p(\theta \mid D) = \arg\max_\theta p(D \mid \theta),p(\theta)$。

系列入口00.系列规划 | 前置:01 总论Math-00/50 损失


1. MLE(D2–D3)

图 1 似然峰值即 MLE

$$
\hat{\theta}{\mathrm{MLE}} = \arg\max\theta \ p(D \mid \theta) = \arg\max_\theta \ \log p(D \mid \theta)
$$

模型 似然 MLE 等价损失
高斯噪声回归 $y \sim \mathcal{N}(w^\top x, \sigma^2)$ MSE
二分类 logistic $y \sim \mathrm{Bernoulli}(\sigma(w^\top x))$ 交叉熵
Poisson 计数 $y \sim \mathrm{Poisson}(\lambda)$ Poisson NLL

MLE 无先验 → 数据多时与 MAP 接近;小样本易过拟合(Math-08/02)。


2. MAP(D3)

图 2 先验把峰值拉向先验均值

$$
\hat{\theta}{\mathrm{MAP}} = \arg\max\theta \ \big[\log p(D \mid \theta) + \log p(\theta)\big]
$$

对数后验 = 对数似然 + 对数先验(差一常数)。


3. L2 正则 = 高斯先验 MAP(D6)

设 $w \sim \mathcal{N}(0, \tau^2 I)$,线性回归高斯似然:

$$
\log p(w \mid D) \propto -\frac{1}{2\sigma^2}|y - Xw|^2 - \frac{1}{2\tau^2}|w|^2
$$

MAP 等价于 RidgeMath-08/03):

$$
\min_w |y - Xw|^2 + \lambda |w|^2, \quad \lambda = \frac{\sigma^2}{\tau^2}
$$

先验 MAP 等价
高斯 $w \sim \mathcal{N}(0, \tau^2 I)$ L2 / Ridge / weight decay
Laplace $w \sim \mathrm{Laplace}(0, b)$ L1 / Lasso
无先验(均匀,非正规) MLE

正则化强度 $\lambda$ ↔ 先验精度 $1/\tau^2$。


4. 跨领域例子(D7)

图 3 MLE/MAP 应用

领域 估计方式 说明
统计建模 MLE + 渐近标准误 大样本置信区间
深度学习 MLE + weight decay AdamW 即 MAP 近似
NLP 预训练 MLE(下一词预测) billions 数据,先验影响弱
小样本微调 MAP / 强 L2 防 catastrophic forgetting
基因组 GWAS Lasso MAP(Laplace 先验) 稀疏因果 SNP
传感器融合 Kalman 滤波 高斯先验 + 线性高斯 = 递推 MAP/后验
Spam 过滤 朴素贝叶斯 MAP 多项式先验 + 词频似然

5. MLE vs MAP 选型(D7–D8)

图 4 局限

情况 建议
数据 $n \gg$ 参数 $p$ MLE 通常足够
$n$ 小或 $p$ 大 MAP / 正则
需完整不确定性 全后验(非仅 MAP)→ 05 VI
先验难定 弱信息先验或经验 Bayes
多峰后验 MAP 可能误导(只取众数)

MLE 不变性:变换参数后 MLE 不一定不变;贝叶斯后验在适当变换下更一致(Jeffreys 先验等,进阶话题)。


6. NumPy 示例:Ridge = MAP(D12)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
import numpy as np

rng = np.random.default_rng(0)
n, d = 80, 20
X = rng.standard_normal((n, d))
w_true = rng.standard_normal(d) * 0.5
y = X @ w_true + 0.1 * rng.standard_normal(n)

# MLE (lambda=0)
w_mle = np.linalg.lstsq(X, y, rcond=None)[0]

# MAP / Ridge
lam = 1.0
w_map = np.linalg.solve(X.T @ X + lam * np.eye(d), X.T @ y)

print("||w|| MLE:", np.linalg.norm(w_mle), "MAP:", np.linalg.norm(w_map))

MAP 解的 $|w|$ 更小 → 先验收缩效应。


7. 小结

MLE 是频率派基石;MAP 是「带先验的 MLE」,与 L1/L2 正则 一一对应。下一篇:03 共轭先验

系列导航01 总论 | Math-08/03 L2

-------------本文结束感谢您的阅读-------------