
流行误解
贝叶斯更新常被听成:
- 有公式就是客观,先验随便填。
- 等于永远不下结论,一直改概率。
- 和「用数据说话」是一回事,有表格就行。
核心纪律其实是:先验要可辩护;证据要用「若假设为真/假,多容易看到这些数据」来加权;后验是暂时的工作信念,不是永恒真理。
定义
贝叶斯更新(Bayesian updating):在假设空间上维持信念(先验),观察到证据后,按各假设对证据的似然进行重加权,得到后验;后验可作为下一步的先验。决策可基于后验与损失函数,而不是单次「显著/不显著」口号。
离散直觉(不必先上全套测度论):
[
P(H\mid E)=\frac{P(E\mid H),P(H)}{P(E)}
]
其中 (P(H)) 为先验,(P(E\mid H)) 为似然,(P(H\mid E)) 为后验。
段末注释:先验(prior) 是见证据前的信念;似然(likelihood) 是假设下看到证据的容易程度;后验(posterior) 是更新后的信念。
| 它是 | 它不是 |
|---|---|
| 证据进入信念的记账规则 | 先验乱填仍自称客观 |
| 与概率思维配套的更新步骤 | 必须手算复杂积分才能用思想 |
| 对基准率的显式尊重 | 「p<0.05 就证明假设」的替代迷信 |
史源
名称关联托马斯·贝叶斯(Thomas Bayes)与后来拉普拉斯等人的概率逆问题:由结果推原因的可信度。现代在诊断、垃圾邮件、A/B、追踪与风险管理中广泛使用。它要对付的诱惑是:证据来了信念不动,或无基准率地被单次阳性吓到/兴奋到。
适用场景
值得用:
- 诊断与排障:罕见故障 vs 常见误报
- 实验与投放:小样本结果如何改你对效应的信念
- 情报与审核:多源线索的综合,而不是「最新一条说了算」
- 个人判断校准:显式写下更新前后的置信
先别用 / 慎用:
- 似然完全拍脑袋且不敏感性分析
- 假设空间漏掉真原因(更新再漂亮也在错集合上归一化)
- 用贝叶斯话术回避该做的随机对照与测量设计
应用步骤
- 列互竞假设 (H_1,H_2,\ldots)(尽量完备;做不到就承认有「其他」桶)。
- 写先验:比例或排序;来自基准率、历史、约束;写来源。
- 写证据 (E):观测要具体(日志模式、指标、实验结果)。
- 估似然:对每个 (H),(P(E\mid H)) 相对大小;可用「很易/一般/很难看到 E」。
- 更新:重加权并归一化得后验;记录从先验到后验动了多少。
- 决策/再取样:若后验仍跨行动阈值,设计下一份最能区分假设的证据(最大信息量实验),而不是重复同质数据自我安慰。
操作口令:
先验写出处;证据问「在该假设下有多容易出现」;后验只是下一轮的先验。
多域例证
医学:基准率 + 阳性
罕见病筛查阳性。无基准率时,直觉会高估患病概率。贝叶斯要求:先放患病率先验,再乘以真阳性/假阳性结构。许多「准」的检测在低先验下,阳性预测值仍然一般——这是算术,不是冷漠。
排障:新发布 vs 旧依赖
延迟升高。先验:若刚发布,回归权重高;若无发布,依赖/容量权重高。证据:错误栈、变更时间对齐、依赖侧指标。更新后决定先回滚还是先扩容——按后验排序验证,而不是按嗓门。
A/B:小样本波动
短期上扬不等于效应实锤。先验若是「多数改动近似零效应」,弱证据只把后验轻轻推离零;要更大证据或更大样本,而不是立刻全量。
例外与坑
坑 1:先验洗白
把希望写成先验,再找证据合理化——是确认偏误穿了贝叶斯外套。
坑 2:似然不对称乱调
对喜欢的假设给高似然、对讨厌的给低似然,更新必歪。做敏感性:似然在合理范围内摆动时,结论稳不稳?
坑 3:假设集合错了
真因不在列表里,后验只是「错题里的相对排名」。保持「其他/未知」桶,并定期问是否该扩空间。
用前自检
- 假设列表是否显式?有无「其他」?
- 先验来源能否说清?
- 似然是否按「证据在假设下的易见程度」估?
- 后验是否记录?下一份证据能否区分残留混淆?
- 是否在该测结构(对照、测量)时,用更新话术逃避设计?
贝叶斯更新不保证你聪明;它保证你改口时,至少有一张能给别人复核的账。