Math-00.数学分布-40.极限与近似关系

本文汇总 Math-00 数学分布 系列中各分布之间的极限与近似关系,回答「何时可用简单分布替代复杂分布」——这是选择检验方法、样本量规划与近似推断的理论依据。

段末注释CLT(central limit theorem)为中心极限定理;LLN(law of large numbers)为大数定律。

读前说明:本篇为关系专论,不对应单一分布的 PMF/PDF;下文给出核心极限公式。系列:00 规划 | 01 总论


1. 为什么需要极限近似

图 1 分布极限关系总览

精确计算往往复杂:二项 PMF 含组合数、小样本 $t$ 检验用精确分布。当 $n$ 大或参数满足条件时,极限分布给出闭式近似,计算更快、与经典检验直接对接。


2. 收敛类型

类型 符号 含义
依分布收敛 $X_n \xrightarrow{d} X$ CDF 点点收敛
依概率收敛 $X_n \xrightarrow{p} \mu$ LLN
几乎必然 $X_n \xrightarrow{a.s.} \mu$ 强 LLN

实务中「$n$ 足够大时近似成立」指依分布收敛。


3. 核心极限公式

图 2 二项→泊松→正态链条

3.1 二项 → 泊松

若 $X_n \sim \mathrm{Binomial}(n, p_n)$,$np_n \to \lambda$($n \to \infty$,$p_n \to 0$):

$$
X_n \xrightarrow{d} \mathrm{Poisson}(\lambda)
$$

经验法则:$n \ge 20$ 且 $p \le 0.05$,或 $np < 10$ 时 Poisson 近似可用。→ 11.二项12.泊松

3.2 二项 → 正态(de Moivre–Laplace)

$n$ 大,$np$ 与 $n(1-p)$ 均 $\ge 5$:

$$
\frac{X - np}{\sqrt{np(1-p)}} \xrightarrow{d} \mathcal{N}(0,1)
$$

20.正态

3.3 泊松 → 正态

$\lambda$ 大(常 $\lambda \ge 10$):

$$
\frac{X - \lambda}{\sqrt{\lambda}} \approx \mathcal{N}(0,1)
$$

3.4 中心极限定理(CLT)

i.i.d. $X_i$,$\mathbb{E}[X_i]=\mu$,$\mathrm{Var}(X_i)=\sigma^2$:

$$
\frac{\bar{X}_n - \mu}{\sigma/\sqrt{n}} \xrightarrow{d} \mathcal{N}(0,1)
$$

3.5 t → 正态

$\nu \to \infty$:$t_\nu \xrightarrow{d} \mathcal{N}(0,1)$。→ 27.t

3.6 其他

关系 条件
$\chi^2_\nu$ → 正态 $\nu$ 大
$\mathrm{Binomial} \to \mathrm{Beta}$ 贝叶斯极限
几何 → 指数 连续化等待时间

4. 数字特征在极限下的传递

源分布 极限 期望/方差
Bin($n,p$) Po($\lambda$) $np \to \lambda$,$np(1-p) \to \lambda$
Bin($n,p$) Normal $\mu=np$,$\sigma^2=np(1-p)$
Po($\lambda$) Normal $\mu=\sigma^2=\lambda$
$\bar{X}_n$ Normal $\mu$ 不变,$\mathrm{Var}(\bar{X}_n)=\sigma^2/n$

5. 分布族关系图

图 3 适用场景

1
2
3
4
5
6
7
8
9
10
11
Bernoulli(p)
↓ n 次独立
Binomial(n,p) ──n大,p小,np=λ──→ Poisson(λ) ──λ大──→ Normal
│ ↑
└──n大,np与n(1-p)均≥5───────────────┴──→ Normal(np, np(1-p))

i.i.d. 任意(有限方差) ──CLT,n大──→ Normal(μ, σ²/n) [样本均值]

Exp(λ) ──k 个独立同分布求和──→ Gamma(k,λ) ──k大──→ Normal

t(ν) ──ν→∞──→ Normal(0,1)

6. 前提假设(各近似通用)

每种极限/近似都有独立前提,使用前须逐条核对:

近似 核心前提 常见失效
二项 → 泊松 $n\to\infty,,p\to 0,,np\to\lambda$ $n$ 小或 $p$ 不小
二项 → 正态 $n$ 大,$np$ 与 $n(1-p)$ 均 $\ge 5$(经验) $p$ 极端小样本
泊松 → 正态 $\lambda$ 大 $\lambda$ 小
$t$ → 正态 $\nu\to\infty$ 小 $\nu$ 厚尾
超几何 → 二项 $N\gg n$ $n/N$ 大
CLT i.i.d. 有限方差,$n$ 大 厚尾/强相关

段末注释:近似是计算便利而非理论替代;边界情形应优先精确分布或模拟。


7. 适用场景

场景 用哪种近似
稀有事件计数 Bin → Poisson
大样本比例 Z 检验 Bin → Normal
RNA-seq 大 $\lambda$ 基因 Poisson → Normal
样本均值置信区间 CLT → Normal
小样本 $\sigma$ 未知 t,勿强行 Normal

8. 局限与误用

图 4 近似失效情形

误用 后果
$np$ 过小仍用正态 比例检验 I 类错误失真
Poisson 过离散仍用 Poisson 低估方差 → 假阳性
偏态/重尾用 CLT $n$ 需更大;或改用 bootstrap
小 $\nu$ 用 Z 代替 t 置信区间过窄
忽略连续性校正 离散→连续近似偏差

连续性校正(二项→正态):

$$
P(X \le k) \approx \Phi\left(\frac{k + 0.5 - np}{\sqrt{np(1-p)}}\right)
$$


9. 何时用精确 vs 近似

条件 建议
$n \le 30$,$p$ 近 0/1 精确二项
$np < 5$ 或 $n(1-p) < 5$ 精确二项或 Poisson
$n$ 大,$0.1 < p < 0.9$ 正态近似 + 连续性校正
$\sigma$ 未知,$n$ 小 t 检验
任意分布,$n$ 大 CLT 用于 $\bar{X}$

10. 数值演示

场景:比较 Bin(100, 0.05) 与 Poisson(5)、Normal(5, 4.75) 的 PMF/CDF。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

n, p = 100, 0.05
lam = n * p
k = np.arange(0, 15)

binom_pmf = stats.binom.pmf(k, n, p)
poisson_pmf = stats.poisson.pmf(k, lam)
# normal approx with continuity correction on CDF
normal_cdf = stats.norm.cdf(k + 0.5, lam, np.sqrt(lam))

fig, axes = plt.subplots(1, 2, figsize=(12, 4))
axes[0].plot(k, binom_pmf, 'o-', label='Bin(100,0.05)')
axes[0].plot(k, poisson_pmf, 's--', label='Po(5)')
axes[0].set_title('PMF: Binomial vs Poisson'); axes[0].legend()

binom_cdf = stats.binom.cdf(k, n, p)
poisson_cdf = stats.poisson.cdf(k, lam)
axes[1].plot(k, binom_cdf, 'o-', label='Bin CDF')
axes[1].plot(k, poisson_cdf, 's--', label='Po CDF')
axes[1].plot(k, normal_cdf, '^:', label='Normal approx CDF')
axes[1].set_title('CDF comparison'); axes[1].legend()
plt.savefig('limit_bin_poisson_normal.png', dpi=150)

# CLT demo: exponential samples
rng = np.random.default_rng(42)
means = [stats.expon.rvs(size=n, random_state=rng).mean()
for n in [5, 30, 100]]
print("sample means (Exp(1)):", [f'{m:.2f}' for m in means])

11. 小结

  • Bin → Po → Normal 是离散计数最常用的近似链;条件为 $np$、$\lambda$ 足够大。
  • CLT 保证样本均值渐近正态;t 是小样本 $\sigma$ 未知的修正。
  • 近似前检查条件;不满足时用精确检验或 bootstrap。

系列导航01 总论 | 11.二项 | 20.正态


参考文献

  1. Feller W. An Introduction to Probability Theory and Its Applications.
  2. scipy.stats 各分布文档
-------------本文结束感谢您的阅读-------------