Math-00.数学分布-13.几何分布

几何分布(Geometric distribution)描述独立伯努利试验中首次成功所需试验次数(或首次成功前的失败次数),是离散版的「等待时间」模型,具有与 指数分布 类似的无记忆性

段末注释无记忆性(memoryless property)指已等待若干次失败不影响剩余等待次数的分布形态。

读前说明:离散分布,下文给出 PMF。系列:00 规划 | 前置:10.伯努利


1. 产生背景与直观

图 1 几何分布直观

每次试验成功概率 $p$,问「第几次才第一次成功」。直觉:

  • 反复 PCR 直到首次扩增成功
  • 筛库直到找到第一个活性克隆
  • 反复抛硬币直到首次正面

核心:固定 $p$,等待次数 $X$ 的分布只依赖 $p$,与已失败次数无关(无记忆)。


2. 定义与参数

两种常见参数化(文献与软件可能不同):

参数化 随机变量含义 scipy
A 首次成功失败次数 $Y$ geom(p)
B 直到首次成功总试验次数 $X$ geom(p, loc=1)

$X = Y + 1$,本文默认 A(失败次数 $Y \sim \mathrm{Geom}(p)$):

要素 内容
支撑集 ${0, 1, 2, \ldots}$
参数 $p \in (0, 1)$,单次成功概率

3. PMF 与 CDF

图 2 PMF 几何递减

3.1 PMF(失败次数 $Y$)

$$
P(Y=k) = (1-p)^k p, \quad k=0,1,2,\ldots
$$

总试验次数 $X=k+1$:$P(X=k+1)=(1-p)^k p$。

3.2 CDF

$$
F(k) = P(Y \le k) = 1 - (1-p)^{k+1}
$$

分位数:$k_q = \left\lceil \dfrac{\log(1-q)}{\log(1-p)} \right\rceil - 1$(近似)。


4. 数字特征

公式($Y$=失败次数)
期望 $\mathbb{E}[Y] = \dfrac{1-p}{p}$;$\mathbb{E}[X] = \dfrac{1}{p}$
方差 $\mathrm{Var}(Y) = \dfrac{1-p}{p^2}$
众数 $0$(最可能第一次就成功)

$p$ 越小,等待越长,PMF 尾部越重。


5. 与其他分布的关系

关系 说明
Bernoulli 每次试验底为 Ber($p$)
负二项 第 $r$ 次成功前失败数 $\sim \mathrm{NB}(r,p)$;$r=1$ 即几何 → 14.负二项
指数 连续等待时间类比 → 22.指数
Poisson 过程 事件间隔的离散版

6. 前提假设

假设 含义 违背时
独立 Bernoulli 底 每次试验独立 批次相关 → 非几何
$p$ 恒定 成功概率不变 学习/疲劳 → 时变 $p$
无试验上限 可一直重复直至首次成功 最大轮次 → 截断几何
等待首次成功 计数对象为首次成功前的失败数或总次数 固定 $n$ 次成功数 → 二项

段末注释:几何分布具有无记忆性;与 指数 分别为离散/连续等待时间模型。


7. 适用场景

图 3 适用场景

场景 示例
首次成功等待 筛库轮次、首次 PCR 成功
可靠性(离散) 第几次使用才失效(理想化)
序贯检验 SPRT 中等待边界
推荐系统 用户第几次点击才转化(粗模)

8. 局限与误用

图 4 局限

问题 说明
$p$ 不恒定 学习效应、疲劳 → 非几何
有上限轮次 截断几何
非独立试验 批次相关 → 失效
与二项混淆 固定 $n$ 次成功数 → 二项
参数化混用 读文献须确认是「失败次数」还是「总次数」

9. 参数估计与推断

9.1 MLE

观测 $n$ 个独立几何变量(失败次数)$y_1,\ldots,y_n$:

$$
\hat{p}{\mathrm{MLE}} = \frac{n}{n + \sum{i=1}^n y_i}
$$

9.2 检验


10. 示例与代码

场景:酶定向进化每轮成功概率 $p=0.05$,模拟首次成功所需轮次。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

p = 0.05
# scipy.geom: 失败次数 Y
Y = stats.geom.rvs(p, size=5000, random_state=42)
X = Y + 1 # 总试验次数

print(f"E[Y] theory={(1-p)/p:.1f}, sim={Y.mean():.1f}")
print(f"E[X] theory={1/p:.1f}, sim={X.mean():.1f}")

# 无记忆性:P(Y>2+3 | Y>2) = P(Y>3)
s, t = 2, 3
cond = stats.geom.sf(s+t, p) / stats.geom.sf(s, p)
uncond = stats.geom.sf(t, p)
print(f"P(Y>{s+t}|Y>{s})={cond:.4f}, P(Y>{t})={uncond:.4f}")

k = np.arange(0, 40)
fig, ax = plt.subplots(figsize=(8, 4))
ax.bar(k, stats.geom.pmf(k, p), alpha=0.7, label=f'p={p}')
ax.set_xlabel('failures before first success (Y)')
ax.set_ylabel('PMF'); ax.legend()
plt.savefig('geometric_pmf.png', dpi=150)

11. 小结

  • Geom($p$):首次成功前的失败次数;无记忆、PMF 几何递减。
  • $r=1$ 的负二项特例;连续类比为 Exp($\lambda$)
  • 注意 scipy 与教材的参数化(失败次数 vs 总次数)。

系列导航11.二项 | 14.负二项 | 22.指数


参考文献

  1. scipy.stats.geom
-------------本文结束感谢您的阅读-------------