Math-00.数学分布-27.t分布

Student t 分布(t-distribution)是小样本、总体方差未知时对样本均值进行推断的参考分布,t 检验的统计量即在 $H_0$ 下服从该分布。

段末注释t 检验(t-test)比较样本均值与假设值或两组均值差异,$\sigma$ 未知时用 t 分布确定临界值。

读前说明:连续分布,下文给出 PDF。系列:00 规划 | 前置:20.正态


1. 产生背景与直观

图 1 t 分布直观

1908 年威廉·戈塞特(笔名 Student)在吉尼斯啤酒厂研究小样本质量:总体 $\sigma$ 未知时,用样本标准差 $s$ 标准化均值,统计量不再服从标准正态,而呈更重尾的 t 分布。直觉:

  • 仅 5~10 次重复实验估计酶活均值
  • $\sigma$ 用 $s$ 估计带来的额外不确定性

2. 定义与参数

$T \sim t(\nu)$($\nu$ 为自由度,degrees of freedom):

要素 内容
支撑集 $(-\infty, +\infty)$
参数 $\nu > 0$(常为整数,也可推广到实数)

构造(与正态、卡方的关系):

$$
T = \frac{Z}{\sqrt{V/\nu}}, \quad Z \sim \mathcal{N}(0,1),; V \sim \chi^2_\nu,; Z \perp V
$$


3. PDF 与 CDF

图 2 t 分布 PDF 族

3.1 PDF

$$
f(t) = \frac{\Gamma\left(\frac{\nu+1}{2}\right)}{\sqrt{\nu\pi},\Gamma\left(\frac{\nu}{2}\right)} \left(1 + \frac{t^2}{\nu}\right)^{-\frac{\nu+1}{2}}
$$

3.2 性质

  • 对称,单峰,均值 0($\nu > 1$),方差 $\dfrac{\nu}{\nu-2}$($\nu > 2$)
  • $\nu \to \infty$ 时 $t(\nu) \to \mathcal{N}(0,1)$
  • 尾部比正态更厚 → 小样本推断更保守

3.3 CDF / 分位数

scipy.stats.t.cdf / ppf;双侧 95% 临界值 $t_{0.975,,\nu}$。


4. 数字特征

$\nu$ 方差 与正态对比
1 不存在(Cauchy 特例) 极重尾
2 $\infty$ 仍很重尾
5 $5/3 \approx 1.67$ 明显厚尾
30 $\approx 1.07$ 接近 $\mathcal{N}(0,1)$
$\infty$ 1 标准正态

5. 与其他分布的关系

关系 说明
正态 $\nu \to \infty$ 极限为 $\mathcal{N}(0,1)$ → 20.正态
Cauchy $t(1)$ 即标准柯西分布
F 分布 $F = \dfrac{t_1^2/\nu_1}{t_2^2/\nu_2}$(独立 t 平方比)
样本均值 $n$ 个 $\mathcal{N}(\mu,\sigma^2)$ 样本,$\dfrac{\bar{X}-\mu}{s/\sqrt{n}} \sim t(n-1)$
贝叶斯 正态–逆 Gamma 后验预测 t

6. 前提假设

假设 含义 违背时
正态总体 $X_i\stackrel{\mathrm{i.i.d.}}{\sim}N(\mu,\sigma^2)$ 厚尾/偏态 → 非参数/稳健
i.i.d. 样本 观测独立同分布 配对/重复测量 → 配对 $t$
$\sigma$ 未知 用样本标准差 $s$ 估计 $\sigma$ 已知大样本 → 正态/Z
简单随机抽样 无系统偏倚 复杂设计 → 校正/混合模型

段末注释:$\nu\to\infty$ 时 $t$ 趋近标准正态;双样本 $t$ 还需方差齐性(或 Welch 修正)。


7. 适用场景

图 3 适用场景

场景 示例
单样本 t 检验 酶活均值 vs WT($\sigma$ 未知)
双样本 t 检验 两组突变体活性比较
配对 t 检验 处理前后同一批样品
回归系数 $\hat{\beta}_j$ 的 t 统计量
置信区间 $\bar{x} \pm t_{\alpha/2,,n-1}, s/\sqrt{n}$

8. 局限与误用

图 4 局限

误用 后果
数据严重非正态仍用 t I 类错误率失真;用非参或变换
方差不齐仍用合并 t 用 Welch t
多次检验不校正 假阳性膨胀
$n$ 很大仍纠结 t vs Z 二者几乎等价,Z 可接受
忽略配对结构用独立 t 检验功效下降

9. 参数估计与推断

9.1 自由度

单样本:$\nu = n - 1$;两样本合并:$\nu = n_1 + n_2 - 2$;Welch:Satterthwaite 近似。

9.2 t 检验

单样本统计量:

$$
t = \frac{\bar{x} - \mu_0}{s / \sqrt{n}} \sim t(n-1) \quad \text{(在 } H_0: \mu=\mu_0 \text{ 下)}
$$

详见 两组数据差异显著性检验Math-01.显著性检验-02.t检验(规划)。


10. 示例与代码

场景:突变组 8 个酶活 vs 对照假设 $\mu=1$;配对与独立双样本。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
import numpy as np
from scipy import stats
import matplotlib.pyplot as plt

mutant = np.array([1.12, 1.05, 1.18, 0.99, 1.22, 1.08, 1.15, 1.01])
control = np.array([0.98, 1.02, 0.95, 1.00, 0.97, 1.03, 0.99, 1.01])

# 单样本 t 检验
t1, p1 = stats.ttest_1samp(mutant, popmean=1.0)
print(f"one-sample t vs 1.0: t={t1:.3f}, p={p1:.4f}, df={len(mutant)-1}")

# 双样本 Welch t(方差不必齐)
t2, p2 = stats.ttest_ind(mutant, control, equal_var=False)
print(f"Welch t-test: t={t2:.3f}, p={p2:.4f}")

# 配对 t
t3, p3 = stats.ttest_rel(mutant, control)
print(f"paired t-test: t={t3:.3f}, p={p3:.4f}")

# 不同自由度的 t PDF vs 正态
x = np.linspace(-4, 4, 300)
fig, ax = plt.subplots(figsize=(8, 4))
for df in [1, 3, 10, 30]:
ax.plot(x, stats.t.pdf(x, df), label=f't df={df}')
ax.plot(x, stats.norm.pdf(x), 'k--', label='N(0,1)')
ax.legend(); ax.set_title('t distribution vs Normal')
plt.savefig('t_vs_normal.png', dpi=150)

# 95% CI for mutant mean
n, m, s = len(mutant), mutant.mean(), mutant.std(ddof=1)
tcrit = stats.t.ppf(0.975, n - 1)
ci = (m - tcrit * s / np.sqrt(n), m + tcrit * s / np.sqrt(n))
print(f"95% CI for mutant mean: [{ci[0]:.3f}, {ci[1]:.3f}]")

11. 小结

  • $t(\nu)$:正态除以 $\sqrt{\chi^2/\nu}$;厚尾,小样本均值推断基准。
  • $\nu = n-1$ 时对应单样本 t;$\nu \to \infty$ → 正态。
  • 使用前检查正态性与方差齐性;非正态考虑 Welch 或非参。

系列导航20.正态 | Math-01 显著性检验


参考文献

  1. Student. The Probable Error of a Mean. Biometrika 1908.
  2. scipy.stats.t
-------------本文结束感谢您的阅读-------------