特征选择(feature selection)中,相关分析常作为 Filter 方法的第一步:保留与标签/表型相关、且彼此低冗余的属性。本篇衔接 05 偏相关与矩阵 与存量 相关分析-相关系数,并对接蛋白 ML 实践(如 酶改造-06)。
段末注释:Filter 指先用统计量(如 $|r|$)筛特征,再训练模型;与 Wrapper、Embedded 方法并列。
系列:01 总论 | 多重比较:Math-01-20
1. 属性 vs 特征(D1)

| 概念 | 含义 |
|---|---|
| 属性 | 数据集每一列(原始变量) |
| 特征 | 对预测/分类有益的属性子集 |
相关 Filter:$|r(X_j, Y)|$ 大 → $X_j$ 更可能为特征;$|r(X_i,X_j)|$ 过大 → 冗余,可删其一。
2. Filter 流程(D2–D3)

1 | 原始 p 个属性 |
Y 类型:
- 连续表型(酶活、$\log_{10}(\mathrm{activity}/\mathrm{WT})$)→ Pearson / Spearman
- 二分类(高/低活性)→ 点二列 / Phi
- 多分类 → Cramér’s V / ANOVA $\eta^2$
3. 共线性与 VIF(D4)
| 指标 | 含义 | 阈值经验 |
|---|---|---|
| $ | r_{X_i,X_j} | $ |
| VIF(variance inflation factor) | 回归中 $X_i$ 被其余 $X$ 解释程度 | $>5\sim10$ 警告 |
VIF$_i = 1/(1-R_i^2)$,$R_i^2$ 为 $X_i$ 对其余自变量回归的 $R^2$。
4. 适用场景(D5–D7)

| 场景 | 做法 |
|---|---|
| biomarker 初筛 | $ |
| PLM 嵌入维度 | 嵌入列与活性 Spearman |
| 多组学冗余 | 相关矩阵聚类去冗余 |
| 酶改造 ML | 与 酶改造-06 表征质控配合 |
5. 局限与误用(D8)

| 误用 | 后果 |
|---|---|
| 全数据做相关再划分 train/test | 数据泄漏 |
| 只 Filter 不验证模型 | 漏非线性特征 |
| 不 FDR | 高维假阳性 |
| $ | r |
| 相关特征当因果 | 错误生物学解读 |
正确做法:在训练集内算 $r$、选特征;测试集仅评估最终模型。
6. 示例代码
1 | import numpy as np |
7. 小结
- Filter 特征选择:标签相关(+FDR)→ 特征间去冗余 → 下游建模。
- 必须在训练集内完成;共线性用 $|r|$ 或 VIF 诊断。
- 与 Wrapper(RFE)、Embedded(Lasso)可串联,相关 Filter 成本低、可解释。
参考文献
- Guyon I., Elisseeff A. An Introduction to Variable and Feature Selection. JMLR 2003.
- sklearn.feature_selection