本页汇总领域特化预处理——通用 02–06 在各模态上的具体化。
段末注释:迁移学习(transfer learning)中常用源域预处理统计量(如 ImageNet 均值方差);目标域分布差异大时应重新估计或使用域自适应。
系列入口:00.系列规划 | 前置:10 Pipeline
1. 计算机视觉(D2–D3)

典型流程:
$$
x’ = \frac{x / 255 - \boldsymbol{\mu}}{\boldsymbol{\sigma}}
$$
| 策略 | $\boldsymbol{\mu}, \boldsymbol{\sigma}$ | 场景 |
|---|---|---|
| ImageNet 统计 | [0.485, 0.456, 0.406] 等 | 预训练权重微调 |
| 数据集自身 | train 上按通道估计 | 从头训练、域差大 |
| /255 only | 无 | 某些检测/分割 |
增强(翻转、裁剪)属 Math-08/04,与归一化正交。
2. NLP(D3)

| 步骤 | 说明 |
|---|---|
| 规范化 | 大小写、Unicode |
| 分词 | BPE、WordPiece、SentencePiece |
| 序列截断/填充 | max_len、attention mask |
| 位置编码 | 正弦或可学 |
词表与 BPE merge 规则只在 train 语料 fit;与 scaler 泄漏同理。
3. 表格与组学(D7)

| 领域 | 特化预处理 | 注意 |
|---|---|---|
| 表格风控 | Winsorize + Target Enc + GBDT | 时间切分 |
| RNA-seq | $\log_2(n+1)$、CPM/TPM、可选 quantile | 文库大小归一 |
| 蛋白组 | 分位数对齐、缺失 MNAR | 批次效应 |
| 单细胞 | 库大小回归、HVG 选择 | 稀疏 count |
| 酶活性 assay | plate 内 z-score、对照扣空白 | 实验设计 |
| 质谱 | 基线校正、总离子流归一 | 仪器漂移 |
| 推荐 | 对数变换交互频率 | 隐式反馈 |
4. 深度模型内归一化(D6)
| 层 | 作用 |
|---|---|
| BatchNorm | mini-batch 内减均值除方差 |
| LayerNorm | 特征维归一(Transformer) |
| GroupNorm | 小 batch 视觉 |
推理时用 running stats(BN)或当前输入统计(LN)——train/eval 模式切换(Math-08/04)。
5. 局限(D8)

| 陷阱 | 说明 |
|---|---|
| ImageNet norm 用于医学 X 光 | 域差大,应自算 |
| 测试集文本进 BPE 词表 | 泄漏/污染 |
| 组学 batch 混训混归一 | 批次 confound |
| 忽略单位 | 浓度 µM vs mM |
6. PyTorch 视觉示例(D12)
1 | import torch |
7. 小结
Math-09 特征预处理与变换 系列:通用 scaler/变换 + Pipeline 纪律 + 领域默认,构成 ML 数据层的完整地图。
系列导航:00 规划 | 01 总论 | Math-08 泛化