Math-09.特征预处理与变换-20.领域特化预处理

本页汇总领域特化预处理——通用 02–06 在各模态上的具体化。

段末注释迁移学习(transfer learning)中常用源域预处理统计量(如 ImageNet 均值方差);目标域分布差异大时应重新估计或使用域自适应。

系列入口00.系列规划 | 前置:10 Pipeline


1. 计算机视觉(D2–D3)

图 1 图像预处理链

典型流程:

$$
x’ = \frac{x / 255 - \boldsymbol{\mu}}{\boldsymbol{\sigma}}
$$

策略 $\boldsymbol{\mu}, \boldsymbol{\sigma}$ 场景
ImageNet 统计 [0.485, 0.456, 0.406] 等 预训练权重微调
数据集自身 train 上按通道估计 从头训练、域差大
/255 only 某些检测/分割

增强(翻转、裁剪)属 Math-08/04,与归一化正交。


2. NLP(D3)

图 2 文本 → 张量

步骤 说明
规范化 大小写、Unicode
分词 BPE、WordPiece、SentencePiece
序列截断/填充 max_len、attention mask
位置编码 正弦或可学

词表与 BPE merge 规则只在 train 语料 fit;与 scaler 泄漏同理。


3. 表格与组学(D7)

图 3 表格 vs 组学

领域 特化预处理 注意
表格风控 Winsorize + Target Enc + GBDT 时间切分
RNA-seq $\log_2(n+1)$、CPM/TPM、可选 quantile 文库大小归一
蛋白组 分位数对齐、缺失 MNAR 批次效应
单细胞 库大小回归、HVG 选择 稀疏 count
酶活性 assay plate 内 z-score、对照扣空白 实验设计
质谱 基线校正、总离子流归一 仪器漂移
推荐 对数变换交互频率 隐式反馈

4. 深度模型内归一化(D6)

作用
BatchNorm mini-batch 内减均值除方差
LayerNorm 特征维归一(Transformer)
GroupNorm 小 batch 视觉

推理时用 running stats(BN)或当前输入统计(LN)——train/eval 模式切换(Math-08/04)。


5. 局限(D8)

图 4 领域预处理陷阱

陷阱 说明
ImageNet norm 用于医学 X 光 域差大,应自算
测试集文本进 BPE 词表 泄漏/污染
组学 batch 混训混归一 批次 confound
忽略单位 浓度 µM vs mM

6. PyTorch 视觉示例(D12)

1
2
3
4
5
6
7
8
9
10
11
12
import torch
from torchvision import transforms

# 微调 ImageNet 预训练
tf_train = transforms.Compose([
transforms.RandomResizedCrop(224),
transforms.RandomHorizontalFlip(),
transforms.ToTensor(),
transforms.Normalize(mean=[0.485, 0.456, 0.406],
std=[0.229, 0.224, 0.225]),
])
# 服务阶段 eval 用同一 Normalize,增强去掉

7. 小结

Math-09 特征预处理与变换 系列:通用 scaler/变换 + Pipeline 纪律 + 领域默认,构成 ML 数据层的完整地图。

系列导航00 规划 | 01 总论 | Math-08 泛化

-------------本文结束感谢您的阅读-------------