抗体-04.工具-01.抗体亲和力预测工具调研综述

抗体–抗原亲和力(Antibody–Antigen Affinity) 是衡量免疫识别强度与 therapeutic 候选分子质量的核心指标。结合的热力学与动力学基础、各结构域在互作中的分工,见前置 抗体-03.互作-01.抗体抗原互作原理介绍;影响亲和力的环境与分子因素见 抗体-03.互作-02.影响亲和力的因素。湿实验(表面等离子体共振,Surface Plasmon Resonance,SPR生物膜层干涉,Biolayer Interferometry,BLI 等)仍是金标准,但通量与成本限制了早期筛选规模;计算机辅助(in silico) 预测因此成为抗体发现、亲和力成熟(affinity maturation) 与逃逸突变分析的重要补充。本文按「测什么 → 用什么数据评 → 工具怎么分 → 各工具细节 → 怎么选」组织,覆盖 2024–2025 年主流方法与 benchmark 结论。

段末注释亲和力 通常以平衡解离常数 (K_{\mathrm{D}}) 表征,数值越小结合越强;ΔΔG 指突变引起的结合自由能变化,用于比较同一复合物 wild-type 与 mutant 的相对稳定性。


1. 亲和力指标与预测任务类型

1.1 实验可测物理量

指标 含义 关系
(k_{\mathrm{on}}) 结合速率常数 复合物形成快慢
(k_{\mathrm{off}}) 解离速率常数 复合物稳定性
(K_{\mathrm{D}}) 平衡解离常数 (K_{\mathrm{D}} = k_{\mathrm{off}} / k_{\mathrm{on}})
(\Delta G_{\mathrm{bind}}) 结合自由能 (\Delta G_{\mathrm{bind}} \approx RT \ln K_{\mathrm{D}})
(\Delta\Delta G_{\mathrm{bind}}) 突变致结合能变化 亲和力成熟/逃逸分析的主标签

除 (K_{\mathrm{D}}) 外,半数抑制浓度(Half Maximal Inhibitory Concentration,(IC_{50}))酶联免疫吸附测定(Enzyme-Linked Immunosorbent Assay,ELISA) 的 (EC_{50})、逃逸分数(escape fraction,(f)) 等也常被用作亲和力代理指标;跨平台、跨批次的数值不可直接混作回归标签——这也是近年 benchmark 转向排序(ranking) 而非绝对值回归的重要原因之一。(EC_{50}) 与 (K_{\mathrm{D}}) 的测定、换算与报告规范见 抗体-02.指标-02.EC50与KD的测定与换算;指标总览见 抗体-02.指标-01

段末注释(EC_{50}) 为半数有效浓度,在 ELISA 等终点实验中常用;与 (K_{\mathrm{D}}) 相关但受 avidity、包被方式等影响,不宜与 SPR 的 (K_{\mathrm{D}}) 简单等同。

1.2 计算预测的三类任务

  1. 绝对亲和力预测:由序列/结构直接估计 (K_{\mathrm{D}}) 或 (\Delta G_{\mathrm{bind}})(如 ANTIPASTI)。
  2. 突变效应预测(ΔΔG):给定 wild-type 复合物结构与突变位点,预测 (\Delta\Delta G_{\mathrm{bind}})(如 FoldXGearBindAttABseq)。
  3. 相对排序/分类:判断 A 是否比 B 结合更强,或是否属于 binder/non-binder(如 AbRankAbAgIntPreLlamaAffinity)。

Therapeutic 早期筛选往往只需「谁更好」,排序任务与实验噪声更匹配;lead 优化阶段则更依赖 ΔΔG 的定量或半定量估计。


2. 实验评估方法与基准数据集

2.1 湿实验平台对比

平台 原理 输出 优势 局限
SPR 折射率变化,实时传感 (k_{\mathrm{on}})、(k_{\mathrm{off}})、(K_{\mathrm{D}}) 动力学分辨率高;抗体工业界事实标准 需固定化策略优化;大分子/复杂基质可能受限
BLI 光纤探针干涉 同上 dip-and-read,对流体/杂质更宽容;适合高通量初筛 分辨率通常略低于 SPR;表位分 binning 分辨率有限
ELISA 酶促显色终点 (EC_{50})/相对结合 成本低、通量高 非 label-free;难获可靠 (k_{\mathrm{on}}/k_{\mathrm{off}})
等温滴定量热法(Isothermal Titration Calorimetry,ITC) 热量变化 (\Delta H)、(K_{\mathrm{D}}) 热力学信息完整 耗样大、通量低

建议:计算模型训练/验证应尽可能对齐实验条件(温度、pH、抗体格式、抗原构象);混用 SPR (K_{\mathrm{D}}) 与 ELISA (EC_{50}) 作单一回归目标会显著抬高标签噪声。

段末注释表位分 binning(epitope binning) 指区分不同抗体是否竞争同一抗原表位,BLI/SPR 均可实现,与亲和力测定互补。

2.2 常用公开基准

数据集 规模/特点 主要用途
SKEMPI 2.0 ~7085 条突变,含动力学/热力学子集 通用 PPI ΔΔG benchmark
AB-Bind 1101 条抗体–抗原突变(32 复合物) 抗体专用 ΔΔG;实验条件较一致
S1131 / AB645 / AB1101 自 SKEMPI/AB-Bind 去冗余子集 单点/多点突变方法对比
AbRank >38 万条测定,9 源聚合 跨抗体/抗原泛化的配对排序 benchmark
SAbDab 结构抗体库 结构预测与训练数据来源

评估划分策略 比数据集本身更关键:按突变划分(split-by-mutation) 易高估泛化(同复合物/同位点泄漏);按复合物划分(split-by-complex) 更接近真实抗体工程场景。GearBindGraphinity 等近年工作均强调后者。


3. 工具分类总览

1
2
3
4
5
6
7
8
9
                    ┌─ 物理/统计能量函数 ─ FoldX, Flex ddG, BeAtMuSiC, SSIPe, PBEE
输入:结构 ────────┼─ 图签名 + ML ─────── mCSM-AB, Bind-ddG/DDGPred, GearBind, Graphinity, MutPPI
└─ 结构波动 + DL ───── ANTIPASTI

┌─ 序列编码 + DL ───── AttABseq, ProtAttBA, AntiFormer, LlamaAffinity
输入:序列 ────────┼─ 交互分类 ────────── AbAgIntPre, AntiBinder, MultiSAAI
└─ PLM 嵌入 + 排序 ── AbRank/WALLE-Affinity (结构可选)

前置依赖 ─────────── IgFold/AF3/Boltz-1(抗体/复合物结构);HADDOCK(约束对接)

下文按方法族展开;文末给出选型矩阵。


4. 物理与统计能量函数类

4.1 FoldX

维度 内容
原理 基于经验力场与物理方程估计突变对折叠/结合自由能的影响;对界面原子进行能量分解(van der Waals、氢键、静电、溶剂化等)。
输入 复合物三维结构(PDB);指定突变。
输出 (\Delta\Delta G_{\mathrm{bind}})(kcal/mol 量级)。
优势 无需训练数据;对 crystal structure 上单点突变有一定区分力(AB-Bind 上 Pearson (r \approx 0.34));GearBind 集成实验表明 FoldX 与 DL 模型互补,ensemble 可提升 Spearman 相关。
局限 绝对定量误差大;对预测结构(AlphaFold2/ESMFold)敏感,相关可降至 (r \approx 0.04)–0.14;难刻画大侧链替换、多位点 epistasis。
适用场景 已有高质量共晶结构时的快速突变扫描;作为 ML ensemble 的一票。

段末注释Ensemble(集成模型) 指组合多个 predictor 的预测值(如简单平均),以降低单一方法偏差。

4.2 Rosetta Flex ddG

维度 内容
原理 在 Rosetta 能量函数下,用 backrub 采样骨架微动,生成构象 ensemble,再对界面能量差取平均估计 ΔΔG。
优势 较 rigid-body Rosetta ddG 在抗体–抗原界面、小→大侧链突变、多位点非丙氨酸突变上明显改进(ZEMu 1240 突变 benchmark)。
局限 计算成本高(每突变需大量采样);仍依赖结构质量;Pearson 相关通常仅 moderate。
适用场景 少量 lead 候选的精细 ΔΔG 评估;与 FoldX、GearBind 组成三方法 ensemble。

4.3 BeAtMuSiC

维度 内容
原理 将复合物 ΔΔG 分解为复合物稳定性变化与各单体稳定性变化的线性组合;基于 PoPMuSiC 统计势。
优势 Web 服务器易用;可界面系统性扫描;在 SKEMPI 系列 benchmark 中长期作为强 baseline;对 reverse mutation 预测较稳健(bias 分析)。
局限 统计势对非典型界面化学环境泛化有限;绝对值精度仍不足。
适用场景 通用 PPI ΔΔG;抗体工程入门扫描。

4.4 SSIPe

维度 内容
原理 结构/序列同源搜索构建界面 profile,与 EvoEF 物理势结合;引入氨基酸特异 pseudocount 缓解数据稀疏。
优势 在严格 30% 序列 identity 划分下 TestSet PCC (\approx 0.61),RMSE (\approx 1.93) kcal/mol,优于多数传统方法。
局限 依赖可靠复合物结构;非界面突变仅用 EvoEF,精度下降。
适用场景 有结构、需进化信息增强的 ΔΔG 预测。

4.5 PBEE 与其他

PBEE(Physics-Based Energy Estimator) 等新一代能量估计器在 AbRank benchmark 中与 FoldX 一并作为 energy-based baseline;总体在跨复合物泛化上弱于排序式 GNN,但在局部突变场景仍具可解释性。


5. 结构 + 机器学习类

5.1 mCSM-AB / mCSM-PPI

维度 内容
原理 将复合物表示为图:原子为节点,距离与物化类型为边;提取 graph-based signatures(累积分布)作为 ML 特征,回归 ΔΔG。
优势 首个面向抗体–抗原优化的专用 Web 工具;AB-Bind 上 (r \approx 0.53)–0.56,优于当时 FoldX(0.34)、Rosetta(0.16)等;无需显式溶剂 FEP。
局限 训练集偏向 destabilizing 突变;对 stabilizing 突变识别仍弱;结构输入质量敏感。
适用场景 抗体界面饱和突变扫描;逃逸突变风险初筛。

5.2 Bind-ddG / DDGPred

维度 内容
原理 几何图神经网络(Equivariant GNN)编码 wild-type 复合物 3D 几何,预测突变 ΔΔG。
优势 在 crystal PDB 上可达较高相关;显式建模界面几何。
局限 ProtAttBA 等 2025 对比显示:换用 AlphaFold2/ESMFold 结构后性能骤降,泛化弱于序列法;对 CDR 环构象误差极敏感。
适用场景 有实验共晶、单点/少点 CDR 优化。

5.3 GearBind / GearBind+P

维度 内容
原理 多关系图 + 多层几何消息传递GearBind+P 在大规模无标签蛋白结构上做对比预训练,再 fine-tune SKEMPI。
优势 split-by-complex 五折 CV 上优于 FoldX、Flex ddG、Bind-ddG;实验验证 ELISA (EC_{50}) 最高改善 ~17 倍,(K_{\mathrm{D}}) ~6.1 倍;与 FoldX ensemble 效果接近完整五模型 ensemble。
局限 需复合物结构;预训练与推理成本高于 mCSM-Ab;对 AF3 预测结构的鲁棒性仍受 AbRank 等 benchmark 挑战。
适用场景 亲和力成熟 in silico 饱和突变;与 FoldX 联用的 ensemble 工作流。

5.4 Graphinity / MutPPI

维度 内容
原理 Graphinity:等变 GNN 预测 ΔΔG;MutPPI:GNN + ESM-2 多模态。
优势 Graphinity 在 AB-Bind 645 突变上曾报告 Pearson (\approx 0.87),但 Nature Computational Science (2025) 指出该高分来自 overfitting,真实泛化远低于报告值;在百万级 FoldX 合成数据上可学至 (r \approx 0.9)。
局限 实验数据量不足时 DL 易记忆复合物 id;需严格 split-by-complex 评估。
适用场景 研究用;合成数据预训练 + 小实验集 fine-tune 的探索性流程。

5.5 ANTIPASTI

维度 内容
原理 对复合物结构计算 Normal Mode 相关图(残基波动耦合),CNN 回归 (\log K_{\mathrm{D}})。
优势 直接预测绝对 (K_{\mathrm{D}})(非仅 ΔΔG);报告 test (R \approx 0.85)–0.86;CPU 训练 <10 min;可解释性(normal mode 可视化)。
局限 训练/测试抗原需低冗余划分,难以与其他方法公平重训对比;依赖结构;对柔性 CDR 的 normal mode 近似可能失真。
适用场景 已有抗体–抗原结构、需快速 (K_{\mathrm{D}}) 量级估计;与 AlphaFold 结构联用教程已提供。

6. 序列与混合深度学习类

6.1 AttABseq

维度 内容
原理 抗体/抗原序列分别编码,multi-head attention 捕获突变前后序列上下文,端到端回归 ΔΔG。
优势 纯序列、无需结构;在 AB645/AB1101/S1131 上优于多种序列 baseline;2024 Briefings in Bioinformatics
局限 对训练集未覆盖的抗原/scaffold 外推有限;多点突变深度增加时仍弱于 ProtAttBA 等更新方法。
适用场景 早期 CDR 点突变筛选;无结构时的 ΔΔG 粗排。

6.2 ProtAttBA(2025)

维度 内容
原理 序列 attention + 可解释模块;针对抗体工程优化。
优势 在 sequence identity split、mutation depth split 上整体优于 AttABseq 与 structure-based DDGPred(尤其当输入为预测结构时)。
局限 仍依赖 AB-Bind/SKEMPI 类标签分布;绝对 ΔΔG 误差需实验校准。
适用场景 推荐作为序列优先 ΔΔG 工作流的首选之一。

6.3 AntiFormer / LlamaAffinity

维度 内容
原理 AntiFormer:图增强 LLM,双塔编码抗体–抗原序列;LlamaAffinityLLaMA 3 backbone + OAS 抗体序列微调,做 binding 分类。
优势 AntiFormer 在患者 BCR 数据分析、疫苗应答研究中展示应用;LlamaAffinity 报告分类 AUC-ROC (\approx 0.994)、训练 ~0.46 h。
局限 LlamaAffinity 等为分类非 (K_{\mathrm{D}}) 回归;LLM 类方法易过拟合公开 benchmark;临床靶点(HER2、SARS-CoV-2)外部验证仍不足。
适用场景 大规模 binder/non-binder 初筛;免疫组库分析。

6.4 AbAgIntPre / AntiBinder / MultiSAAI

维度 内容
原理 AbAgIntPre:CKSAAP 编码 + Siamese CNN,预测是否结合;AntiBinder:双向 cross-attention 融合结构+序列;MultiSAAI:多尺度序列 DL。
优势 AbAgIntPre 提供 Web 服务器与 SARS-CoV 专用模型;AntiBinder 在未见抗原跨物种任务上优于多种 SOTA;MultiSAAI 2025 bioRxiv 在通用数据集上优于 AbAgIntPre。
局限 交互预测 ≠ 亲和力定量;结构增强模型仍受结构预测误差拖累。
适用场景 表位/抗体库 hit picking;新抗原、新病原体的 first-pass 筛选。

7. 排序学习范式:AbRank 与 WALLE-Affinity

7.1 问题重构

AbRank(2025) 指出:亲和力标签存在(1)检测限截断(如 (< 0.1,\mathrm{nM}));(2)SPR/BLI/ELISA 混用;(3)批间噪声。故将任务改为 **(m)-confident pairwise ranking**:仅学习满足 (a_i > m \cdot a_j)(默认 (m=10) 倍)的样本对顺序,损失为 margin ranking loss:

[
\mathcal{L}(x_i, x_j, y_{ij}) = \max\left(0,,-y_{ij}\cdot(f(x_i)-f(x_j))+\mathrm{margin}\right)
]

7.2 WALLE-Affinity

维度 内容
原理 GNN 整合 PLM 嵌入(ESM-2/Mint)与粗粒度结构图;支持 regression 与 ranking 两种目标。
优势 Ranking 训练在 Hard Ab/Ag split 上 AUC 优于 ANTIPASTI、GearBind、ESM-2、FoldX;对 Boltz-1/AF3 预测结构的噪声更鲁棒。
局限 输出为相对顺序,需额外校准才能得到 (K_{\mathrm{D}});benchmark 构建复杂,复现门槛高。
适用场景 多候选抗体对同一抗原的优先级排序;跨抗原、跨 scaffold 的泛化评估标准。

8. 结构预测与对接:亲和力的上游依赖

亲和力 predictor 的上限常由输入结构决定。下表为结构获取工具(非直接预测亲和力,但是 ΔΔG/结构 ML 的前置步骤):

工具 角色 抗体–抗原表现 注意点
AlphaFold3(AF3) 端到端复合物预测 多 seed 时 DockQ 成功率显著高于 AF-Multimer;单 seed 抗体 docking 失败率仍 ~65% CDR-H3 是瓶颈;建议多 seed + ipTM 筛选
Boltz-1 / Chai-1 开源 AF3 类 AbRank 默认抗原结构来源;速度与精度折中 柔性区域不确定性高
IgFold 抗体 Fv 专用 AbRank 默认抗体结构来源 不含抗原对接
HADDOCK3 信息驱动对接 需 paratope/epitope 约束;AI 结构 ensemble + HADDOCK 可优于纯 rigid-body 依赖 prior 界面信息
ABodyBuilder3 抗体 homology/model 传统抗体建模管线 需另做对接

实践建议:in silico 亲和力流程宜采用「多 seed 结构生成 → 界面质量过滤(DockQ/ipTM)→ ΔΔG/排序模型 → top 突变实验验证(SPR/BLI)」;勿将单一 AF3 模型直接喂给结构敏感 predictor 并期待定量 (K_{\mathrm{D}})。


9. 工具选型指南

9.1 按场景推荐

场景 推荐工具(优先级) 理由
有共晶、单点 CDR 成熟 GearBind+P + FoldX ensemble → Flex ddG 复核 实验验证的 in silico maturation 管线
无结构、点突变 ΔΔG ProtAttBA / AttABseq 对预测结构误差免疫
饱和突变扫描(界面) mCSM-AB Web → GearBind 精排 Web 快速 + DL 精排
绝对 (K_{\mathrm{D}}) 量级(有结构) ANTIPASTI 少数直接回归 (K_{\mathrm{D}}) 的专用工具
抗体库 binder 分类 AbAgIntPre / LlamaAffinity / AntiFormer 高通量、低成本
未见抗原/跨物种结合 AntiBinder 专门优化 OOD 抗原
多候选排序(不同实验源) AbRank 框架 + WALLE-Affinity 对标签噪声最匹配
逃逸突变/疫苗设计 mCSM-AB + 排序模型 界面 destabilizing 突变识别
可解释、物理先验 FoldX + BeAtMuSiC + SSIPe 对比 能量分解便于人工审查

9.2 方法族横向对比

方法族 典型精度(实验 ΔΔG) 计算成本 结构依赖 泛化(新抗原) 可解释性
物理能量 低–中((r) 0.2–0.4) 中–高 中(不记忆训练集)
结构 GNN 中–高(数据依赖) 低–中
序列 DL 低–中 低–中
排序 GNN 中(AUC) 中–高 可选 中–高
交互分类 高(AUC) 可选 方法差异大

10. 共性局限与研究前沿

  1. 数据瓶颈:高质量抗体–抗原 ΔΔG 仍仅千级量级;SKEMPI 中抗体条目占比有限;stabilizing 突变欠采样。
  2. 评估泄漏:split-by-mutation 造成「虚高 SOTA」;发表性能需核查划分策略与复合物 identity cutoff。
  3. 结构误差传播:CDR-H3、抗原柔性 loop 导致 AF3/IgFold 界面 RMSD 数 Å 即足以翻转 ΔΔG 符号;序列法因此「工程上更稳」。
  4. 标签异质性:(K_{\mathrm{D}})、(IC_{50})、escape (f) 混训的 regression 模型物理意义不清;排序 + m-fold 过滤 是务实方向。
  5. 实验–计算闭环:GearBind 等已展示 ELISA/BLI 验证可达 5–17 倍改善,但成功率依靶点而异;计算预测应定位为富集因子而非替代 SPR。
  6. 2025 趋势:PLM(ESM-2、Mint、AbLang2)+ 粗粒度结构图;metric learning;合成数据(FoldX/Rosetta)预训练 + 小样本实验 fine-tune;AF3 复合物 + 排序 head 的一体化 pipeline。

11. 推荐工作流(示意)

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
[序列] ──► 可选:AbAgIntPre / AntiBinder(binder 分类)


[结构] IgFold(Ab) + AF3/Boltz-1(Ag–Ab complex),多 seed


[ΔΔG / 排序] 序列优先:ProtAttBA
结构优先:GearBind + FoldX ensemble
噪声标签:WALLE-Affinity ranking


[实验] top 8–24 变体:BLI/SPR 测 KD;ELISA 作补充


[迭代] 实验数据回流 fine-tune 或更新 ensemble 权重

12. 工具与资源索引

工具 类型 链接/备注
FoldX 能量函数 foldxsuite.org
Rosetta Flex ddG 能量+ensemble Rosetta Commons
BeAtMuSiC Web ΔΔG babylone.ulb.ac.be/beatmusic
SSIPe Web ΔΔG zhanggroup.org/SSIPE
mCSM-AB Web ΔΔG structure.bioc.cam.ac.uk/mcsm_ab
GearBind GNN ΔΔG Nature Communications 2024
ANTIPASTI CNN (K_{\mathrm{D}}) github.com/kevinmicha/ANTIPASTI
AttABseq 序列 ΔΔG github.com/ruofanjin/AttABseq
AbAgIntPre 序列交互 Frontiers in Immunology 2022 Web server
AbRank Benchmark arXiv:2506.17857
SKEMPI 2.0 数据库 life.bsc.es/pid/skempi2
AB-Bind 数据库 github.com/sarahsirin/AB-Bind-Database
SAbDab 结构库 opig.stats.ox.ac.uk/webapps/sabdab

13. 小结

抗体–抗原亲和力预测已形成「实验测定 → 公开 benchmark → 多范式计算」的完整生态:物理能量法可解释、对结构敏感但不易过拟合;结构 GNN 在共晶+按复合物划分时最强,是亲和力成熟的主力;序列 DL 在缺少结构或 AF 模型不可靠时更稳健;排序学习(AbRank) 最适合多源、 noisy 标签下的候选优先级。没有单一工具能在所有靶点与任务上占优——应依据「有无结构、要绝对值还是排序、突变深度、是否需要 OOD 抗原」四元组选型,并始终以 SPR/BLI 实验闭环校验。


参考文献(选)

  1. Cai Y. et al. Pretrainable geometric graph neural network for antibody affinity maturation. Nat. Commun. 2024.
  2. Michalewicz H. et al. ANTIPASTI: interpretable prediction of antibody binding affinity exploiting Normal Modes and Deep Learning. 2024.
  3. Jin R. et al. AttABseq: an attention-based deep learning prediction method for antigen–antibody binding affinity changes based on protein sequences. Brief. Bioinform. 2024.
  4. Liu C. et al. AbRank: A Benchmark Dataset and Metric-Learning Framework for Antibody–Antigen Affinity Ranking. 2025 (arXiv:2506.17857).
  5. Barlow K. et al. Flex ddG: Rosetta ensemble-based estimation of changes in protein–protein binding affinity upon mutation. J. Phys. Chem. B 2018.
  6. Pires D.E.V. et al. mCSM-AB: a web server for predicting antibody–antigen affinity changes upon mutation. Nucleic Acids Res. 2016.
  7. Shan Y. et al. Deep learning guided optimization of human antibody against SARS-CoV-2 variants with broad neutralization. Proc. Natl. Acad. Sci. 2022 (Bind-ddG).
  8. Abramson J. et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature 2024.
  9. Nature Computational Science 2025: Investigating data requirements for generalizable antibody–antigen ΔΔG prediction (Graphinity).
  10. ProtAttBA: Sequence-Only Prediction of Binding Affinity Changes. 2025 (arXiv:2505.20301).
-------------本文结束感谢您的阅读-------------