抗体从头理性设计(de novo rational antibody design)指在已知或假设的抗原靶标与表位约束下,通过计算生成、筛选并迭代优化 VH/VL(或 VHH)序列,最终获得可表达、可结合、具备成药潜力的候选分子。它与 亲和力成熟(affinity maturation,在已有 binder 上微调)和 免疫动物筛选(hybridoma / display)互补:前者从「零」或「弱模板」出发,后者从实验文库出发。分子架构与 CDR 功能见 抗体-01.结构 系列;结合原理见 抗体-03.互作;亲和力预测工具专篇见 抗体-04.工具-01。
本文按端到端工作流组织:先给出流程总览,再逐步列出每步的计算任务、输入输出、开源工具/模型及许可注意点。所称「开源」以 GitHub 可获取代码/权重 为准;PyRosetta、AlphaFold3 权重、FoldX 等虽广泛使用,但学术/商业许可与权重获取受限,文中单独标注。
配图位于同名资源目录 抗体-04.工具-02.抗体从头理性设计开源工具综述/;正文使用相对子目录路径(如 ./抗体-04.工具-02.抗体从头理性设计开源工具综述/fig01.png),便于本地 Markdown 预览;Hexo 构建时 hexo-asset-image 会自动剥离首段目录、拼到文章永久链接下。流程图正文用 PNG,.svg 仅作可编辑源文件。
段末注释:CDR(complementarity-determining region,互补决定区)为抗体可变区中直接参与抗原接触的环区;VHH 为单域抗体(纳米抗体)的可变重链片段。
1. 端到端流程总览
理性设计并非严格线性流水线——实践中常在 序列生成 ↔ 结构预测 ↔ 打分过滤 之间多轮迭代。典型闭环如下(图 1–2)。


一体化 pipeline(将多步打包)在 2024–2025 年快速涌现,见 §11 与 图 3;单步工具仍是大规模定制流程的积木。
2. 步骤 0:靶标与表位定义
目标:明确抗原序列/结构、构象状态(apo / holo)、表位残基或热点(hotspot),为后续对接约束与 CDR 设计提供几何锚点。
| 任务 | 输入 | 输出 | 开源工具 / 模型 | 许可 / 备注 |
|---|---|---|---|---|
| 抗原结构预测 | 氨基酸序列 | PDB/mmCIF | AlphaFold2、ColabFold、ESMFold、Boltz-1、Boltz-2、Chai-1、Protenix | AF2/Boltz/Chai/Protenix 等多为 Apache/MIT;AF3 代码开源、权重需申请 |
| 构象集合 / 柔性 | 序列或低分辨结构 | 多构象模型 | AFsample2、AF-cluster、BioEmu、ESMFold + MD 后处理 | 表位在柔性 loop 上时需多构象采样 |
| 线性 / 构象表位预测(序列) | 抗原 FASTA | 残基概率、表位片段 | BepiPred 3.0 | 基于 ESM-2;GitHub;学术免费 |
| 构象表位(结构) | 抗原 PDB | 表面可及、B-factor 加权表位 | DiscoTope 3.0、PEPITO、ElliPro | DTU 服务 + 部分可本地部署;DiscoTope 3 用蛋白质语言模型 |
| 表位 / 界面残基(复合物) | Ab–Ag 复合物 PDB | 接触残基、埋藏表面积 | FreeSASA、ProDy、PyMOL、biotite |
有共晶时作金标准注释 |
| 热点约束生成 | 抗原 PDB + 残基列表 | 约束文件(RFdiffusion/HADDOCK) | 手工 + PyMOL / 自写脚本 | RFantibody、Germinal、mBER 均支持用户指定 epitope 残基 |
实践建议:治疗性靶点优先用实验结构或 AF3/Boltz 高置信域;表位预测工具给出候选集合而非单点真理,宜与保守性、糖基化、跨膜区排除规则联用。抗原 同源多态 与 pH/离子强度 若影响表位,应在步骤 0 固定假设。
段末注释:热点(hotspot) 指界面中贡献大部分结合自由能的少数残基,常用于约束扩散设计或对接。
3. 步骤 1:抗体格式与框架选择
目标:确定分子格式(VHH、scFv、Fab、双特异性构建等),选定 框架区(FR) 模板与 VH–VL 配对策略;为 CDR 设计保留可折叠、可表达的骨架。
| 任务 | 输入 | 输出 | 开源工具 / 数据 | 许可 / 备注 |
|---|---|---|---|---|
| 序列编号与域注释 | VH/VL FASTA | IMGT/Kabat/Chothia 编号、CDR 边界 | ANARCI、AbNumber | ANARCI 广泛用于工业流程 |
| 结构抗体数据库检索 | 靶标/家族/物种 | 同源 FR、CDR 长度分布 | SAbDab、Thera-SAbDab、ABSD | SAbDab 提供 PDB、VH–VL 配对、抗原注释 |
| 天然配对序列库 | 物种、链型 | 百万级抗体序列 | OAS(Observed Antibody Space) | 训练 PLM、humanness 基准 |
| germline 与 V(D)J | 序列 | 胚系基因、突变位点 | IMGT/V-QUEST(Web)、IgBLAST(NCBI) | 免疫原性评估输入 |
| VH–VL 配对预测 | VH + 多条 VL 候选 | 配对得分 | ABPair、DeepAb(配对模块) | 共折叠 ipTM 亦可作配对验证 |
| 治疗性 FR 模板 | 格式需求 | 稳定 FR 序列 | Thera-SAbDab 统计、文献模板(如 4-4-20、HuCAL 衍生) | 无单一官方工具,多从 SAbDab 聚类 |
| 纳米抗体 / VHH 模板 | 序列 | VHH 结构、CDR3 长度 | SAbDab(nanobody 标签)、NanoNet | — |
实践建议:从头设计通常固定 FR、主要设计 CDR(尤其 CDR-H3);全链从头生成需额外可开发性过滤。VH–VL 错配是常见失败模式,scFv/Fab 设计应显式跑配对预测或共折叠筛选。
4. 步骤 2:结合位点与 CDR 骨架设计
目标:在抗原表位附近生成抗体三维骨架(主链几何),确定 CDR 环形状与相对取向——相当于「结构层面的结合位点设计」。
| 任务 | 输入 | 输出 | 开源工具 / 模型 | 许可 / 备注 |
|---|---|---|---|---|
| 表位靶向 CDR 骨架扩散 | 抗原 PDB + hotspot + 抗体 FR 模板 | 全原子或 backbone 设计 | RFantibody(抗体微调 RFdiffusion) | MIT;RosettaCommons/RFantibody |
| 表位靶向 hallucination | 抗原 + epitope + 格式参数 | 复合物轨迹 | Germinal(ColabDesign + AF-Multimer 梯度) | SantiagoMille/germinal;依赖 PyRosetta(学术许可) |
| 模板 + 反传优化 | 抗原 + binder 模板 + hotspot | 优化后复合物 | mBER(ColabDesign + AF-Multimer) | manifoldbio/mber-open |
| 抗体复合物扩散生成 | 抗原表位、长度约束 | CDR 构象 | DiffAb | luost26/diffab;扩散模型生成 CDR |
| 多 CDR 协同设计 | 抗原 + 框架 | CDR 序列与结构 | dyAb | 动态图网络 + 迭代设计 |
| MEAN 等端到端 CDR | 抗原结构 + FR | CDR 序列/结构 | MEAN | 几何深度学习 CDR 设计 |
| 通用 binder 骨架(非抗体专用) | 靶标表面 | binder backbone | RFdiffusion、RFDiffusion3、Chroma、Genie 2 | 需后续 graft 到抗体 FR 或作纳米抗体启发 |
| 传统对接(刚性/半柔性) | 抗原 + 抗体同源模型 | 对接复合物 | HADDOCK3、LightDock、ZDOCK、ClusPro(Web) | HADDOCK3 开源;支持表位约束 |
| Rosetta 抗体对接 | 抗原 + 抗体 | 低能对接姿态 | SnugDock、RosettaAntibody | 需 Rosetta 许可 |
实践建议:RFantibody、Germinal、mBER 代表当前「表位靶向从头 binder」三条技术路线(扩散 / hallucination / 模板反传)。纳米抗体(VHH)因无 VL,pipeline 更简单、成功率常更高;全长 IgG 还需后续 Fc 与表达格式工程(超出本文 CDR 设计范围)。
5. 步骤 3:序列设计与生成
目标:在固定或近似固定的骨架上,为 CDR(或全长可变区)赋予氨基酸序列,生成候选库。
| 任务 | 输入 | 输出 | 开源工具 / 模型 | 许可 / 备注 |
|---|---|---|---|---|
| 结构条件序列设计(通用) | backbone + 固定位点 | 序列 | ProteinMPNN、LigandMPNN | MIT;工业界事实标准 |
| CDR 专用 MPNN | 抗体 PDB + 设计掩码 | CDR 序列 | AbMPNN(Germinal 内置)、RFantibody 的 CDR-only MPNN 包装 | 通常只设计 CDR 环 |
| 逆折叠 + 语言模型梯度 | 骨架 + 目标 | 序列轨迹 | ColabDesign(mk_afdesign)、LM-design | 与 AF2 梯度联用 |
| 抗体序列 PLM | 部分序列 / 掩码 | 全序列、嵌入 | AbLang、AbLang2、AntiBERTy、IgLM | Oxford / Meta 等开源权重 |
| 抗体基础模型(生成式) | 条件:物种、CDR 长度、基因等 | 全序列、标注、inpainting | AbBFN2(Bayesian Flow Network) | instadeepai/AbBFN2 |
| 通用蛋白 PLM 设计 | 结构 + 序列掩码 | 突变建议 | ESM-IF1、ESM-2 + 采样 | Meta fair-esm |
| 物理能量 + Monte Carlo | 结构 + 突变集 | 低能序列 | Rosetta AntibodyDesign、RAbD | 需 Rosetta;适合少量精细优化 |
| 全原子扩散序列-结构联合 | 复合物框架 | 序列+侧链 | MultiFlow、Chroma(部分模式) | 研究向,抗体专用仍少 |
实践建议:主流组合为 骨架(RFdiffusion/Germinal)→ ProteinMPNN/AbMPNN → 结构 repredict 过滤。PLM(AbLang、IgLM)常用于梯度引导 hallucination(Germinal 中 ablm_model)或序列后处理(去罕见 motif)。每步宜生成 10²–10⁴ 序列,靠下游结构+打分漏斗至 10¹–10² 合成。
6. 步骤 4:结构与复合物预测
目标:验证设计序列能否折叠为预期抗体构象,并与抗原形成合理复合物——是 in silico 过滤的核心。
| 任务 | 输入 | 输出 | 开源工具 / 模型 | 许可 / 备注 |
|---|---|---|---|---|
| 抗体 Fv 单体结构 | VH/VL 或 VHH 序列 | PDB | IgFold、ImmuneBuilder(ABodyBuilder2/3) | Oxford OPIG;秒级;纳米抗体用 NANOBODYBUILDER |
| 通用单链/复合物预测 | 序列(多链) | 复合物结构 + pLDDT/ipTM | AlphaFold2-Multimer、ColabFold | 抗体–抗原常用;CDR-H3 置信度常偏低 |
| 生物分子相互作用 | 抗体 + 抗原序列 | 复合物 | AlphaFold3、Boltz-1/2、Chai-1、Protenix | AF3/部分模型权重有限制;Boltz 开源权重友好 |
| 抗体专用共折叠 | VH/VL + Ag | 复合物 | AF3、Boltz、IgFold + HADDOCK 串联 | 无单一「抗体专用」共折叠金标准 |
| 构象质量指标 | PDB | pLDDT、ipTM、PAE、RMSD | OpenStructure、ModelAngelo(辅助)、自研脚本 | 过滤阈值依项目校准 |
| 多 seed ensemble | 序列 | 构象分布 | AF2 dropout、AFsample、多次随机 seed | 界面柔性大时必做 |
实践建议:过滤常用:pLDDT > 0.85(FR)、CDR-H3 不过低、ipTM / docking score 在候选间排序。设计序列与 repredict 结构 RMSD(尤其 CDR)过大则丢弃。IgFold 作快速单体预筛,Boltz/AF3 作复合物精评,是 2025 年常见分层策略。
7. 步骤 5:对接与界面精修
目标:在预测复合物基础上,优化 CDR–抗原界面 几何(氢键、盐桥、去冲突、packing),减少预测误差。
| 任务 | 输入 | 输出 | 开源工具 | 许可 / 备注 |
|---|---|---|---|---|
| 数据驱动柔性对接 | 抗原 + 抗体 + 约束 | 对接集合 | HADDOCK3 | GPL;表位/air 约束 |
| 轻量蛋白-蛋白对接 | 两个 PDB | 姿态 | LightDock | GPL |
| 几何对接 + 聚类 | 受体 + 配体 | top poses | ZDOCK、Piper(部分开源) | — |
| 抗体专用柔性对接 | 抗原 + CDR 柔性 | 精修复合物 | SnugDock(Rosetta) | CDR loop 采样 |
| 侧链 repacking / 最小化 | 复合物 PDB | 低能结构 | PyRosetta、OpenMM + PDBFixer | 工业流程常见 |
| 显式溶剂 MD(可选) | 复合物 | 轨迹、稳定性 | GROMACS、OpenMM | 计算贵;用于 lead 精修 |
实践建议:若步骤 4 已用 AF3/Boltz 高置信共折叠,对接有时可省略,仅做 Rosetta relax 或 OpenMM 最小化。表位约束对接(HADDOCK)在「预测复合物 ipTM 低但序列合理」时用于重采样姿态。
8. 步骤 6:亲和力、稳定性与界面打分
目标:对候选序列/结构排序,选出最值得合成的 top N。详细工具对比见 抗体-04.工具-01。
| 任务 | 输入 | 输出 | 开源 / 可获取工具 | 许可 / 备注 |
|---|---|---|---|---|
| 界面物理评分 | 复合物 PDB | 能量、氢键、形状互补 | Rosetta InterfaceAnalyzer、PyRosetta | 学术许可 |
| 突变 ΔΔG(结构) | 复合物 + 突变 | (\Delta\Delta G_{\mathrm{bind}}) | Rosetta Flex ddG、mCSM-AB(Web) | FoldX 非开源 |
| 突变 ΔΔG(ML) | 结构/序列 | (\Delta\Delta G)、排序 | GearBind、Graphinity、AttABseq、ProtAttBA | 见工具-01 专篇 |
| 序列亲和力排序 | 抗体 + 抗原序列 | 配对得分 | AbRank、AbAgIntPre、LlamaAffinity | 无结构时优先 |
| 深度学习界面指标 | 复合物 | 结合概率 | Prodigy、DFIRE | 快速、粗筛 |
| 免疫特异性 / 脱靶(可选) | 序列 + 人蛋白组 | 同源风险 | BLAST、DIAMOND | 开源 |
实践建议:从头设计阶段多为 ranking 而非绝对 (K_{\mathrm{D}}) 预测;推荐 结构界面分 + GearBind/AttABseq 排序 + 实验 SPR/BLI 闭环。避免仅用 split-by-mutation 训练的模型在全新表位上过度自信。
9. 步骤 7:可开发性与人源化
目标:在保持结合的前提下,降低聚集、低溶解度、免疫原性、非天然 motif 风险,满足治疗性候选的「可开发性(developability)」门槛。
| 任务 | 输入 | 输出 | 开源工具 / 平台 | 许可 / 备注 |
|---|---|---|---|---|
| 溶解度 / 可溶表达预测 | 序列 | 可溶性概率 | SoluProt、DeepSol、ProSo | 序列级快速过滤 |
| 溶解度(结构) | PDB | 表面疏水斑块 | CamSol、CamSol-intrinsic | CamSol 学术免费 |
| 聚集倾向 | 序列 | 热点片段 | TANGO、Waltz、Aggrescan3D | 开源 / 免费学术 |
| 治疗性抗体理化画像 | 序列 | TAP 指标 | TAP(Therapeutic Antibody Profiler)、BioPhi 内置 | BioPhi MIT |
| Humanness / 免疫原性 | 序列 | OASis 9-mer、胚系距离 | BioPhi(OASis、Sapiens) | 人源化 + 评分一体 |
| 人源化(CDR graft + 回复突变) | 鼠源序列 | 人源化候选 | BioPhi Humanize、Humatch | Humatch 有开源组件 |
| 条件生成人源化序列 | 鼠源 + 约束 | 人源序列 | AbBFN2(metadata 条件) | 生成式人源化 |
| 电荷 / pI / 粘度代理 | 序列 | 理化性质 | BioPhi、IPC、Biopython | 高浓度制剂相关 |
| 脱酰胺、氧化、异构化 motif | 序列 | 风险位点 | BioPhi、规则脚本(NG、M、W 等 motif) | 治疗性开发常规检查 |
实践建议:可开发性过滤宜早于大规模合成:先用 TANGO/Aggrescan + SoluProt + BioPhi OASis 去掉明显风险序列,再进入亲和力实验。鼠源或全合成极端 CDR 需显式 人源化;Sapiens(BioPhi)与 AbBFN2 可批量生成人源化变体。
10. 步骤 8:序列定稿与合成前校验
目标:统一编号、检查克隆与表达约束,输出最终 VH/VL(或 VHH)序列供基因合成。
| 任务 | 输入 | 输出 | 开源工具 | 备注 |
|---|---|---|---|---|
| 编号一致性校验 | 最终序列 | IMGT/Kabat 注释 | ANARCI | 与 CDR 设计掩码对齐 |
| 接头 / 格式拼接 | VH, VL | scFv / Fab 序列 | 自研脚本、BioPhi Designer | (G4S)n linker 长度经验 |
| 密码子优化 | 蛋白序列 | DNA(宿主特异) | CodonOptimizer(Biopython 生态)、JCat(Web) | 避免稀有密码子、重复序列 |
| 克隆酶切位点检查 | DNA | 报告 | SnapGene(商业)/ pydna | 开源可用 pydna |
| 信号肽 / 标签 | 格式需求 | 全长的表达 cassette | 文献模板 + SignalP(部分开源) | 表达系统依赖 |
实践建议:定稿序列应保留完整计算溯源(骨架来源、MPNN seed、结构 model、过滤分数),便于实验失败后回溯。建议每个 lead 至少保留 1–2 个 备选回复突变(reversion)用于挽救表达或亲和力。
11. 一体化开源 Pipeline 对比
将 §2–§9 多步打包的端到端方案(2024–2025 主流):

| Pipeline | 核心流程 | 适用格式 | 依赖亮点 | 开源许可 |
|---|---|---|---|---|
| RFantibody | RFdiffusion(抗体微调)→ ProteinMPNN(CDR)→ RF2 过滤 | Fab / VHH(HLT 格式) | 表位靶向扩散;Rosetta 生态 | MIT |
| Germinal | ColabDesign hallucination → AbMPNN → AF3/AF2 共折叠过滤 | VHH、scFv | 表位残基约束;AbLang/IgLM 梯度 | 开源;需 PyRosetta、GPU |
| mBER | 模板准备 → AF-Multimer 反传轨迹 → 多维评估 | VHH(CLI mber-vhh) |
模块化 YAML 配置 | 开源 |
| DiffAb | 扩散生成 CDR → 内置评估 | Fab 类 | 学术 CDR 设计经典基线 | 开源 |
| ColabDesign + 自研脚本 | 灵活组合 AF-design、MPNN、AbLang | 自定义 | 研究自由度最高 | Apache/MIT 组件 |
选型速查:
- 表位明确 + 纳米抗体:优先 Germinal 或 mBER;
- 需全长 Fab + 工业 Rosetta 流程:RFantibody;
- 已有弱结合模板、做 CDR 重设计:DiffAb + ProteinMPNN + GearBind 排序;
- 无 GPU / 快速原型:IgFold + HADDOCK3 + AbLang 序列采样 + BioPhi 过滤。
12. 推荐工作流(按场景)

12.1 表位靶向 de novo VHH
1 | 抗原(AF3/Boltz)+ BepiPred/DiscoTope 表位 |
12.2 基于已知复合物的 CDR 重设计(亲和力成熟前置)
1 | 共晶 / AF 复合物 |
12.3 序列优先、结构后置(低算力)
1 | AbBFN2 / IgLM 条件生成 CDR |
13. 许可与「开源」边界说明
| 组件 | 性质 | 说明 |
|---|---|---|
| ProteinMPNN、IgFold、AbLang、Boltz、RFantibody | 开源友好 | 可本地部署、可改代码 |
| AlphaFold2、ColabFold、ESMFold | 开源代码 + 公开权重 | 商业使用需查阅各模型许可 |
| AlphaFold3 | 代码开源、权重申请 | 非完全开放权重 |
| PyRosetta / Rosetta | 学术免费、商业需授权 | Germinal、RFantibody 部分步骤依赖 |
| FoldX | 商业软件 | 工具-01 中作对比,非开源 |
| BepiPred 3.0 | 学术免费、商业需授权 | 与 DTU 条款一致 |
构建生产级 pipeline 时,应在架构图中标注许可链,避免商业转化时踩坑。
14. 工具与资源索引(按步骤)
| 步骤 | 工具 | 链接 |
|---|---|---|
| 表位 | BepiPred 3.0 | github.com/UberClifford/BepiPred-3.0 |
| 结构预测 | ColabFold | github.com/sokrypton/ColabFold |
| 结构预测 | Boltz | github.com/jwohlwend/boltz |
| 编号 | ANARCI | github.com/oxpig/ANARCI |
| 数据库 | SAbDab | opig.stats.ox.ac.uk/webapps/sabdab |
| 抗体结构 | IgFold / ImmuneBuilder | github.com/Graylab/IgFold |
| 序列设计 | ProteinMPNN | github.com/dauparas/ProteinMPNN |
| PLM | AbLang | github.com/oxpig/AbLang |
| 生成模型 | AbBFN2 | github.com/instadeepai/AbBFN2 |
| Pipeline | RFantibody | github.com/RosettaCommons/RFantibody |
| Pipeline | Germinal | github.com/SantiagoMille/germinal |
| Pipeline | mBER | github.com/manifoldbio/mber-open |
| CDR 扩散 | DiffAb | github.com/luost26/diffab |
| 对接 | HADDOCK3 | github.com/haddocking/haddock3 |
| 人源化 | BioPhi | github.com/Merck/BioPhi |
| 亲和力 ML | GearBind 等 | 见 抗体-04.工具-01 |
15. 小结
抗体从头理性设计的计算闭环可归纳为 「表位锚定 → 框架固定 → 骨架/序列生成 → 结构验证 → 界面打分 → 可开发性/人源化 → 实验合成」。2024–2025 年的关键变化是 表位靶向生成式 pipeline(RFantibody、Germinal、mBER)与 开源共折叠(Boltz、Chai)使「无共晶、仅序列表位」的设计成为可行路径;但 CDR-H3 不确定性、AF 界面误差 与 标签噪声 仍未解决,实验验证(BLI/SPR + 表达量 readout)不可替代。
选型时应先定 格式(VHH vs Fab) 与 表位证据强度,再选一体化 pipeline 或模块化积木;亲和力与人源化工具分别详见 工具-01 与 BioPhi/AbBFN2 文档。计算预测的定位始终是:放大有效序列空间、压缩湿实验合成量,而非单次运行即交付终版药物分子。
参考文献(选)
- Watson J. L. et al. De novo design of protein structure and function with RFdiffusion. Nature 2023(RFantibody 基础)。
- Bennett N. P. et al. Atomically accurate de novo design of antibodies with RFantibody. bioRxiv 2024(RFantibody)。
- Mille S. et al. Efficient generation of epitope-targeted de novo antibodies with Germinal. bioRxiv 2025.
- Swanson K. et al. mBER: Manifold Binder Engineering and Refinement. bioRxiv 2025.
- Luo S. et al. Antigen-specific antibody design via direct energy-based preference optimization. Nature Machine Intelligence 2024(DiffAb 相关线)。
- Ruffolo J. A. et al. Fast, accurate antibody structure prediction from deep learning on massive set of natural antibodies. Nat. Commun. 2023(IgFold)。
- Abramson J. et al. Accurate structure prediction of biomolecular interactions with AlphaFold 3. Nature 2024.
- Wohlwend J. et al. Boltz-1: Democratizing biomolecular interaction modeling. 2024.
- Prihoda D. et al. BioPhi: A platform for antibody design, humanization, and humanness evaluation. mAbs 2022.
- Atkinson E. et al. AbBFN2: Antibody sequence generation and labelling with Bayesian Flow Networks. bioRxiv 2025.