AntiBARTy Diffusion 文献解读:BART 潜空间上的性质引导抗体生成

系列抗体-05.方法文献系列说明 · 第 01 篇
范式对照亲和力改造范式 · 方向 4b 生成(性质引导 de novo,非抗原条件)


0. 文献卡片

内容
题名 AntiBARTy Diffusion for Property Guided Antibody Design
作者 / 机构 Jordan Venderley / Eli Lilly and Company
载体 arXiv 预印本,2023-09
链接 arXiv:2309.13129 · HTML
一句话贡献 先训抗体专用 BART(AntiBARTy),再在其冻结潜空间上训性质条件扩散模型,用 无分类器引导 做 IgG 可变区从头生成(用例:计算机溶解度)

段末注释BART(Bidirectional and Auto-Regressive Transformers,双向与自回归变换器)是「编码器看腐蚀序列、解码器做去腐蚀」的序列到序列预训练范式;IgG(Immunoglobulin G,免疫球蛋白 G)是最常见治疗抗体同种型。


1. 问题与动机

工业抗体路径通常是:展示库/杂交瘤拿到抗原特异性 binder → 再改可开发性(溶解度、免疫原性、可制造性等),同时尽量保住亲和力。性质标签往往远少于公开抗体序列;若直接在氨基酸串上训强条件生成器,容易欠拟合或牺牲「像不像抗体」。

作者策略拆成两步:

  1. 用海量无标签序列学强先验 (p(\text{序列}))(AntiBARTy);
  2. 把少量性质数据「挂」到冻结潜空间上,用扩散 + 引导采样推向有利性质模式。

相对结构扩散(如 DiffAb)与离散序列引导扩散(如 Gruver et al.),本文刻意走:序列优先、计算便宜、可变长、不依赖抗原 3D、不要求固定编辑预算


2. 方法总览

图 1 AntiBARTy Diffusion 两阶段:大规模 BART 先验 → 潜空间性质条件扩散 → 解码成 VH 序列(科普示意)

阶段 模块 输入 输出 参数量(作者)
A AntiBARTy(BART) 腐蚀后的 Fv 序列 去腐蚀序列;编码器连续潜表示 ~16M
B 性质条件 DDPM(U-Net) 噪声潜向量 + 时间步 ± 性质类 去噪潜编码 ~3M
生成 CFG 采样 + decoder (z_T\sim\mathcal{N}(0,I))、引导强度 (w)、链类型 token 氨基酸序列

段末注释Fv(fragment variable,可变片段)含 VH/VL 可变域;DDPM(denoising diffusion probabilistic model,去噪扩散概率模型)通过多步加噪/去噪学习数据分布;CFG(classifier-free guidance,无分类器引导)用「有条件 − 无条件」噪声预测差引导采样,无需单独训练分类器。

端到端采样伪代码:

1
2
3
4
5
z_T ~ N(0, I)
for t = T … 1:
ε̂ = ε_θ(z_t, t, ∅) + w · (ε_θ(z_t, t, c) − ε_θ(z_t, t, ∅)) # CFG
z_{t-1} ← 按 DDPM 后验一步更新
seq ← AntiBARTy.decoder(z_0 | 起始 token=<heavy>) # Gumbel, T=0.1

3. 实现细节(一):AntiBARTy

3.1 数据与预处理

来源 规模 备注
OAS 人源 IgG 重链 Fv 2.54 亿 Observed Antibody Space
OAS 人源 IgG 轻链 Fv 3.42 亿 同上
UniProtKB 0.28 亿 增加非抗体蛋白多样性

过滤:长度限制在 ([100,140]) 氨基酸;去掉含未知残基 X 的链。
前缀标签:<heavy> / <light> / <protein>;末尾 <EOS>

段末注释OAS(Observed Antibody Space,观测到的抗体空间)是清洗、注释后的大规模抗体序列库;UniProtKB(UniProt Knowledgebase)为通用蛋白知识库。

合计量级约 6 亿+ 条,与综述常用「超 6 亿 Fv」表述一致。

3.2 预训练目标与架构

  • 目标:BART 去腐蚀——编码器读被破坏序列,解码器重建干净序列。
  • 腐蚀类型(训练时 on-the-fly):token masking、插入/删除(indel)、infilling。
  • 结构:encoder / decoder 各 6 层注意力;Flash Attention;4×A100;约 6 epoch / 6 天
  • 强腐蚀极限:接近纯 decoder 语言模型;弱腐蚀则保留双向上下文。

相对 encoder-only 抗体 LM(如 AntiBERTy):BART 给出精确自回归似然,作者提到利于 repertoire 的 evolutionary velocity 等分析(本文未展开)。
相对纯 decoder(如 IgLM):多出可冻结的连续编码器潜空间,便于接扩散。

3.3 微调:质量对齐 + max-pooled 条件化

OAS 存在 N 端截断等质量问题。预训练后在 OAS paired 子集(更高质量)上短微调,把生成分布拉回「可被 ANARCI 正确编号」的完整抗体。

关键改动:解码器 cross-attention 改为对编码器输出在序列维做 max-pooling,得到固定维聚合嵌入,再供解码注意。

做法 作者判断
全长 token 级 cross-attn 变长 Fv 难与固定维扩散潜变量对齐
自然语言 latent diffusion 常用的经验长度采样 抗体场景不如 pooling
max-pooled 聚合嵌入 与扩散生成编码联用时序列质量更好

微调后 冻结 AntiBARTy 全参数。

图 2 上:变长序列 → max-pool 成固定「指纹」潜向量;下:CFG 用有/无条件噪声预测差引导性质方向(科普示意)

段末注释ANARCI(Antigen receptor Numbering And Receptor ClassificatIon)用于可变域编号与链型/物种分类,是本文生成质量的粗检工具。


4. 实现细节(二):潜空间性质条件扩散

4.1 为何在潜空间扩散?

归一化后的编码器连续潜空间训 DDPM,而非离散氨基酸空间:

  • 复用已学抗体流形,降低「生成不像抗体」的风险;
  • 长度可变:最终长度由 decoder 决定,不绑定固定编辑预算(对比 guided discrete diffusion);
  • indel 已在 BART 腐蚀中成为先验一部分,与亲和力成熟中 indel 的生物学角色一致。

4.2 U-Net 与条件融合

  • 骨干:3 层 U-Net,约 3M 参数;
  • 上采样阶段融合:自编码输入 + 可学习性质类嵌入 + 时间步嵌入
  • 同时支持条件 / 无条件噪声预测,供 CFG 使用。

4.3 性质标签与训练配方(溶解度用例)

设定
性质来源 Protein-Sol 对 paired OAS 子集中一批 VHin silico 溶解度
低溶类 分数 (< 0.45)
高溶类 分数 (> 0.7)
规模 每类约 2 万
CFG 训练 以概率 0.1 丢弃性质类嵌入(学无条件分支)
类别不平衡 条件训练集 10× 上采样

无条件分支还使用 AntiBARTy 微调集上的嵌入。

段末注释Protein-Sol 是基于序列特征的蛋白质溶解度预测工具;本文优化的是其分数景观,不等于实测溶解度。

CFG 噪声预测(符号与常见图像 CFG 一致):

[
\hat{\varepsilon}(z_t,t,c)=\varepsilon_\theta(z_t,t,\varnothing)+w\bigl(\varepsilon_\theta(z_t,t,c)-\varepsilon_\theta(z_t,t,\varnothing)\bigr)
]

其中 (c) 为性质类,(w) 为引导强度。作者观察:推向低溶解度往往需要更大的 (w),才能达到与高溶侧相当的分布偏移。

4.4 解码超参

  • decoder 输入初始化:<heavy>(主结果为重链);
  • 解码:Gumbel 采样式贪心,温度 0.1(偏确定、低随机性)。

5. 结果与口径

5.1 仅 AntiBARTy(无扩散)

另训「只条件 <heavy> / <light>」版本,各采 1k 条:长度分布可复现高质量训练集;ANARCI 链型全对,germline 物种分布与训练一致;样本彼此唯一。说明微调缓解了预训练集 N 端截断导致的分布污染。

5.2 AntiBARTy Diffusion(溶解度引导)

检查项 作者报告
无条件溶解度分布 贴近全训练集
高/低溶条件采样 Protein-Sol 分数明显分离
ANARCI 全为重链;>99.9% 人源 germline
新颖性 >99.9% 不在溶解度训练集;与最近邻有 Levenshtein 距离分布
潜空间覆盖(UMAP) 高溶引导避开低溶模式,聚集于高溶区域

口径提醒:全部为 in silico;无表达、无 SPR/BLI、无抗原结合实验。数字不可与亲和力成熟论文的「(N) 倍 (K_D)」横比。


6. 局限、风险与任务边界

类型 说明
标签代理 优化 Protein-Sol,可能与真实溶解/表达脱钩
无抗原条件 不能替代 DiffAb / dyMEAN / RFantibody 等 binder 设计
无湿实验 作者结论亦写明计划实验验证
CFG 强度 (w) 过大易模式崩塌或「假性质」;高低溶所需 (w) 不对称
配对 主结果在 VH;完整治疗分子还需 VL 配对与恒定区
数据偏倚 OAS/人源 IgG 主导;跨物种/特殊格式需另评

一句话边界:本方法属于「可开发性/性质引导的序列 de novo」,不是「表位定制亲和力设计」主引擎。


7. 与相近方法对照(选型用)

方法 条件对象 表示空间 更适合
AntiBARTy Diffusion 序列性质(溶解度等) BART pooled latent 性质偏置的合法抗体采样
DiffAb / RFantibody 抗原结构 / 表位 结构(±序列) 抗原特异性结合
EAGLE 表位结构 ESM embedding 上扩散 表位条件全长序列
Guided discrete diffusion(Gruver) 性质 + 编辑预算 离散序列 固定长度 lead 优化(有实验报道)

8. 工程取用建议

  1. 有用时:已有大量无标签抗体序列 + 少量可计算/可预测性质;需要新颖、可变长、像抗体的候选池,并偏向某一性质模式。
  2. 不够时:必须指定抗原表位、或必须以实测亲和力/溶解度闭环为准——需另接结构条件生成或湿实验筛选。
  3. 复现注意:原文为 Lilly 内部工作,公开信息以 arXiv 方法节为准;实现时重点对齐——(i) max-pool 潜向量、(ii) 0.1 条件 dropout CFG、(iii) 性质集上采样
  4. 本仓库衔接:范式总览 4b;注释质控可用 ANARCI 科普;抗原条件设计见工具-02 与后续方法文献篇目。

9. 可核对原文要点清单

  • 数据:OAS 254M VH + 342M VL + UniProt 28M;长度 ([100,140])
  • AntiBARTy:6+6 层,~16M;BART 腐蚀;paired 微调 + max-pool
  • 扩散:3 层 U-Net,~3M;Protein-Sol 高低溶各 ~20k;mask (p=0.1);条件 10× upsample
  • 采样:标准正态潜向量 → CFG → decoder(<heavy>,Gumbel (T=0.1))
  • 结果:in silico 溶解度可分;ANARCI/新颖性高;无湿实验、无抗原设计

参考文献(本篇)

  1. Venderley J. AntiBARTy Diffusion for Property Guided Antibody Design. arXiv:2309.13129, 2023.
  2. Lewis et al. BART. ACL 2020.
  3. Ho & Salimans. Classifier-free diffusion guidance. NeurIPS Workshop 2021.
  4. Ho et al. Denoising diffusion probabilistic models. NeurIPS 2020.
  5. Olsen et al. Observed Antibody Space. Protein Science 2022.
  6. Hebditch et al. Protein-Sol. Bioinformatics 2017.
-------------本文结束感谢您的阅读-------------