RNAbpFlow:碱基对增强 SE(3) 流匹配条件 RNA 三维结构生成

1. 文献信息

项目 内容
题目 RNAbpFlow: base pair-augmented SE(3) flow matching for conditional RNA 3D structure generation
期刊 Nature Methods(2026-06-30,Open Access,CC BY-NC-ND 4.0)
作者 Sumit Tarafder, Debswapna Bhattacharya(Virginia Tech)
DOI 10.1038/s41592-026-03128-4
代码 / 数据 GitHub · Zenodo

一句话:RNAbpFlow 在不依赖多序列比对(Multiple Sequence Alignment,MSA)或同源结构模板的前提下,以核苷酸序列 + 碱基配对(2D)图为条件,用 SE(3) 等变流匹配(flow matching)高效采样全原子 RNA 三维构象集合;碱基对条件化是性能提升的关键。

段末注释MSA 为同源序列比对,蛋白结构预测常用;RNA 因碱基配对同构性,MSA 构建更困难;流匹配(flow matching)学习从简单分布到数据分布的向量场,采样比扩散模型更省步数。

关联笔记RNA-FrameFlow / RNA 3D 生成背景MOO-01 帕累托最优(精度–速度权衡);Math-04 优化


2. 问题背景与动机

RNA 三维结构对 RNA 疗法设计、功能机制理解至关重要,但:

  1. 构象柔性大:RNA 常呈构象集合而非单一静态结构,传统「单结构预测」不足。
  2. PDB 数据稀缺:模板法(ModeRNA、RNAbuilder)与物理/片段组装法(FARFAR2、3dRNA、RNAComposer)受限于结构库规模与算力。
  3. 深度学习依赖进化信息:除 DRfold 外,trRosettaRNA、RhoFold+、NuFold 等多依赖 MSA 或语言模型隐式同源信号;RNA MSA 深度不足时性能骤降。
  4. 2D 碱基对利用不足:canonical / noncanonical 碱基对与 stacking 是 3D 折叠核心,许多方法未显式、充分地条件化。
  5. 生成式空白:RNA-FrameFlow 虽用流匹配生成骨架,但为无条件采样,不用序列与碱基对。

RNAbpFlow 的定位:序列 + 碱基对条件 + 流匹配 + 全原子端到端,在 MSA/模板缺失场景(尤其 CASP 硬靶)提供可扩展的构象采样器。


3. 方法架构

RNAbpFlow 要回答的问题是:已知一条 RNA 的碱基序列,以及「谁和谁应该配对」的二维接触图,能否高效地采样出一批三维全原子构象?下面用一个极简例子把整条链路串起来,再展开技术细节。

考虑一条 6 核苷酸发夹:G–C–G–A–A–U。G₁ 与 U₆、C₂ 与 A₅ 形成茎部配对,中间的 G₃、A₄ 构成柔性环区。模型拿到的输入只有两样东西:四色碱基序列,以及一张 $6 \times 6$ 的碱基对矩阵——配对位置格点亮起,其余为 0。它要输出的不是单一结构,而是多达 1000 个略有差异的构象,以刻画 RNA 在溶液中的柔性。

论文 Fig.1 从左到右画的正是这件事(见下图)。左侧每个核苷酸用糖环 C1′ 上的局部坐标架描述,不必直接预测每个原子的 $(x,y,z)$;中间从 $t=0$ 的高斯噪声出发,在序列与碱基对条件的约束下,经 Conditional SE(3) flow matching 逐步推成 $t=1$ 的全原子三维结构;右侧 Fig.1b 则展开网络内部——六层 IPA(Invariant Point Attention,不变点注意力)模块逐层更新每颗核苷酸的刚体帧,并用碱基对相关的辅助损失把配对几何「写进」训练目标。

原文 Fig.1 Overview of RNAbpFlow

6 核苷酸发夹 RNA 玩具例子(科普示意图)

段末注释ensemble(构象集合)指同一 RNA 的多种 3D 状态;碱基对图(base-pair graph)是 $L \times L$ 矩阵,标记哪些位置应形成碱基对。

3.1 表示:核苷酸刚体帧 + 全原子重建

直接预测全原子坐标维度太高。RNAbpFlow 沿用 NuFold 的核碱基中心表示(flexible nucleobase center representation):

  • 每个核苷酸为特殊欧氏群(Special Euclidean group,SE(3))刚体帧 $T_i = (R_i, t_i)$:原点落在糖环 C1′,朝向由 O4′–C1′–C2′ 三点定义。
  • 从帧导出 O4′、C1′、C2′;碱基附着点 N1(嘧啶)/ N9(嘌呤) 由四面体几何插值。
  • 其余原子分 10 个子帧,由 9 个可转键二面角 迭代更新,端到端输出全原子坐标(含糖环 puckering:C3′-endo / C2′-endo)。

对 6-mer 发夹,6 颗珠子各有站位与朝向;G₁ 与 U₆ 配对时 C1′ 距离应落在约 10–11 Å,网络先学好帧,再按化学规则长出完整原子。

3.2 条件输入

模型带着两张「说明书」折叠:序列(one-hot 编码的 A/U/C/G)说明每颗珠子是什么碱基;碱基对图说明哪些位置必须靠近。RNAbpFlow 的关键设计是同时使用三通道碱基对图——训练时来自 RNAView、MC-Annotate、DSSR 对同一 PDB 的独立注释,推理时换成 IPKnot、SPOT-RNA、RibonanzaNet 三种 pseudoknot-aware 预测图。三图不做强行 reconciliate,直接作为边特征 bias 输入,宁可略冗余,也不漏掉 canonical / noncanonical 配对差异。

模态 训练 推理(无 native 2D 时)
序列 one-hot(A/U/C/G),长度 $L$ 同左
碱基对图 三通道 $L \times L \times 3$(RNAView / MC-Annotate / DSSR) IPKnot / SPOT-RNA / RibonanzaNet

推理时也支持用户自定义单图(复制三通道)。

段末注释pseudoknot(伪结)为二级结构中碱基对交叉;INF(Interaction Network Fidelity,互作网络保真度)衡量预测 3D 与参考碱基互作网络一致度。

3.3 网络:FrameFlow + AlphaFold2 结构模块

折叠的「教练」是六层 IPA 堆栈(AlphaFold2 结构模块风格)。网络维护每颗核苷酸的 single 表示和任意两核苷酸间的 pair 表示;碱基对图调制 attention bias,使配对位置信息交换更强。在任意时刻 $t$,速度场网络 $\mathbf{v}_\theta(\mathbf{T}_t, t)$ 根据当前帧预测去噪后的 clean 帧 $(\hat{r}_1, \hat{x}_1)$。

IPA 同时做两件事:用序列特征计算点积亲和力,用当前三维帧计算距离亲和力。两路相加后经 Softmax 更新表示——既看「说明书上谁该配对」,也看「它们现在实际站得有多远」。G₁ 与 U₆ 因此被强化关联,环区 G₃、A₄ 则主要保持链连续,允许更大柔性。Fig.1b 右侧放大图展示的正是这一机制。

3.4 SE(3) 流匹配

流匹配(flow matching)学习从噪声到真实结构的向量场,轨迹比扩散模型更直、采样步数更少,适合一次生成 1000 个构象。RNAbpFlow 在 $\mathbb{R}^3$ 平移与 SO(3) 旋转的乘积流形上构造测地线路径:

$$
\mathbf{T}t = \exp{\mathbf{T}0}!\left(t \cdot \log{\mathbf{T}_0}(\mathbf{T}_1)\right)
$$

平移与旋转分别插值:

$$
\mathbf{x}_t = (1-t)\mathbf{x}_0 + t\mathbf{x}_1, \quad
\mathbf{r}t = \exp{\mathbf{r}0}!\left(t \log{\mathbf{r}_0}(\mathbf{r}_1)\right)
$$

训练时从 PDB 取真实结构为 $\mathbf{T}_1$,加噪得 $\mathbf{T}_0$,随机采样 $t \sim \mathcal{U}[0, 1-\epsilon]$($\epsilon=0.1$),让网络学会在任意中间时刻该往哪推。平移先验为 $\mathcal{N}(0,I_3)$,旋转先验为 IGSO3($\sigma=1.5$);推理时旋转用指数调度 $e^{-ct}$($c=10$)离散积分。对 6-mer 发夹,$t=0$ 时珠子散乱,$t=0.5$ 时茎部开始靠近,$t=1$ 时发夹成形;重复采样 1000 次即得构象集合。相对 RNA-FrameFlow(无条件)与扩散模型,这一范式在保持精度的同时显著降低了 ensemble 采样的计算成本。

SE(3) 流匹配:从噪声到折叠结构(科普示意图)

3.5 损失函数

训练时不只看整体形状,还显式约束碱基对几何——这是 RNAbpFlow 相对「只看序列」方法大幅提升的关键:

作用
$L_{\mathrm{trans}}$ 平移向量场 MSE,按 $(1-t)^{-2}$ 加权
$L_{\mathrm{rot}}$ SO(3) 旋转对数映射损失
$L_{\mathrm{tors}}$ 9 个二面角 sin/cos 嵌入 MSE
$L_{\mathrm{bp3D}}$ 配对核苷酸 C1′–C1′ 距离 MSE(三注释器并集)
$L_{\mathrm{bp2D}}$ 预测 2D 接触图 vs 三实验图的 BCE

$$
L_{\mathrm{total}} = 2 L_{\mathrm{trans}} + L_{\mathrm{rot}} + L_{\mathrm{tors}} + L_{\mathrm{bp3D}} + L_{\mathrm{bp2D}}
$$

$L_{\mathrm{bp3D}}$ 把 G₁–U₆、C₂–A₅ 拉到正确距离,$L_{\mathrm{bp2D}}$ 保证输出结构反推的配对图与输入一致。消融实验表明,去掉任一碱基对辅助项,茎区往往拉不近,采样质量明显下降(Fig. 4b)。

3.6 训练配置

  • PyTorch Lightning,Adam lr=$10^{-4}$,8× NVIDIA H100,1500 epoch(cross-distillation 集约 36 h)。
  • Fine-tune:在 IPKnot / SPOT-RNA / RibonanzaNet 预测 2D 上再训 200 epoch,lr=$10^{-5}$,缩小 noisy vs native 2D 差距。
  • Cross-distillation 增广:bpRNA-1m(90) 筛得 2170 条 AF3 高置信预测(plDDT≥60,PAE≤15,无 MSA),与 994 条 PDB 实验结构约 1:2.2 混合 batch。

4. 实验设计与基准

基准 训练 cutoff 测试规模 对比对象
RNA3DB 内部 2024-04-26,560 训 / 48 测 每靶 1000 samples 自身 ablation
RNAJP 采样 同上 12 个三向 junction RNAJP(MD 粗粒化)
CASP15 PDB < 2022-04,731 训 6 natural + 4 synthetic DRfold、NuFold、trRosettaRNA、RhoFold+、物理方法等
CASP16 盲测 PDB ≤ 2024-04-06,994+2170 28 靶(主分析 ≤200 nt 共 14 靶) AF3-server、Yang-Server、AF3/NuFold/trRosettaRNA2/DRfold2

公平性:与深度学习竞品比较时均不提供 MSA;物理方法可给 native DBN(DSSR 提取)。

ensemble 选代表结构:用作者先前 lociPARSE 估计 pMoL,从 1000 个样本中选 top 结构用于 CASP15 单模型指标。

主要指标:TM-score(US-align, C3′)、lDDT、GDT-TS、全原子 RMSD、INF(Watson–Crick / NWC / Stack)、MolProbity 立体化学。


5. 主要结果

5.1 相对 RNAJP(构象采样)

在 12 个三向 junction 靶标上各采样 1000 个 decoy,RNAbpFlow 在全局拓扑与局部构象上均优于传统 MD 粗粒化采样器 RNAJP:

指标 RNAbpFlow RNAJP
平均 mean lDDT 0.66 0.59
平均 mean TM-score 0.38 0.32
至少 1 个 TM>0.45 的靶比例 66.7% 41.7%
至少 1 个 lDDT>0.75 的靶比例 25% 0%
全部 decoy 中 TM>0.45 占比 13.4% 1.73%

![原文 Fig.2 Sampling performance comparison with RNAJP](./DOI-s41592-026-03128-4-RNAbpFlow-RNA三维结构条件流匹配/Sampling performance comparison with RNAJP..png)

Fig.2 从三个角度印证了上述结论。汇总表(a)显示 RNAbpFlow 在 TM-score 与 lDDT 上全面领先。3D 叠合图(b)更直观:以 2HGH(55 nt)为例,预测结构(蓝)与 native(绿)几乎重合(TM 0.53),而 RNAJP 仅 0.40;在更长的 3PDR(160 nt)上优势依然保持。互作网络图(c)进一步表明,RNAbpFlow 不仅整体形状更准,碱基对和堆积关系(INF 分数)也恢复得更好。

5.2 CASP15(预测模式)

在 CASP 官方评测中,RNAbpFlow 的优势进一步得到验证。

Natural RNA(6 靶,predicted 2D 条件):RNAbpFlow 优于 NuFold、trRosettaRNA、RhoFold+、DRfold 等(Table 1)。

Native 2D 条件(上界):

  • TM-score 0.48 vs predicted 2D 0.40(+20%)
  • RMSD 7.77 Å vs 10.70 Å(−27.4%)
  • INF-NWC 0.62 vs 0.48(+29.2%)
  • 全部 pseudoknot 恢复

物理方法即使给 native DBN,TM-score 最高仅 ~0.34(Vfold)。

5.3 CASP16 盲测(≤200 nt,14 靶)

两年后的 CASP16 盲测提供了更大规模、更严格的检验。

对比 结论
vs AF3-server / Yang-Server(CASP 官方 top server,用 MSA) RNAbpFlow ensemble max TM/lDDT 平均更高
浅 MSA($N_{\mathrm{eff}}\le130$)硬靶 RNAbpFlow consistently 优于两 server
深 MSA 易靶(如 R1263/R1264) Server 可比或更好 → 揭示 RNAbpFlow 不借进化信息的 trade-off
vs AF3 / NuFold(本地,无 MSA,1000 samples) RNAbpFlow max TM/lDDT 更优;85.7% 靶 ensemble 含 TM>0.45,AF3 为 57.1%
>200 nt 仍优于 NuFold/trRosettaRNA2/DRfold2;略逊于 AF3;predicted 2D INF 从 0.84→0.51,是主要瓶颈

![原文 Fig.3 RNAbpFlow vs state-of-the-art on CASP16](./DOI-s41592-026-03128-4-RNAbpFlow-RNA三维结构条件流匹配/RNAbpFlow can sample higher-quality 3D structures than state-of-the-art methods..png)

Fig.3 是 CASP16 盲测最亮眼的一组证据。性能表(a)中 RNAbpFlow 以 avg max TM 0.61、lDDT 0.72 居首,超过使用 MSA 的 AF3-server(0.54/0.64)和 Yang-Server(0.54/0.63)。逐靶 ΔTM 柱图(b)显示,14 个靶中多数 RNAbpFlow 占优,尤其在 hard target R1255(124 nt)上优势最大。3D 视觉对比(c)最能说明问题:R1288 上 RNAbpFlow 的蓝绿结构几乎重合(TM 0.63),而两 server 仅 ≈0.28–0.40;R1255 的「分叉手臂」方向,RNAbpFlow 达到 TM 0.71,server 却折向错误方向。在浅 MSA 硬靶上,显式 2D 条件 + 大规模 ensemble 采样可以弥补不借进化信息的短板;但当序列超过 200 nt、predicted 2D 质量下降时,性能瓶颈也随之显现。

5.4 碱基对 fidelity 与条件服从性

上述结果也揭示了一个重要特性:模型对输入碱基对图高度敏感。

  • Native 2D 输入:输出 INF vs 输入 ≈ 0.93(高度忠实)。
  • Predicted 2D 输入:INF ≈ 0.84——模型强服从输入,即使输入有误也会「忠实实现错误配对」,并引入约 更多 false-positive 碱基对。
  • Spearman:输入 INF 与 ensemble lDDT 相关性强于 TM-score → 准确 2D 更利于局部正确性。

5.5 消融(RNA3DB 48 测,1000 samples/靶)

配置 avg max TM avg max lDDT
仅序列(无 2D) 0.36 0.46
三注释器 2D 联合 0.51 0.71
相对 baseline +41.7% TM +54.3% lDDT

三图联合优于任一单图;去掉 bp2D/bp3D 辅助损失均降质。

5.6 Cross-distillation + fine-tune(CASP16 ≤200 nt)

变体 avg max TM avg max lDDT
无 distillation + predicted 2D 0.50 0.61
有 distillation + predicted 2D 0.57 0.69
distillation + native 2D 0.68 0.77
+ fine-tune on predicted 2D 0.61

6. 优势、局限与讨论

6.1 优势

  1. MSA/模板自由:在 RNA MSA 稀缺靶上相对 AF3-server 更有优势(CASP16 14 靶中仅 4 个深 MSA)。
  2. 显式 2D 条件 + ensemble:一次生成 1000 构象,刻画柔性;碱基对比序列跨物种更保守(作者论点)。
  3. 流匹配效率:相对扩散,更适合大规模采样(相对 RNA-FrameFlow 有条件、全原子)。
  4. 端到端全原子:无需后处理 geometry optimization(默认 pipeline);PyRosetta relax 可改善立体化学且几乎不伤 TM/lDDT(Supp. Table 13)。
  5. 开源:GPLv3 代码 + Zenodo 训练数据。

6.2 局限

  1. 强依赖 2D 质量:predicted 2D 不准时 3D 上限明显;长 RNA(>200 nt)predicted INF 骤降。
  2. 立体化学:默认 clash / 键角违规多于物理方法(无内置 refinement);需可选 relax。
  3. 长度与架构:训练集 ~92% ≤200 nt;超长 RNA 需 subquadratic 架构(稀疏 attention / 局部 message passing)。
  4. 「忠实错误输入」:predicted 2D 错配会被高 INF 复现,可能增加 spurious pairs。
  5. CASP15 样本量小($n=6$ natural),统计检验需谨慎。

6.3 作者展望

  • 融入 MSA、SHAPE/DMS 化学探测、交联稀疏约束;
  • 探索 FR3D 等开放 2D 注释 pipeline;
  • 扩展多链 / 复合物(当前 focus 单链 monomer)。

7. 与相关方法对比(概念层)

方法 进化信息 2D 条件 生成范式 输出
trRosettaRNA / RhoFold+ MSA / LM 部分 判别 + 能量最小化 单结构
NuFold 可选 predicted 2D 判别,核碱基中心 单结构
DRfold(2) 弱/无 判别 单结构
AF3 MSA + template 隐式 扩散式联合建模 少样本
RNA-FrameFlow 无条件流匹配 骨架
RNAbpFlow 显式三通道 2D 条件流匹配 全原子 ensemble

ProteinMPNN(结构→序列)相反,RNAbpFlow 是 序列+2D→3D 构象分布,同属生成式结构建模谱系。


8. 使用与复现要点

1
2
3
# 仓库:https://github.com/Bhattacharya-Lab/RNAbpFlow
# 依赖 PyTorch;推理需序列 FASTA + 三份 L×L 碱基对矩阵(或默认 2D 预测 pipeline)
# 训练数据:Zenodo 10.5281/zenodo.19388910

实践建议

  1. 优先提升 2D:IPKnot + SPOT-RNA + RibonanzaNet 共识或投票;长序列尤其重要。
  2. ensemble 1000 + lociPARSE 选模(CASP15 协议)或按 TM/lDDT 选 top-k。
  3. 交付前 PyRosetta relax 若下游需要低 clashscore。
  4. MOO 结合:TM-score vs 采样时间 / vs 2D INF 可画 Pareto 前沿选部署点。

9. 小结

维度 要点
核心创新 碱基对增强的条件 SE(3) 流匹配 + 核碱基中心全原子表示 + bp2D/bp3D 辅助损失
适用场景 无深 MSA 的 RNA;需要构象集合;已有或可信的 2D(native 或高质量预测)
性能亮点 CASP16 盲测 ≤200 nt 上 ensemble 质量优于无 MSA 的 AF3,并可与 MSA-server 抗衡 hard targets
主要瓶颈 predicted 2D 质量;>200 nt;默认立体化学

RNAbpFlow 将 RNA 3D 建模从「借进化信息猜单结构」推向「在 2D 约束下流式采样全原子 ensemble」,与 RNA 柔性生物学更一致;工程上,2D 预测 pipeline 的质量将成为与模型本身同等重要的上游环节

段末注释SE(3) 为三维特殊欧氏群,旋转+平移对称性;等变(equivariant)网络在该群作用下输出随输入协变,是结构深度学习的标准归纳偏置。


10. 参考文献(原文精选)

  1. Tarafder S., Bhattacharya D. Nat. Methods (2026). doi:10.1038/s41592-026-03128-4
  2. Yim J. et al. SE(3) flow matching / FrameFlow — arXiv:2310.05297
  3. Kagaya Y. et al. NuFold — Nat. Commun. 16, 881 (2025)
  4. Anand R. et al. RNA-FrameFlow — TMLR (2025)
  5. Abramson J. et al. AlphaFold 3 — Nature 630, 493–500 (2024)
-------------本文结束感谢您的阅读-------------