| 项目 | 内容 |
|---|---|
| 题目 | Miniaturizing and modifying natural proteins with Raygun |
| 期刊 | Nature(2026-07-29,Open Access,CC BY-NC-ND 4.0) |
| 作者 | Kapil Devkota、Daichi Shonai(共一);通讯 Scott Soderling、Rohit Singh(Duke University 等) |
| DOI | 10.1038/s41586-026-10842-8 |
| 代码 / 数据 | GitHub: rohitsinghlab/raygun;训练数据 Zenodo;设计序列 AddGene |
总体来说:Duke 团队提出 Raygun——以现有蛋白为模板,把蛋白质语言模型(Protein Language Model,PLM)嵌入压缩成固定维度的概率分布,再用 noise(替换强度)与 target length(indel 目标长度)两个参数一次性生成可变长候选(相较于大部分设计方案以替换稳住,本方法主要是考虑了indel来改变蛋白长度);在荧光蛋白、TurboID 生物素连接酶与 EGF–EGFR 结合三条湿实验链路上,部分候选保留了功能,但极端微型化与超高活性工程化性状仍依赖下游筛选或定向进化。
1. 要解决的问题
天然蛋白进化同时依赖点突变与 indel,但现有计算设计大多只能在固定长度上做替换,或走 de novo 从头生成——能否在保留模板结构与功能语法的前提下,对天然/工程蛋白做大规模、协同的替换 + indel,且计算上可并行、可筛选?
更具体地说:给定一条模板序列,能否只调两个标量,就系统性地生成 10–25%(有时 >50%)缩短、或适度放大的变体,并在功能位点(活性中心、发色团、结合界面)上仍保持合理保留率?
2. 现阶段的常见方案
de novo 路线(RFdiffusion、Genie 2、ESM-3 等)擅长从约束出发「造新蛋白」,但长度通常在生成时固定,生成后再改长度往往只能做替换,indel 空间难以系统搜索。
模板引导的替换设计(逆折叠 ProteinMPNN、PLM 嵌入空间采样、inpainting 类 EvoDiff / DPLM)在同长度变体上已较成熟:对单点或局部替换,PLM 嵌入附近采样即可得到功能保留变体。但一旦需要删结构域、缩环区、适配 AAV 包装上限,或在短肽模板上做适度延伸,嵌入维度随序列长度变化,不同长度蛋白的表示不可直接比较,indel 设计在表示层就卡住。
手工结构生物学路线(如 UltraID 删除 TurboID 的 DNA 结合域)能成功,但依赖领域知识指定删哪里;作者希望用数据驱动方式自动找到可删冗余区。
其实也是目前技术实现路径上的一个技术缺口:缺少一种 length-agnostic(长度无关)的模板表示,使「从同一模板出发、任意目标长度、单次采样」成为可 tractable 的设计操作,而不是迭代贪心删残基或固定长度 inpainting。
3. 作者提出的新思路
核心假设:PLM 逐残基嵌入虽随长度变化,但相邻残基信息高度冗余;把序列切成固定数量 $K$ 个 block 并对每 block 做聚合后,可用多元高斯分布近似该蛋白在嵌入空间的「功能–结构语法」,从而把任意长度蛋白映射到同一固定维空间。
设计选择对照直觉:
- 若假设成立:同一模板在不同 target length 下采样,应仍预测为相似 fold(TM-score 等),且功能位点保留率高于随机 indel 基线。
- 若假设不成立:缩短/放大后结构指标应随机崩溃,或 indel 会集中破坏活性中心——实验上作者报告功能位点保留比高于整体序列保守比(>1.0)。
Raygun 定位是模板引导设计(template-guided design):从天然流形上的蛋白出发向外探索,与 de novo「从远处收敛到流形」互补;AAV 载荷、融合标签体积、结构域裁剪等场景,属于「长度错了但其余性质已对」的工程痛点。

段末注释:TM-score 衡量预测结构与模板结构的全局相似性(0–1,越高越像);后文结构保留讨论默认指 AlphaFold3 / OmegaFold 等预测结构相对模板的 TM-score。
4. 方法与原理
4.1 输入 → 输出
| 输入 | 含义 |
|---|---|
| 模板氨基酸序列 | 任意天然或工程蛋白 |
| noise $\sigma$ | 缩放高斯协方差,控制替换/序列多样性 |
| target length $L_{\mathrm{out}}$ | 目标序列长度,驱动 indel |
| 输出 | 含义 |
|---|---|
| 一条长度 $L_{\mathrm{out}}$ 的候选序列 | 经 ESM-2 解码器从重建嵌入反推 |
单次生成在 NVIDIA A100 上约 0.3 s;作者称相对 diffusion de novo 路线约 100× 更快(同文比较口径,非独立基准)。
4.2 固定维概率编码
- 用 ESM-2 650M 得长度 $n$ 的嵌入矩阵(每残基 1280 维)。
- 划分为 $K=50$ 个等长 block(block 内残基数随 $n$ 缩放,如 500 aa 模板约 10 aa/block)。
- 对每个 block 的嵌入向量取平均;由中心极限定理,block 统计量近似多元高斯。
- 50 个 block × 1280 维 → 固定 64,000 维表示,与原始 $n$ 无关。
- 推理时从该分布采样(noise 控制协方差),再解码到指定 $L_{\mathrm{out}}$。
与 diffusion(EvoDiff、DPLM 等)的差异:Raygun 走单步采样 + 解码器一步去噪,非迭代 denoising;trade-off 是探索方式不同,同长度 benchmark 上作者报告结构/功能保留与 inpainting 方法相当(见 Extended Data Fig. 5f、9b)。
4.3 Raygun 架构(auto-encoder)
- Encoder:ESM-2 嵌入 → 多级 T-Block(Transformer + 1D 卷积,抓全局与局部)→ Reduction(block 内平均,产出固定长表示)。
- Decoder:固定长 latent → Repetition(按 $L_{\mathrm{out}}$ 展开为变长嵌入)→ T-Block → 重建嵌入 → 预训练 ESM-2 序列解码器(验证准确率 >99%)。
- 参数量约 701M;在 UniRef50 ~80k 蛋白上自监督训练(作者亦展示更大数据/更大模型可继续提升)。
训练目标(三轴一致):
- 嵌入空间重建损失;
- 序列空间交叉熵(经 ESM-2 解码);
- size-invariance loss:固定长表示 → 解码更短序列 → 再编码 → 惩罚 latent 漂移(保证跨长度生成稳定)。
推理技巧:
- 一步 recycling:将生成候选再作模板过一遍,提升质量/多样性;
- decoder 微调:encoder 管多样性、decoder 管保真;对目标家族只微调 decoder 可达 BLOSUM >0.99,且多样性下降有限;
- 下游过滤:伪对数似然 pLL(PLM 适应度代理)+ 长度校正 pLL(跨长度公平排序);常配合 HMMER/Pfam、TemStaPro、任务专用 predictor(如 GFP 亮度模型)。
原文 Fig.1 为官方总览(Nature 原文 Fig.1);本文为 CC BY-NC-ND,此处不转载原图,以上文字对应原文 Fig.1a–h 流程。
5. 主要结果
5.1 计算内:结构与功能语法保留
对 血红蛋白(147 aa)、CCR1(355)、lacZ(1024)、mTOR(2549)(跨度约 17×)各生成 2000 候选,保留 length-adjusted pLL 前 5%:
- 在 ±10% 长度变化内,中位 TM-score ≈ 0.78;
- mTOR 缩短 >500 aa(>20%)时 TM-score 仍约 0.7;
- 更激进设置下可减半或加倍长度、或 >50% 残基替换,结构仍「 broadly 保留」(作者表述,需结合具体蛋白看)。
- indel 位置:不完全堆在单环区;小幅缩短时略偏 loop,大幅缩短时偏好减弱;α/β 删除比例大致均衡。
- 功能位点:有注释的活性/结合位点,其保留率相对全序列保守率之比 >1.0(5%/10%/25% 删除率均如此),提示 implicit 偏好 functional site。
- Pfam 结构域:50–200% 家族长度范围内,50.65% 候选保留结构域;优于匹配 indel/替换率的随机序列基线约 15%。
- 与 EvoDiff / DPLM 同长度对比(60 个酶,匹配序列同一性分布):结构保留与 CLEAN EC 预测功能保留相当;Raygun 额外支持 indel。
5.2 湿实验一:微型化荧光蛋白(eGFP / mCherry)
设置:各 70,000 候选,目标长度 195–235 aa;过滤 = pLL(去掉 90%)+ hmmscan(Pfam)+ 自定义亮度 predictor → 8 条实验验证。
| 指标 | 结果(相对模板/数据库) |
|---|---|
| 缩短幅度 | eGFP 最多 −25 aa(10.5%) → 199 aa;mCherry −37 aa(15.6%) → 206 aa |
| 与 FPbase 比 | 2 条短于 96% 已知荧光蛋白 |
| 细胞荧光 | 6/8 有明显荧光(XFP01/02/04/05/06/08);XFP03/07 阴性 |
| 发色团约束 | 未硬性指定 XYG motif 或 Hayes et al. ESM-3 GFP 设计中的 6 残基/58–71 约束;多数仍自发保留发色团;1 条含非经典发色团 |
对照含义:相对 Hayes et al. Science 2025 ESM-3 de novo GFP(固定 229 aa + 强约束),Raygun 走「更短 + 更弱约束」路线,亮度普遍偏低——与荧光蛋白 narrow fitness landscape(Sarkisyan Nature 2016)一致,作者亦预期需定向进化提亮。
5.3 湿实验二:微型化 TurboID
设置:500,000 候选;moderate 195–235 aa + extreme 150–180 aa;过滤含 TemStaPro、pLDDT、TM-score 等 → 11 条验证。
| 候选 | 要点 |
|---|---|
| TurboID-1(317 aa,−1%) | 有显著生物素连接活性 |
| TurboID-5(304 aa,−6%) | 有显著生物素连接活性 |
| TurboID-11(165 aa,约 −50%) | 自发删除 DNA 结合域(与手工 UltraID 策略一致);可表达但连接活性不显著 |
| 表达 | 6/11 有 HA western 信号 |
解读:对多结构域、经定向进化强化过的 supra-evolutionary 活性(TurboID 相对 BirA),PLM 统计 alone 不足以保证极端缩短后仍高活性;moderate 缩短更可靠。
5.4 湿实验三:放大 EGF 提升 EGFR 结合(Adaptyv 竞赛)
设置:模板 EGF 53 aa(接近 Raygun 最短阈值 ~50 aa),放大至 55–57 aa;decoder 在 5 条 EGF-like 序列上微调;10,000 候选;用 ProTrek 三模态 PLM 按序列预测 EGFR 结合潜力排序(非 iPTM/iPAE 结构界面指标)。
| 变体 | $K_{\mathrm{d}}$(µM) | 相对 WT EGF(0.759 µM) |
|---|---|---|
| EGF-Raygun-1 | 0.274 | 更强 |
| EGF-Raygun-2 | 0.561 | 更强 |
| WT EGF | 0.759 | — |
10 条提交中 4 条进入生物测试,2 条结合更强;作者称在同竞赛 EGF 路线中 $K_{\mathrm{d}}$ 最优。序列同一性更低者(Raygun-1 70.7%)反而更好,改动多在外围位点,提示全局上下文影响结合,非仅界面残基。
段末注释:$K_{\mathrm{d}}$(dissociation constant,解离常数)越小表示结合越强;EGFR(epidermal growth factor receptor,表皮生长因子受体)为 EGF 靶标。
6. 局限、假设与审慎读法
- 训练规模:主文模型仅 ~80k UniRef50;超长蛋白(如 mTOR 2549 aa)零样本重建更难,作者建议微调;更大模型/数据改善有 Supplementary 证据,但主结论仍来自中等规模 checkpoint。
- 过滤负荷:高 hit rate 依赖 pLL + Pfam + 任务 predictor 等多级筛选;未过滤候选相对 greedy pLL 删残基基线虽更好保留功能位点,但最终实验 hit rate 仍低(荧光 6/8、TurboID 活性 2/11)。不能把「生成器 implicit 保留」等同于「无需实验」。
- 指标与真实功能:TM-score、pLDDT、ProTrek 相似度是代理;TurboID-11 说明「结构/interface 预测过关 ≠ 催化效率保留」,尤其对工程化超高活性酶。
- 极端缩小:自发删结构域在 TurboID 上与 UltraID 一致,但 50% 缩短丢活性——Raygun 找得到「像那么回事的序列」,不保证「好用」。
- 荧光亮度:成功变体多「有荧光但更暗」;与 de novo GFP 类似,需进化/筛选补亮度。
- 生物安全:作者签署 Responsible AI for Biodesign 原则;免疫原性、脱靶等治疗场景风险文中仅原则性讨论,未做系统性安全实验。
- 许可:代码与数据已开放;文章 CC BY-NC-ND,二次改编图/衍生序列用于商业需另查 AddGene 与许可条款。
7. 其他可对比参考的方法
| 方案 | 时间 | 核心差异 | 证据类型 | 何时更值得考虑 |
|---|---|---|---|---|
| EvoDiff / DPLM 等离散 diffusion inpainting | 2023–2024 | 同长度、迭代去噪;mask 指定编辑区 | 同长度酶功能 benchmark | 只需局部替换、不改长度 |
| ProteinMPNN + 结构约束 | 2022+ | 结构条件逆折叠,无 indel | 大量结构/design 案例 | 骨架固定、优化序列/稳定性 |
| Greedy pLL / ESM 删残基 | 通用 | 逐位删低 pLL 残基;无全局 indel 协调 | 文内 eGFP/mCherry/RAS 对照,功能位点保留更差 | 快速粗缩短、可接受大幅失活 |
| 手工结构域删除(UltraID) | 2022 | 领域知识指定删 DNA-binding domain | TurboID 172 aa 高活性 | 已知冗余结构域、要可解释编辑 |
| ESM-3 de novo GFP(Hayes Science 2025) | 2025 | 从头/强约束发色团,非缩短 | 488 条 de novo 荧光序列 | 要探索远源序列而非缩模板 |
| RFdiffusion / Genie 2 等 de novo | 2023–2024 | 新骨架/新 fold;长度固定 | binder/酶 de novo | 无合适模板、需全新几何 |
Raygun 的差异化在于 indel + 替换同一框架、单次采样、模板保真;若任务仅是 同长度点突变 或 已知删哪一段结构域,上表路线可能更简单、实验 hit rate 更可预期。
8. 对从业者的可操作含义
- AAV/融合标签体积:值得用 Raygun 批量生成「略短于包装上限」的载体蛋白/报告基因变体,再用任务 filter + 少量湿实验验证;优先 moderate(10–20%)缩短。
- 先跑官方 checkpoint + pLL 排序:GitHub 提供 notebook;注意使用 length-adjusted pLL 跨长度比较。
- 酶/探针已是 directed evolution 产物:TurboID 案例表明 >30–50% 缩短需准备进化回路;Raygun 输出适合作 起始库,不是终产物。
- 短肽放大(EGF 类):可对极短模板做 magnification + 家族微调 decoder + ProTrek/结合 assay;外围位点可能带来 affinity 增益,需实验确认特异性。
- 与 de novo 联用:de novo 得到正确功能但长度超标时,用 Raygun 作 post-hoc 缩短,比重新 diffusion 更省算力(作者 Discussion 主张,需自行验证具体蛋白)。
9. 小结
- 问题:固定长度 PLM 设计难以系统做 indel,模板引导的大规模「换 + 删 + 加」缺乏统一表示。
- 思路:$K=50$ block 高斯压缩 → 固定维 latent;noise + target length 两参数控制生成。
- 最硬证据:EGF-Raygun-1/2 在 Adaptyv 竞赛中 $K_{\mathrm{d}}$ 优于 WT;荧光蛋白 6/8 有活性且 2 条短于 FPbase 96% 条目。
- 最要紧边界:极端微型化与 supra-evolutionary 酶活性 不能单靠 Raygun + PLM filter;TurboID-11 可表达但无活性即是反例。
- 发表后对照:48 小时内无新主线;同长度 diffusion/inpainting 与 de novo 仍是互补而非替代。
10. 参考文献与延伸
- Devkota K. et al. Miniaturizing and modifying natural proteins with Raygun. Nature (2026). DOI:10.1038/s41586-026-10842-8
- 预印本:Devkota K. et al. bioRxiv (2024). DOI:10.1101/2024.08.13.607858
- 代码:github.com/rohitsinghlab/raygun
- PLM 骨干:Lin Z. et al. ESM-2. Science 379, 1123–1130 (2023).
- de novo GFP 对照:Hayes T. et al. ESM-3. Science 387, 850–858 (2025).
- UltraID:Kubitz L. et al. Commun. Biol. 5, 657 (2022).
- EGFR 竞赛:Cotet T.-S. et al. bioRxiv (2025). DOI:10.1101/2025.04.17.648362
- ProTrek:Su J. et al. Nat. Biotechnol. (2025).
- 原文配图与 Extended Data:Nature 文章页