这是系列的总览,也是团队对齐用的那一页。蛋白质工程(protein engineering,PE)改序列,让蛋白在指定应用里更好用。自然选择优化的是生物适合度,不是反应器、注射方案或洗涤剂配方;天然序列几乎总是起点,不是可交付物。
本篇交付三样:立项时能写下的真正目标、选路线时用的预测 / 筛选判据、报结果时同一套 $\Delta G$ 验收语言。后面各篇按工序展开,不在这里堆操作细节。
段末注释:蛋白质工程通常改编码基因,使宿主合成变体蛋白;遗传工程更常指把一个基因放到另一个生物里。前者改「这个蛋白好不好用」,后者改「这个生物会不会做这个蛋白」。

1. 为何必须工程,而不是「拿来就用」
进化只维持刚好够用的性质。中温菌蛋白在高温下会展开,而同源的嗜热菌蛋白能扛住同一温度,说明序列空间里「更稳」的解存在,只是中温环境给不出选择压。多余的稳定性、催化速度或结合强度若不再提高适合度,会被遗传漂变慢慢吃掉。
因此工程问题几乎总是:
- 场景变了(有机溶剂、高温、非天然底物、注射而非胰腺分泌);
- 指标变了(剂量、半衰期、对映体纯度、单位酶产率);
- 天然蛋白只是起点,不是终点。
经典对照:枯草杆菌蛋白酶(subtilisin)能耐受热水和表面活性剂,却被漂白剂氧化失活;把活性位点附近易氧化的 Met222 换成 Ala,就得到可用的洗涤剂蛋白酶。胰岛素的生理目标仍是控糖,但给药方式从「持续微量分泌」变成「餐前注射 / 夜间基底」,于是要分别工程成快效(lispro)与长效(glargine)类似物。
2. 立项只收四类目标
应用千差万别,方案把「必须改的蛋白性质」收成四类。立项先把应用句翻译成其中一类,并写出需要改多少(例如 $T_{\mathrm{m}}$ 提高 $8^{\circ}\mathrm{C}$,$K_{\mathrm{d}}$ 降 10 倍)。没有幅度的目标无法排期。
| 目标 | 英文 | 比较的是什么 | 应用里长什么样 |
|---|---|---|---|
| 稳定性 | stability | 功能态相对失活态是否更占优 | 耐热、耐溶剂、耐储存、血浆半衰期、耐受后续功能突变 |
| 结合 | binding | 复合物相对游离组分 | 抗体更咬抗原;或反过来:去免疫原性、减少受体介导清除 |
| 反应性 | reactivity | 过渡态相对酶+底物 | 更快、吃新底物、关掉有毒活力、开出新反应类型 |
| 选择性 | selectivity | 两种结合或两种反应的相对优劣 | 底物 / 配体判别、对映体选择、主产物对副产物 |
稳定性谈的是「还能不能工作」;结合谈「抓得紧不紧」;反应性谈「转得快不快」;选择性谈「在混合物里偏谁」。
**真正目标(true goal)**是:若只改这一条、其余不变,应用仍然变好。同时变好的其他性质常常是副作用或实现路径。例如工程一种更会切 Pro–Gln 的谷蛋白蛋白酶时,结合、选择性、反应性可能一起变;但若反应性没升,只是对 Pro–Lys 更挑食,对患者饮食没有帮助——真正目标是反应性,更紧的结合只是假设中的手段。
段末注释:真正目标是应用改善所必需的那条性质;假设是「怎样改能量差才能带动这条性质」。先写目标,再写假设,避免把 $K_{\mathrm{d}}$ 下降误当成已经成功。
3. 三条应用战线,同一套目标语言
医、农、工约束差几个数量级,但目标语言相同:都是四类性质之一(或有限组合)。排案例是为了对齐口径,不是为了背清单。
| 战线 | 例子 | 落到哪一类 |
|---|---|---|
| 医 | 曲妥珠单抗人源化并补 7 个框架突变,恢复对 HER2 的阻断 | 结合(兼降低免疫原性) |
| 医 | SARS-CoV-2 刺突蛋白多处 Pro 替换,锁在融合前构象 | 稳定性(构象) |
| 农 | 植酸酶耐制粒高温;Bt 毒素加强对昆虫肠靶标的结合 | 稳定性 / 结合 |
| 工 | 淀粉酶耐低 pH 与高温;转氨酶 27 处突变做西格列汀 | 稳定性 + 反应性 + 选择性 |
工业酶典型代价约 $$100/\mathrm{kg}$ 量级,治疗蛋白可高数个数量级;约束不同,但能量语言相同。用酶替换危险试剂,是绿色化学(green chemistry)里「降危害本身、而不只是降暴露」的一条主路。
4. 一条因果链:突变如何变成性质
方案里所有后续计算和筛选,都挂在同一条因果链上:
氨基酸替换 → 非共价相互作用与熵 → 各宏观态的相对吉布斯能 → 可测性质。
蛋白以宏观态(macrostate)存在:折叠 / 去折叠、游离 / 结合、酶+底物 / 酶·过渡态。态与态的吉布斯能差 $\Delta G$ 决定平衡;垒高决定快慢。工程做的是差分稳定(differential stabilization):让目标相关的两个态能量差朝有利方向动,而不是「整分子一律更稳」。
室温下数量级对照:$\Delta G$ 每差约 $1.36,\mathrm{kcal,mol^{-1}}$,平衡常数大约差 10 倍。
$$
\Delta G = -RT\ln K
$$
| 性质 | 关键能量差 | 工程方向 |
|---|---|---|
| 稳定性 | $\Delta G_{\mathrm{unfold}}$(去折叠 − 折叠) | 增大(稳折叠 或 捣乱去折叠) |
| 结合 | $\Delta G_{\mathrm{d}}$(游离 − 复合物) | 增大(更难解离) |
| 反应性 | $\Delta G^{\ddagger}$(过渡态 − 酶+底物) | 减小(稳过渡态) |
| 选择性 | 两条路径的 $\Delta\Delta G$ | 拉开差距 |
酶不能改反应的热力学 $\Delta G^{\circ}$(只取决于底物与产物),只能改到达平衡的速度。这一点把「反应性」和「稳定性 / 结合」从概念上切开。
5. 两条策略:预测,或筛选
理性设计(rational design):根据结构、机制和计算,提出少数替换,再实验验证。适合机制清楚、结构可靠、目标能写成「稳某一个态」的问题(许多稳定性位点、部分结合界面)。
定向进化(directed evolution,DE):造多样性文库 → 筛选或选择 → 把优胜者当下一轮亲本。适合机制不清、上位性(epistasis)强、需要同时改多个性质、或计算反复说不准的问题。西格列汀工艺里的转氨酶起始对目标酮几乎无活力,最终换了 27 个残基,是这条路的工业标杆。
实际项目很少纯走一条:计算缩小位点,饱和突变或易错 PCR 补实验;DE 打出的热点再回结构解释。机器学习辅助工程是第三条加速带,但仍要先有本篇的目标定义与能量语言,否则模型在优化一个错的标签。
段末注释:理性设计用先验结构/机制压缩搜索空间;定向进化用可筛选的表型代替机制理解。二者都改变同一条 $\Delta G$ 链,差别只在「谁来提议下一个突变」。
6. 最小作业流程
- 写应用句:在什么条件下、对谁、成功长什么样。
- 翻译成四类之一,并给出幅度(倍数或 $\mathrm{kcal,mol^{-1}}$)。
- 列出不可破坏的已有性质(表达量、原底物活力、免疫原性……)。
- 画出相关态:折叠/去折叠?游离/结合?哪一个过渡态?两条竞争路径?
- 选策略:态清楚且结构好 → 先理性/计算;否则先可筛选的 DE,或二者交错。
- 先做出蛋白,再谈设计:没有表达与突变方法,图纸不会变成数据。
- 用同一指标定义成功:改进因子 $>1$ 才算赢;稳定性应比较 $1/K_{\mathrm{unfold}}$,不要误把更容易去折叠当成「更活」。
7. 验收
- 把「提高抗体药效」翻译成四类目标时,可能是结合、稳定性(血清半衰期)或降低非靶结合。你怎么用「只改一条、应用是否仍变好」来判决?
- 嗜热菌聚合酶很稳,却常不适合室温应用。缺的是哪一类性质?
- 计算预测 $\Delta\Delta G_{\mathrm{unfold}}=+2,\mathrm{kcal,mol^{-1}}$。这对应大约多少倍的去折叠平衡变化?下一步必须做什么?
(1:药效是应用句,不是目标;分别设想「只改 $K_{\mathrm{d}}$ / 只改清除 / 只改脱靶」哪种仍让临床指标变好。2:反应性——室温 $k_{\mathrm{cat}}$ 往往不够。3:约 30 倍量级;必须实测,计算只是提议。)
8. 依据与边界
口径对照 Protein Engineering(Kazlauskas)。原书 Ch.4 / Ch.7 / 部分 DE 章仍在修订,本方案对应工序只写已能稳定使用的部分,不拿未定稿章节充完整流程。
表达常用 pET;稳定性和结合提议常用 FoldX、Rosetta、AlphaFold。$\Delta\Delta G$ 与实验相关有限,柔性、溶剂化和协同突变容易算错。没有与真正目标同构的湿实验,计算输出只是待测清单。