结构分区:先认出区域,再决定改哪一块

图 1 工程要认的是可动手的块:核、表面、口袋、界面、loop、结构域、末端与无序区


1. 四级是地图,分区是工位

蛋白质结构按嵌套层次描述:一级结构(primary structure)是残基共价顺序;二级结构(secondary structure)是主链局部几何($\alpha$-螺旋、$\beta$-折叠、转角、loop);三级结构(tertiary structure)是单链整体折叠;四级结构(quaternary structure)是多亚基装配。工程不改「三级」这个词,改的是落在某个工位上的残基。

段末注释一级到四级回答「这是什么层次的对象」;工位回答「这一段残基在折叠体里干什么」。立项目标写在四类性质上,突变必须落到工位上,两套语言不能混写。

工程常用的工位:

工位 在分子里是什么 动它通常改什么
疏水核 埋藏的 $\alpha/\beta$ 骨架与侧链堆积 折叠稳定性;改坏则聚集
溶剂表面 相对可及性高的残基 溶解度、免疫原性、表面盐桥
口袋 / 活性位点 凹腔及其内衬残基 结合、催化几何
第一壳 / 第二壳 直接接触配体的残基 / 撑住第一壳的残基 反应性、选择性
活性 loop / 通道 围出口袋或隧道的柔性段 $k_{\mathrm{cat}}$、$K_{\mathrm{M}}$、对映选择
结构域与铰链 独立折叠块及其连接 域取向、融合蛋白间距
亚基界面 链–链接触面 寡聚、变构、清除
末端 / 前肽 N、C 端及可切前体段 表达、标签、成熟切割
天然无序区 无稳定三级的区段 调控、降解、接头设计

**第一壳(first shell)**是与底物、过渡态或配体直接接触的残基;**第二壳(second shell)**是接触第一壳、不直接碰配体的残基。催化三联体属于第一壳,通常锁死;功能改造更多发生在第二壳和活性 loop。

段末注释第一壳决定化学接触;第二壳决定第一壳站不站得住。只改第一壳常把酶「改死」;只改表面又常改不到催化。


2. 成熟识别方案:有坐标用注释,没坐标用预测

社区把「认区域」分成两条路径:从三维坐标注释(看到了什么)和从序列预测(倾向是什么)。工程上优先注释,预测只在没有可靠坐标时用,并且必须标成假设。

要认的工位 成熟方案(社区常用) 输入 输出 主要风险
二级结构 DSSP / mkdssp(坐标注释);PSIPRED 等(序列预测) PDB/mmCIF 或序列 残基级 H/E/T/… 或倾向 把预测写成 DSSP 事实;缺失 loop 在晶体里「消失」
核 / 表面 溶剂可及表面积(solvent-accessible surface area,SASA)→ 相对可及性(relative solvent accessibility,RSA);FreeSASA、DSSP ACC 坐标 每残基暴露分数 探针半径与参照 ASA 不同,阈值不可混用
口袋 / 空腔 fpocket(Voronoi / $\alpha$-球);CASTp($\alpha$-shape) 坐标 口袋体积、内衬残基 晶体接触造假口袋;溶液构象未覆盖
底物通道 CAVER 等隧道算法 坐标或轨迹 隧道中心线与瓶颈残基 静态结构漏掉开关态
结构域 Pfam / InterPro(序列家族);CATH / ECOD(折叠分类) 序列或结构 域边界、折叠类型 边界差 5–10 残基就会切错融合位点
亚基界面 PDBe PISA 生物装配坐标 界面面积、残基、推测化学计量 不对称单位拷贝 $\neq$ 溶液寡聚
无序 / 柔性 IUPred、MobiDB;AlphaFold pLDDT;B-factor;氢氘交换质谱 序列或坐标 无序概率、置信度、交换快慢 低 pLDDT 也可能只是「难预测」
跨膜 / 信号肽 SignalP、DeepTMHMM 序列 信号肽、跨膜螺旋 切错信号肽会毁掉分泌构体
进化约束 ConSurf;多序列比对保守性 序列(+结构) 每位点保守色标 保守 $\neq$ 绝对不能动;共识突变也有假阳性

经验阈值(只作起点,须在本蛋白上核对):$\mathrm{RSA}<0.20$–$0.25$ 倾向核,$\mathrm{RSA}>0.40$ 倾向表面。催化残基、金属配位、辅因子接触以 UniProt 功能注释或复合物结构为准,不要用口袋体积代替机制。

一站式半理性服务器 HotSpot Wizard 把口袋、通道、柔性、保守性叠在一张图上,并可用 FoldX / Rosetta 滤掉明显不稳的替换。热稳定多点设计常用 FireProtPROSS:能量项 + 进化共识。它们是「缩小位点」的实现,不是验收。

段末注释SASA 是残基被溶剂看到的面积;RSA 是它相对该氨基酸完全暴露参照值的比例。DSSP 是基于坐标的二级结构字典,不是序列预测器。


3. 按目标选靶区,不要按「看起来好改」

立项四类目标对应不同工位。优先序是经验规则,不是禁令。

真正目标 优先动手 次优先 默认先锁死
稳定性 表面电荷互补、高 B-factor 表面、共识替换;核内体积互补(窄) 二硫键 / Pro 限制去折叠;界面加固寡聚 催化残基;核内 Pro 插入螺旋;核心改成带电
结合 界面热点、口袋内衬(非催化)、识别 loop 第二壳撑几何;末端若参与表位 只为「看起来更疏水」而改核
反应性 活性 loop、第二壳 通道瓶颈(底物进出) 第一壳催化残基、金属配位,除非目标就是关掉毒性活力
选择性 接触「差别基团」的 loop / 第一壳侧链;通道宽窄与电荷 第二壳微调取向 为提高选择性而拆掉催化核

抗体场景把「识别 loop」写成互补决定区(complementarity-determining region,CDR),框架区支撑环的取向——只搬 CDR 常丢亲和,要补框架。酶场景没有 CDR 这个词,但活性 loop 扮演同类角色。

段末注释CDR 是抗体直接接触抗原的环。酶里对等的是围出口袋的活性 loop,不是整段表面。

四条不写进任务单就会返工的规则:

  1. 功能改造先动第二壳和 loop,稳定化先动表面和共识,核最后、且要体积互补。
  2. 界面不是表面:破坏界面会解聚或丢变构,只有目标就是改寡聚时才当主靶。
  3. 无序区可以激进(截短、换 Gly-Ser 接头),但先查蛋白酶切位点与调控磷酸化。
  4. 预测模型的低置信区不要当能量最小值——尤其口袋与 loop。

图 2 四类目标落到不同工位;催化核默认红牌


4. 最小作业(可贴实验记录)

  1. 写下真正目标(四类之一 + 幅度)。
  2. 取得坐标:实验复合物 > 高置信预测 + 实验约束。
  3. 跑一套注释:DSSP、RSA、口袋或 PISA、保守性;需要时再加通道 / 无序。
  4. 填分区表:每个拟突变残基属于哪一工位、RSA、是否催化 / 金属 / 界面。
  5. 按 §3 选出 10 个以内优先位点,其余进「不可退化」。
  6. 把清单交给建模工序(少数替换)或定向进化(饱和这些位点)。

社区方案优先用 HotSpot Wizard / FireProt / PROSS / fpocket / PISA / DSSP,而不是自写几何脚本。应用场景:半理性缩小文库、热稳定多点设计、口袋与界面注释。潜在风险:同源模型局部错 1–2 Å 会把口袋残基认错;PISA 把晶体接触当生理界面;共识突变在表达宿主里可能更不溶。


5. 验收

  1. 任务是提高对映选择性。有人提交了 20 个核内疏水填充突变。缺的是哪一步?
  2. 只有 AlphaFold 单体、pLDDT 在口袋处 $<70$,却用 fpocket 圈了「活性位点」。下一步补什么?
  3. 表面 Lys→Glu 提高了 $T_{\mathrm{m}}$,活力掉了一半。可能动到了哪类工位?

(1:没按目标分区,选择性应先看差别基团接触的 loop / 通道。2:复合物结构或对接 + 实验,确认口袋不是模型幻觉。3:该 Lys 可能是第二壳或底物通道电荷,表面不等于「与功能无关」。)


6. 依据与边界

分区语言对接本方案的四类目标与 $\Delta G$ 验收,不替代稳定性、结合专篇。工具:Kabsch & Sander, Biopolymers 1983(DSSP);Le Guilloux 等(fpocket);Krissinel & Henrick(PISA);Sumbalova 等, Nucleic Acids Res. 2018(HotSpot Wizard 3.0);Bednar 等(FireProt);Goldenzweig 等(PROSS)。RSA 阈值因软件与参照态而异,文中 $0.20$–$0.25$ 只是起点。没有与真正目标同构的湿实验,分区表只是待测清单。

-------------本文结束感谢您的阅读-------------