miRNA-08.蛋白质组学实验与数据分析入门

如果你熟悉 Western(看几个蛋白)或 RNA-seq(看基因表达),但从未做过蛋白质组学(proteomics),第一次听到「搜库」「LFQ」「FDR」往往会一头雾水。本文从零开始,把实验在做什么计算机在算什么串成一条线;外泌体场景下的 QC 要点见 miRNA-07-外泌体蛋白组分析平台

段末注释蛋白质组学指一次性检测样品中大量蛋白的鉴定与(通常还有)定量;本系列实验端以 液相色谱-质谱(liquid chromatography–mass spectrometry,LC-MS/MS)路线为主。


读前说明

  • 不涉及具体仪器按钮怎么按、试剂盒怎么加——那是实验 SOP;这里帮你建立整体地图
  • 配图位于 miRNA-08-蛋白质组学实验与数据分析入门/
  • R / PythonNGS 经验会更容易上手分析端,但不是硬性前提。

1. 一句话:蛋白质组学在干什么?

可以把细胞或外泌体里的蛋白混合液,想象成一本超厚的合订本

  • Western 像只翻其中几页,确认「这几段在不在」;
  • 蛋白质组学 像尽量把整本书的目录列出来,并常常还要比较「这本书比那本厚/薄多少」。

实验负责把蛋白变成质谱能「读」的信号;分析负责把信号翻译回「这是哪个蛋白、含量大概多少」。

图 1 蛋白质组学实验与数据分析全流程(入门示意)

图 1 上半是实验,下半是分析;后文按此顺序展开。


2. 和 RNA-seq、Western 怎么区分?

方法 看什么 通量 通俗理解
Western 少数几个蛋白 很低 点名检查
RNA-seq 基因转录本丰度 很高 看「生产计划单」
蛋白质组 蛋白本身 高(通常几千蛋白) 看「成品仓库现货」

重要直觉:mRNA 多 ≠ 蛋白一定多(翻译、降解、修饰都会影响)。所以外泌体项目里 miRNA-seq 与蛋白组是互补的,不能互相替代——见 miRNA-05 §5 联合 QC。


3. 实验端:从样品到质谱

3.1 样品从哪来?

常见起点:

  • 细胞裂解液(全细胞蛋白);
  • 外泌体 / EV 馏分(蛋白量少,但更有针对性);
  • 血浆/血清(蛋白极多,动态范围大,难度高)。

外泌体样品往往总蛋白很少,后面鉴定数会比全细胞低——这不一定是失败,但解读时要心里有数。

3.2 蛋白提取与浓度测定

目标:把蛋白从样品里溶出来,并知道大概有多少。

  • 常用 BCA / Bradford 测浓度;
  • 外泌体样品切忌「浓度假设」——宁可统一上样量规则,也要记录实际测值。

3.3 酶切:把长蛋白剪成短肽段

质谱不适合直接测整条大蛋白,通常先用蛋白酶(最常见 胰蛋白酶 trypsin)把蛋白剪成肽段(peptide,像把长文章切成短句)。

这一步叫 酶切消化(digestion)。剪完得到的是肽段混合物,不是单个蛋白了——后面要靠算法把肽段拼回蛋白。

3.4 液相色谱(LC):先排队,再一个一个进质谱

肽段太多,若一次性全塞进质谱会「糊成一片」。液相色谱像传送带:按时间把肽段一个一个送进质谱仪。

你可以把它理解成:先分离,再检测

3.5 质谱(MS/MS):给肽段称重量、读序列

质谱仪做两件核心事:

  1. 测质量(m/z,质荷比)——像给每个肽段称「分子量」;
  2. 二级质谱(MS2) 把肽段再碎一点,根据碎片模式推断氨基酸序列

实验员最后得到的是大量 .raw / mzML 等原始谱图文件——像一堆「只有仪器能直接读的天书」。

3.6 实验端小结(检查清单)

步骤 初学者应记住
样品 记录来源、处理、批次
提取 & 定量 浓度与上样量影响鉴定深度
酶切 蛋白 → 肽段
LC-MS/MS 分离 + 测序列与强度
产出 原始谱图 → 交给分析(搜库)

4. 分析端:从「天书」到「蛋白表」

生物信息分析通常不在你的笔记本上跑质谱,而是对实验产生的谱图做搜库与统计。主流软件:MaxQuantFragPipe(含 MSFragger)、Proteome Discoverer 等。

4.1 搜库:谱图和数据库对答案

实验室测到的是「未知肽段指纹」;计算机里有一个蛋白序列数据库(如人类 UniProt),里面是所有已知蛋白的理论序列。

搜库(database search)就是:把每个实验谱图和数据库里「理论酶切肽段」比对,找最像的匹配。

输出通常是:

  • 鉴定到了哪些肽段
  • 这些肽段属于哪些蛋白
  • 每个谱图/肽段的打分。

4.2 FDR:控制「认错」的比例

数据库很大,随机也可能碰对几个肽段。所以要控制假发现率(false discovery rate,FDR)。

初学者只需记住:

  • 报告里写 FDR ≤ 1%,表示大约 100 个鉴定里允许 ~1 个可能是错的(统计意义下的控制);
  • 别为了「鉴定数好看」把 FDR 放得过松。

段末注释FDR 是多重检验校正后的错误比例估计,与单个肽段的「打分」不是同一概念。

4.3 定量:这个蛋白有多「多」?

鉴定回答「有没有」;定量回答「多少」。

常见策略(无标记):

方法 白话
LFQ(label-free quantification) 用谱图峰强度估计蛋白相对丰度,MaxQuant 最常用
iBAQ 粗略估计绝对量,更适合看组成比例,不宜单独做差异
DIA 另一种采集模式 + 另一套算法,通量高,入门先知道名字即可

你会拿到一张大表:行 = 蛋白,列 = 样品,格 = 强度或 LFQ。这就是下游统计的输入。

4.4 过滤与归一化:让样品可以比

原始矩阵不能直接用,常见要做:

  1. 过滤:去掉只出现在 1 个样品里的蛋白、去掉鉴定太弱的;
  2. 缺失值处理:没测到的格子是「真的不存在」还是「太稀没扫到」?外泌体低丰度样品缺失很常见
  3. 归一化:不同样品上样量、仪器响应不同,要拉到同一尺度(如中位数归一化)。

这一步搞错了,后面差异分析全白做。

4.5 差异蛋白分析:哪几个变了?

有分组(如处理 vs 对照、疾病 vs 健康)时,对每个蛋白做统计检验:

  • 常用 limmaMSstats 等;
  • 得到 p 值,再做 FDR 校正;
  • 火山图(横轴变化倍数,纵轴显著性)。

初学者易犯错误:重复太少(1–2 个生物学重复很难下结论)、把技术重复当生物学重复

4.6 富集分析:变化的蛋白在干什么?

差异蛋白一长串,人眼看不懂。富集(enrichment)回答:这些蛋白是不是在某个通路里扎堆?

  • GO(gene ontology):生物过程、细胞定位、分子功能;
  • KEGG / Reactome:通路图。

工具如 clusterProfilerDAVID。注意:鉴定数少时,富集结果可能「看起来很美但 power 不足」。

4.7 分析端小结

1
2
3
4
5
6
7
8
原始谱图
→ 搜库(MaxQuant / FragPipe …)
→ FDR 过滤
→ 蛋白 × 样品 定量矩阵
→ 过滤 / 归一化 /(谨慎)插补缺失
→ 差异分析
→ GO / KEGG 富集
→ 图 + 表 + 文字报告

5. 外泌体蛋白组:多记三件事

外泌体而不是全细胞时,在通用流程上额外关注:

5.1 样品身份:真的是 EV 吗?

看经典标志蛋白是否出现:CD63CD9CD81TSG101 等(详见 miRNA-07 §2)。没有单一蛋白能一锤定音,需结合粒径、WesternmiRNA 谱。

5.2 污染:杂质蛋白会「喧宾夺主」

  • 血浆:白蛋白载脂蛋白 极 abundant;
  • 实验:角蛋白keratin,来自皮肤、 dust);
  • 制备:核蛋白 升高提示细胞裂解污染。

分析时要会用污染蛋白列表过滤,并保留过滤前后对照

5.3 和 miRNA 组学对表

同一批外泌体,若同时测了 sRNA-seq,应在样品 ID 层面对齐,看蛋白 QC 与 miRNA QC 是否一致——见 miRNA-07 图 2


6. 初学者常见困惑(FAQ)

Q1:鉴定到 500 个蛋白算少吗?
取决于样品类型。外泌体 500 可能正常;全细胞裂解往往上千。要和同实验室历史数据比,不要死记网上的数字。

Q2:搜库一定要自己会吗?
入门阶段可以由质谱核心平台跑 MaxQuant 交付 proteinGroups.txt;你需要懂的是矩阵里每列含义下游 QC,再逐步学搜库参数。

Q3:LFQ 缺失很多怎么办?
外泌体常见。别随便用 0 填缺失做 t 检验;先问实验能否加量、加重复,再选合适的过滤和统计方法(如 MSstats)。

Q4:差异蛋白和 Western 对不上?
Western 看单个、更敏感;组学有 FDR 阈值、定量误差。选 2–3 个关键蛋白做 Western 验证是常见做法。

Q5:和转录组差异基因列表怎么联合?
蛋白 ↔ 基因需名称映射UniProtGene symbol);注意 mRNA–蛋白不同步。外泌体项目优先做样品级 QC 是否一致,再谈联合通路。


7. 推荐学习路径

阶段 建议
第 1 周 读本文 + miRNA-07 图 1–2;搞清实验/分析分工
第 2–3 周 拿一份 MaxQuant 输出的 proteinGroups.txt,在 Excel / R 里看列名、筛 LFQ、画简单箱线图
第 4 周起 limmaMSstats 做差异;clusterProfilerGO
结合项目 对照 miRNA-04 §3 看平台要自动化的模块

公开教程关键词:MaxQuant tutorialFragPipe wiki、MSstats vignette、ProteomicsML 示例数据。


小结

  • 实验:蛋白提取 → 酶切成肽段 → LC 分离 → MS/MS 测序列与强度 → 原始谱图。
  • 分析:搜库 → FDR → 定量矩阵 → 归一化 → 差异 → 富集 → 报告。
  • 外泌体:额外盯 EV 标志蛋白、污染蛋白、与 miRNA 及物理 QC 的三角验证。
  • 入门先建立全局地图,再深入某一个软件;与系列平台文档衔接见 miRNA-07

后续可扩展:基于 MaxQuant 输出的 hands-on 练习 notebook(待补)。

-------------本文结束感谢您的阅读-------------