如果你熟悉 Western(看几个蛋白)或 RNA-seq(看基因表达),但从未做过蛋白质组学(proteomics),第一次听到「搜库」「LFQ」「FDR」往往会一头雾水。本文从零开始,把实验在做什么、计算机在算什么串成一条线;外泌体场景下的 QC 要点见 miRNA-07-外泌体蛋白组分析平台。
段末注释:蛋白质组学指一次性检测样品中大量蛋白的鉴定与(通常还有)定量;本系列实验端以 液相色谱-质谱(liquid chromatography–mass spectrometry,LC-MS/MS)路线为主。
读前说明
- 不涉及具体仪器按钮怎么按、试剂盒怎么加——那是实验 SOP;这里帮你建立整体地图。
- 配图位于
miRNA-08-蛋白质组学实验与数据分析入门/。 - 有 R / Python 或 NGS 经验会更容易上手分析端,但不是硬性前提。
1. 一句话:蛋白质组学在干什么?
可以把细胞或外泌体里的蛋白混合液,想象成一本超厚的合订本:
- Western 像只翻其中几页,确认「这几段在不在」;
- 蛋白质组学 像尽量把整本书的目录列出来,并常常还要比较「这本书比那本厚/薄多少」。
实验负责把蛋白变成质谱能「读」的信号;分析负责把信号翻译回「这是哪个蛋白、含量大概多少」。

图 1 上半是实验,下半是分析;后文按此顺序展开。
2. 和 RNA-seq、Western 怎么区分?
| 方法 | 看什么 | 通量 | 通俗理解 |
|---|---|---|---|
| Western | 少数几个蛋白 | 很低 | 点名检查 |
| RNA-seq | 基因转录本丰度 | 很高 | 看「生产计划单」 |
| 蛋白质组 | 蛋白本身 | 高(通常几千蛋白) | 看「成品仓库现货」 |
重要直觉:mRNA 多 ≠ 蛋白一定多(翻译、降解、修饰都会影响)。所以外泌体项目里 miRNA-seq 与蛋白组是互补的,不能互相替代——见 miRNA-05 §5 联合 QC。
3. 实验端:从样品到质谱
3.1 样品从哪来?
常见起点:
- 细胞裂解液(全细胞蛋白);
- 外泌体 / EV 馏分(蛋白量少,但更有针对性);
- 血浆/血清(蛋白极多,动态范围大,难度高)。
外泌体样品往往总蛋白很少,后面鉴定数会比全细胞低——这不一定是失败,但解读时要心里有数。
3.2 蛋白提取与浓度测定
目标:把蛋白从样品里溶出来,并知道大概有多少。
- 常用 BCA / Bradford 测浓度;
- 外泌体样品切忌「浓度假设」——宁可统一上样量规则,也要记录实际测值。
3.3 酶切:把长蛋白剪成短肽段
质谱不适合直接测整条大蛋白,通常先用蛋白酶(最常见 胰蛋白酶 trypsin)把蛋白剪成肽段(peptide,像把长文章切成短句)。
这一步叫 酶切消化(digestion)。剪完得到的是肽段混合物,不是单个蛋白了——后面要靠算法把肽段拼回蛋白。
3.4 液相色谱(LC):先排队,再一个一个进质谱
肽段太多,若一次性全塞进质谱会「糊成一片」。液相色谱像传送带:按时间把肽段一个一个送进质谱仪。
你可以把它理解成:先分离,再检测。
3.5 质谱(MS/MS):给肽段称重量、读序列
质谱仪做两件核心事:
- 测质量(m/z,质荷比)——像给每个肽段称「分子量」;
- 二级质谱(MS2) 把肽段再碎一点,根据碎片模式推断氨基酸序列。
实验员最后得到的是大量 .raw / mzML 等原始谱图文件——像一堆「只有仪器能直接读的天书」。
3.6 实验端小结(检查清单)
| 步骤 | 初学者应记住 |
|---|---|
| 样品 | 记录来源、处理、批次 |
| 提取 & 定量 | 浓度与上样量影响鉴定深度 |
| 酶切 | 蛋白 → 肽段 |
| LC-MS/MS | 分离 + 测序列与强度 |
| 产出 | 原始谱图 → 交给分析(搜库) |
4. 分析端:从「天书」到「蛋白表」
生物信息分析通常不在你的笔记本上跑质谱,而是对实验产生的谱图做搜库与统计。主流软件:MaxQuant、FragPipe(含 MSFragger)、Proteome Discoverer 等。
4.1 搜库:谱图和数据库对答案
实验室测到的是「未知肽段指纹」;计算机里有一个蛋白序列数据库(如人类 UniProt),里面是所有已知蛋白的理论序列。
搜库(database search)就是:把每个实验谱图和数据库里「理论酶切肽段」比对,找最像的匹配。
输出通常是:
- 鉴定到了哪些肽段;
- 这些肽段属于哪些蛋白;
- 每个谱图/肽段的打分。
4.2 FDR:控制「认错」的比例
数据库很大,随机也可能碰对几个肽段。所以要控制假发现率(false discovery rate,FDR)。
初学者只需记住:
- 报告里写 FDR ≤ 1%,表示大约 100 个鉴定里允许 ~1 个可能是错的(统计意义下的控制);
- 别为了「鉴定数好看」把 FDR 放得过松。
段末注释:FDR 是多重检验校正后的错误比例估计,与单个肽段的「打分」不是同一概念。
4.3 定量:这个蛋白有多「多」?
鉴定回答「有没有」;定量回答「多少」。
常见策略(无标记):
| 方法 | 白话 |
|---|---|
| LFQ(label-free quantification) | 用谱图峰强度估计蛋白相对丰度,MaxQuant 最常用 |
| iBAQ | 粗略估计绝对量,更适合看组成比例,不宜单独做差异 |
| DIA | 另一种采集模式 + 另一套算法,通量高,入门先知道名字即可 |
你会拿到一张大表:行 = 蛋白,列 = 样品,格 = 强度或 LFQ 值。这就是下游统计的输入。
4.4 过滤与归一化:让样品可以比
原始矩阵不能直接用,常见要做:
- 过滤:去掉只出现在 1 个样品里的蛋白、去掉鉴定太弱的;
- 缺失值处理:没测到的格子是「真的不存在」还是「太稀没扫到」?外泌体低丰度样品缺失很常见;
- 归一化:不同样品上样量、仪器响应不同,要拉到同一尺度(如中位数归一化)。
这一步搞错了,后面差异分析全白做。
4.5 差异蛋白分析:哪几个变了?
有分组(如处理 vs 对照、疾病 vs 健康)时,对每个蛋白做统计检验:
- 常用 limma、MSstats 等;
- 得到 p 值,再做 FDR 校正;
- 画火山图(横轴变化倍数,纵轴显著性)。
初学者易犯错误:重复太少(1–2 个生物学重复很难下结论)、把技术重复当生物学重复。
4.6 富集分析:变化的蛋白在干什么?
差异蛋白一长串,人眼看不懂。富集(enrichment)回答:这些蛋白是不是在某个通路里扎堆?
- GO(gene ontology):生物过程、细胞定位、分子功能;
- KEGG / Reactome:通路图。
工具如 clusterProfiler、DAVID。注意:鉴定数少时,富集结果可能「看起来很美但 power 不足」。
4.7 分析端小结
1 | 原始谱图 |
5. 外泌体蛋白组:多记三件事
做外泌体而不是全细胞时,在通用流程上额外关注:
5.1 样品身份:真的是 EV 吗?
看经典标志蛋白是否出现:CD63、CD9、CD81、TSG101 等(详见 miRNA-07 §2)。没有单一蛋白能一锤定音,需结合粒径、Western、miRNA 谱。
5.2 污染:杂质蛋白会「喧宾夺主」
- 血浆:白蛋白、载脂蛋白 极 abundant;
- 实验:角蛋白(keratin,来自皮肤、 dust);
- 制备:核蛋白 升高提示细胞裂解污染。
分析时要会用污染蛋白列表过滤,并保留过滤前后对照。
5.3 和 miRNA 组学对表
同一批外泌体,若同时测了 sRNA-seq,应在样品 ID 层面对齐,看蛋白 QC 与 miRNA QC 是否一致——见 miRNA-07 图 2。
6. 初学者常见困惑(FAQ)
Q1:鉴定到 500 个蛋白算少吗?
取决于样品类型。外泌体 500 可能正常;全细胞裂解往往上千。要和同实验室历史数据比,不要死记网上的数字。
Q2:搜库一定要自己会吗?
入门阶段可以由质谱核心平台跑 MaxQuant 交付 proteinGroups.txt;你需要懂的是矩阵里每列含义和下游 QC,再逐步学搜库参数。
Q3:LFQ 缺失很多怎么办?
外泌体常见。别随便用 0 填缺失做 t 检验;先问实验能否加量、加重复,再选合适的过滤和统计方法(如 MSstats)。
Q4:差异蛋白和 Western 对不上?
Western 看单个、更敏感;组学有 FDR 阈值、定量误差。选 2–3 个关键蛋白做 Western 验证是常见做法。
Q5:和转录组差异基因列表怎么联合?
蛋白 ↔ 基因需名称映射(UniProt ↔ Gene symbol);注意 mRNA–蛋白不同步。外泌体项目优先做样品级 QC 是否一致,再谈联合通路。
7. 推荐学习路径
| 阶段 | 建议 |
|---|---|
| 第 1 周 | 读本文 + miRNA-07 图 1–2;搞清实验/分析分工 |
| 第 2–3 周 | 拿一份 MaxQuant 输出的 proteinGroups.txt,在 Excel / R 里看列名、筛 LFQ、画简单箱线图 |
| 第 4 周起 | 学 limma 或 MSstats 做差异;clusterProfiler 做 GO |
| 结合项目 | 对照 miRNA-04 §3 看平台要自动化的模块 |
公开教程关键词:MaxQuant tutorial、FragPipe wiki、MSstats vignette、ProteomicsML 示例数据。
小结
- 实验:蛋白提取 → 酶切成肽段 → LC 分离 → MS/MS 测序列与强度 → 原始谱图。
- 分析:搜库 → FDR → 定量矩阵 → 归一化 → 差异 → 富集 → 报告。
- 外泌体:额外盯 EV 标志蛋白、污染蛋白、与 miRNA 及物理 QC 的三角验证。
- 入门先建立全局地图,再深入某一个软件;与系列平台文档衔接见 miRNA-07。
后续可扩展:基于 MaxQuant 输出的 hands-on 练习 notebook(待补)。