蛋白组学实验怎么做:实验室新人必看的样品前处理与质谱分析全流程指南
蛋白组学这个词听起来很唬人,对吧?好像是需要博士学位+十年经验才能碰的东西。但其实只要你一步步跟着走,从细胞培养到质谱出结果,这条路上每个坑我都帮你标注好了。这篇指南就是为你准备的,读完它,你至少不会再在实验室里对着离心管发呆。
一、蛋白组学是什么?一句话先给你吃颗定心丸
蛋白组学(Proteomics)说白了就是:在你感兴趣的生物样本里,把所有蛋白质都找出来、数清楚、看看它们的状态有没有变化。它和基因组学的区别在于——基因基本是固定的,但蛋白质每天都在变,受环境、疾病、药物影响极大。
你做蛋白组学,通常是为了回答一个问题:“我的实验处理到底改变了哪些蛋白的表达或修饰?”
二、样品前处理:整个实验最关键的环节,没有之一
2.1 样品收集与保存
细胞样品:
细胞是蛋白组学最常见的起点。这里有个很多新人会犯的错误——贴壁细胞直接用胰酶消化就收样。别这么干!
胰酶本身就是一种蛋白酶,它会开始切割你的目标蛋白,而且消化时间不好控制,不同细胞系所需的消化时间差异很大。正确的做法是:
方法一(推荐):直接刮取法
1. 吸去培养基,用预冷的 PBS 轻轻洗涤细胞 2 次
2. 加入预冷的 PBS,用细胞刮板将细胞刮下
3. 转移至离心管,4°C、300g 离心 5 分钟
4. 去上清,用 PBS 再洗一次
5. 去上清,得到细胞沉淀
6. 液氮速冻,-80°C 保存
方法二:直接裂解法(如果后续要做磷酸化蛋白组学)
1. 吸去培养基,冰上预冷 PBS 洗 2 次
2. 直接加入含蛋白酶抑制剂和磷酸酶抑制剂的裂解液
3. 冰上裂解 15-20 分钟,期间涡旋震荡几次
4. 4°C、14000g 离心 15 分钟
5. 取上清即为蛋白提取物
组织样品:
组织比细胞麻烦一些,因为你要先匀浆。核心原则就四个字——全程冰上。
组织处理步骤:
1. 取新鲜组织,用预冷 PBS 冲洗表面血迹
2. 称重记录(重要!后续要用来计算蛋白浓度)
3. 剪成小碎片(越小越好,最好 1-2mm³)
4. 加入裂解液(组织:裂解液 ≈ 1:9 w/v)
5. 使用组织匀浆仪或玻璃匀浆器彻底匀浆
- 玻璃匀浆器:冰上匀浆 30-50 次
- 超声匀浆:冰上 300W,脉冲 10秒开/20秒关,循环 10-15 次
6. 4°C、14000g 离心 15-20 分钟
7. 取上清,测浓度,分装后 -80°C 保存
血液/血清/血浆样品:
血液样品有一个你必须知道的坑:溶血。红细胞破裂后会释放大量血红蛋白,严重干扰质谱检测。所以:
- 采血后尽快分离血浆/血清(2小时内)
- 离心条件:2000-3000g,10分钟,4°C
- 避免剧烈震荡
- 如果有溶血迹象(上清变红),果断重采
2.2 蛋白定量
样品收好了,接下来你得知道每管里有多少蛋白。常用的方法有:
| 方法 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|
| BCA 法 | 抗干扰能力强,操作简单 | 受去垢剂干扰(如 SDS) | 常规样品 |
| Bradford 法 | 快速便宜 | 不同蛋白响应差异大 | 初步估算 |
| Lowe 法 | 适合低浓度样品 | 操作稍复杂 | 微量样品 |
BCA 法实际操作步骤(实验室最常用的):
1. 配制工作液:50 份 BCA 试剂 A + 1 份 BCA 试剂 B
(现用现配,室温避光保存可用 24 小时)
2. 制作标准曲线:
BSA 标准品(2 mg/mL)用裂解液/PBS 做系列稀释:
0、0.125、0.25、0.5、0.75、1.0、1.5、2.0 mg/mL
每个浓度做 3 个复孔
3. 样品处理:
- 取 2-5 μL 样品(根据预估浓度调整)
- 补裂解液或 PBS 至 25 μL
- 每个样品做 3 个复孔
4. 加工作液:每孔加 200 μL BCA 工作液
5. 孵育:37°C 孵育 30 分钟(或室温 2 小时)
6. 测吸光度:酶标仪读取 562 nm 处的 OD 值
7. 计算:根据标准曲线计算样品蛋白浓度
这里有个重要的细节:如果你用的是 RIPA 裂解液,里面的 SDS 会干扰 BCA 测定。这时候有两个选择:
- 用 Bradford 法(对 SDS 耐受性较好,最多耐受 5%)
- 把样品稀释后再做 BCA(稀释 10 倍以上,SDS 干扰就小了)
2.3 蛋白变性、还原、烷基化——三步搞定
这一步是下游酶切的前置操作,目的是把蛋白质”打开”、”锁住”,让酶切更高效。
标准三步处理流程:
第一步:变性
- 取适量蛋白样品(建议上样量 20-100 μg)
- 加入 8M 尿素缓冲液(50mM NH₄HCO₃,含 8M 尿素)
- 终浓度尿素约 4-8M
- 涡旋混匀,室温孵育 15-30 分钟
第二步:还原
- 加入 DTT(二硫苏糖醇)至终浓度 5-10mM
- 56°C 孵育 30 分钟
- 作用:打断二硫键,让蛋白质完全展开
第三步:烷基化
- 冷却至室温
- 加入 IAA(碘乙酰胺)至终浓度 10-15mM
- 室温避光孵育 30 分钟
- 作用:封闭游离巯基,防止二硫键重新形成
- 注意:IAA 见光易分解,操作要避光!
为什么要这么做? 想象一下,蛋白质像一个揉成一团的毛线球,二硫键是扎紧毛线的橡皮筋。不拆掉橡皮筋、不把毛线球展开,酶就切不动。变性与还原就是把橡皮筋拆掉,烷基化就是把剪开的毛线头封好,防止它再缠回去。
2.4 酶切(Digestion)——最常用的方案
酶切是把蛋白质切成肽段的过程,肽段才能被质谱检测。最常用的酶是胰蛋白酶(Trypsin),因为它切得干净、重复性好。
经典 LCL(In-Solution)酶切方案:
第一步:稀释尿素
- 用 50mM NH₄HCO₃ 将尿素浓度稀释至 ≤2M
- 尿素浓度太高会抑制胰蛋白酶活性
- 一般稀释 4-8 倍即可
第二步:加入胰蛋白酶
- 酶:底物比例 1:20 至 1:50(质量比)
- 例如:100μg 蛋白,加入 2-5μg 胰蛋白酶
- 胰蛋白酶推荐用测序级(Sequencing Grade Modified)
第三步:孵育
- 37°C 孵育 4-18 小时
- 时间越长切得越完全,但也要防止过度酶切产生非特异性片段
- 一般过夜(16小时)是最稳妥的选择
第四步:终止反应
- 加入甲酸或 TFA 至终浓度 0.5-1%
- pH 降至 2-3,酶即失活
还有两种常用的酶切方式值得了解:
滤膜辅助样品处理(FASP): 适合膜蛋白或低起始量的样品。核心思路是用 30kDa 的滤膜截留蛋白,在膜上完成变性和酶切,好处是不用稀释尿素,酶切效率更高。
SDS-PAGE 胶内酶切(In-Gel Digestion): 先跑胶分离蛋白,切下目标条带或整条胶,脱水后用丙酰胺(Acrylamide)处理,再加入胰蛋白酶。这个方法纯度高、干扰少,但步骤繁琐,适合需要高纯度的场景。
2.5 肽段脱盐与浓缩
酶切后的肽段溶液中含有盐分、尿素等杂质,必须去除,否则进质谱会严重影响信号。
C18 固相萃取(SPE)脱盐方案(最常用):
材料准备:
- C18 小柱(如 Sep-Pak C18,30mg/1mL)
- 活化液:100% 甲醇
- 平衡液:0.1% TFA / 5% 乙腈(v/v)
- 洗涤液:0.1% TFA
- 洗脱液:80% 乙腈 / 0.1% TFA
操作步骤:
1. 活化小柱:加入 1mL 甲醇,静置 5 分钟后让液体自然流下
2. 平衡小柱:加入 1mL 平衡液,同样让液体自然流下
3. 上样:将脱盐样品(已用 0.1% TFA 稀释)上柱
- 流速要慢,约 1 滴/秒,确保肽段充分结合
4. 洗涤:加入 1mL 洗涤液,去除盐分和杂质
5. 洗脱:加入 500μL 洗脱液,收集洗脱液
6. 浓缩:用真空浓缩仪(SpeedVac)将洗脱液浓缩至干燥
7. 复溶:用 0.1% 甲酸(含 2-5% 乙腈)复溶肽段
- 浓度建议 0.5-1 μg/μL
- 超声 5-10 分钟帮助溶解
- 14000g 离心 10 分钟,取上清进样
三、质谱分析:从进样到数据的完整链路
3.1 质谱仪的基本组成
别被质谱仪吓到,它本质上就是个”称重机”——把肽段离子化后,测量它们的质量电荷比(m/z)。主流厂商是 Thermo Fisher、Agilent、Waters,核心仪器是 Orbitrap 系列和 Q-TOF 系列。
质谱工作流程简化版:
样品 → 液相色谱分离 → 电喷雾离子化(ESI)→
质量分析器(分析 m/z)→ 检测器 → 数据系统
3.2 液相色谱-质谱联用(LC-MS/MS)
蛋白组学几乎都在用 LC-MS/MS。为什么要先过液相色谱?因为一个复杂样品里有成千上万种肽段,同时进质谱会”挤爆”检测器。色谱先把它们分开,一个一个进来检测。
典型的 nanoLC 系统设置:
柱:C18 反相柱,75μm 内径,15-25cm 长,3μm 颗粒
流动相 A:0.1% 甲酸水溶液
流动相 B:0.1% 甲酸乙腈溶液
梯度洗脱示例(60-120分钟梯度):
0 min → 3% B (上样)
10 min → 8% B (清洗柱头)
10-80 min→ 8%→35% B (主要分离梯度)
80-90 min→ 35%→80% B (强洗脱)
90-95 min→ 80% B (柱清洗)
95-100 min→ 3% B (重新平衡)
流速:300-500 nL/min(纳升流速,信号更强)
柱温:40-50°C
进样量:2-10 μg 肽段
3.3 数据采集模式
常见的采集模式有两种:
Data-Dependent Acquisition(DDA)——最常用 先做一个全扫描(MS1),选出信号最强的前 N 个肽段离子,对它们逐一做碎裂和二级扫描(MS2)。优点是能识别更多蛋白,缺点是低丰度蛋白容易被高丰度蛋白掩盖。
典型 DDA 参数设置:
- 分辨率(MS1):120,000(Orbitrap)
- 分辨率(MS2):30,000-60,000
- 碰撞能量:HCD,NCE 27-30%
- 动态排除时间:30-60 秒
- Top N:最多选取前 15-20 个母离子进行碎裂
Data-Independent Acquisition(DIA)——近年流行 把整个质量范围分成很多小窗口,每个窗口内的所有离子统一碎裂、统一检测。优点是重复性好、数据完整性高;缺点是需要特殊的数据库查询方法。
典型 DIA 参数设置(SWATH 模式):
- 质量范围:350-1500 m/z
- 窗口宽度:8-25 Da
- 分辨率(MS1):60,000
- 碰撞能量:以 25Da 窗口为例,中心能量 27,跨度±10
- 动态排除:关闭(因为是系统性采集)
3.4 质谱数据预处理
质谱仪出的原始数据是 .raw(Thermo)或 .d(Agilent)格式,你需要转换成开放格式才能用软件处理。
常用转换工具:
1. Proteome Discoverer(Thermo 官方,付费)
- 直接读取 .raw 文件
- 自带搜索引擎 Sequest
2. Trans-Proteomic Pipeline(TPP,免费开源)
- 用 proteomescannner 转换格式
- 用 pepXML 和 PeptideProphet 做概率分析
3. MaxQuant(免费开源,强烈推荐新手使用)
- 直接读取 .raw 文件
- 自带 Andromeda 搜索引擎
- 一站式完成搜索+定量+差异分析
3.5 数据库搜索
搜索就是把实验得到的质谱图,和理论上的肽段质谱图进行比对。需要的核心信息:
- 物种数据库:比如人源就用人蛋白质组数据库(UniProt Human)
- 酶切规则:胰蛋白酶,允许 1-2 个未切割位点
- 修饰设置:
- 固定修饰:C 氨甲基化(IAA 修饰,+57.0215 Da)
- 可变修饰:M 氧化(+15.9949 Da)、N 端乙酰化(+42.0106 Da)
- 磷酸化(+79.9663 Da)——如果是磷酸化蛋白组学必须加
- 质量容差:前体离子 10-20 ppm,碎片离子 0.02-0.05 Da
MaxQuant 搜索参数示例:
Enzyme: Trypsin/P
Missed cleavages: 2
Fixed modifications: Carbamidomethyl (C)
Variable modifications:
- Oxidation (M)
- Acetylation (Protein N-term)
- Phosphorylation (STY) [可选]
Mass tolerance precursor: 4.5 ppm
Mass tolerance fragment: 20 ppm
FDR: 1%(基于 PSM 和 protein-level)
四、定量分析:从数据到生物学发现
4.1 标记定量 vs 非标记定量
SILAC(稳定同位素标记) 细胞在含重氨基酸的培养基中培养多代,蛋白质自然掺入重标签。不同条件的细胞混合后上机,同一肽段会出现轻/重两个峰,峰面积比就是表达量比。
SILAC 标记策略:
- 轻标签:正常赖氨酸(K)和精氨酸(R)
- 中间标签:⁶D-K 和 ⁶D-R(+6Da)
- 重标签:¹³C₆-K 和 ¹³C₆R(+10Da)
- 至少培养 5-6 代确保标记效率 >98%
- 混合比例:1:1
TMT/iTRAQ 标记定量 在肽段水平加上同位素标签,不同条件的样品分别标记后等量混合,一起上机。标签报告离子的强度比反映表达差异。
TMT 16-plex 实验设计示例:
- 8 个实验组 × 2 个生物学重复 = 16 个通道
- 每个通道标记不同的 TMT 标签(113-127)
- 标记后等量混合,分成两路:
- 一路直接进 LC-MS/MS
- 一路做富集(如磷酸化肽段用 TiO₂ 富集)
Label-Free 定量 不做任何标记,不同样品分别上机,用肽段峰面积或谱图计数(MS1 level)来定量。最简单、最便宜,但对上机重复性要求高。
Label-Free 定量关键要点:
1. 样品处理要尽可能一致(减少技术误差)
2. 上机顺序要随机化(避免批次效应)
3. 至少 3 个生物学重复(统计需要)
4. 建议使用内标或 QC 样品监控仪器稳定性
4.2 差异蛋白分析
搜完数据库、定量完之后,你手里应该有一个蛋白列表,每个蛋白有多个条件下的表达值。接下来就是找差异蛋白。
常用分析工具:
1. Persepe(MaxQuant 配套,免费)
- 直接读取 MaxQuant 输出结果
- 自动计算差异蛋白、 volcano plot、热图
2. Proteome Discoverer(付费)
- 内置统计模块
3. R 语言(灵活,推荐掌握)
用 R 做差异蛋白分析的典型流程:
library(vsn)
library(ggplot2)
library(pheatmap)
# 读取 MaxQuant 结果
data <- read.csv("proteinGroups.txt", header=TRUE, sep="\t")
# 提取表达量数据(假设是 LFQ intensity)
exprs <- data[, c("GeneNames", grep("LFQ intensity", colnames(data), value=TRUE))]
# 对数转换
log_exprs <- log2(exprs[, -1] + 1)
# 计算差异(以两组为例)
group1 <- colMeans(log_exprs[group1_cols])
group2 <- colMeans(log_exprs[group2_cols])
logFC <- group2 - group1
# t 检验
pvals <- apply(log_exprs, 1, function(x) t.test(x[group1_cols], x[group2_cols])$p.value)
# 结果整理
results <- data.frame(
Gene = exprs[, 1],
Log2FC = logFC,
PValue = pvals,
AvgExpr = colMeans(log_exprs)
)
# 校正 p 值(Benjamini-Hochberg)
results$AdjP <- p.adjust(results$PValue, method="BH")
# 筛选差异蛋白(|Log2FC| > 1 且 AdjP < 0.05)
diff_prots <- results[abs(results$Log2FC) > 1 & results$AdjP < 0.05, ]
# 火山图
ggplot(results, aes(x=Log2FC, y=-log10(AdjP))) +
geom_point(alpha=0.5, color="grey") +
geom_point(data=diff_prots, aes(x=Log2FC, y=-log10(AdjP)),
color="red", size=2) +
geom_vline(xintercept=c(-1, 1), linetype="dashed", color="blue") +
geom_hline(yintercept=-log10(0.05), linetype="dashed", color="blue") +
labs(x="Log2 Fold Change", y="-Log10 Adjusted P-value",
title="Volcano Plot of Differential Proteins") +
theme_minimal()
4.3 功能富集分析
找到差异蛋白后,你需要知道这些蛋白参与了什么生物学过程。常用的工具有:
- GO 分析:Gene Ontology,分生物过程(BP)、细胞组分(CC)、分子功能(MF)
- KEGG 通路分析:看看差异蛋白富集在哪些信号通路
- STRING 网络分析:构建蛋白互作网络,找关键节点蛋白
常用工具:
- DAVID(免费,网页版)
- g:Profiler(免费,网页版)
- Metascape(免费,一站式)
- ClusterProfiler(R 包,可本地运行)
五、新人最容易踩的坑(血泪教训)
5.1 样品降解
这是最常见的失败原因。蛋白一旦开始降解,整个实验就废了。
预防措施:
- 操作全程冰上进行
- 裂解液中一定要加蛋白酶抑制剂(每次新鲜配制)
- 样品分装保存,反复冻融会加速降解
- 尽量缩短从取样到裂解的时间
5.2 污染
蛋白质组学对污染极度敏感。常见污染源:
| 污染源 | 特征 | 来源 |
|---|---|---|
| 角蛋白 | 人类角蛋白序列大量出现 | 皮肤、头发、纤维 |
| 酵母蛋白 | 酿酒酵母序列 | 试剂、环境 |
| 橡胶蛋白 | 血清白蛋白等 | 手套 |
预防措施:
- 戴手套操作,勤换手套
- 尽量穿实验服,不要化妆
- 使用无酶无蛋白的耗材
- 超净台/生物安全柜内操作
5.3 上样量不足
质谱仪有检测下限,上样太少就是白做。
建议上样量:
- DDA 模式:1-5 μg 肽段(nanoLC-MS/MS)
- DIA 模式:1-2 μg 肽段
- 磷酸化蛋白组:10-50 μg 总蛋白(因为磷酸化肽段丰度低)
5.4 批次效应
不同批次上机的数据不能直接比较,因为仪器状态、色谱柱老化程度等都在变化。
应对策略:
- 尽量同一批次跑完所有样品
- 如果必须分批,每批都跑一个 QC 样品(混合所有样品的等量混合液)
- 用 PCA 分析检查批次效应是否明显
- 必要时用 ComBat 等算法做批次校正
5.5 生物学重复不够
这是很多新人最容易忽视的问题。没有生物学重复,你的统计就无从谈起。
最低要求:
- 每组至少 3 个生物学重复
- 组间差异大(如临床样本)建议 5-6 个
- 生物学重复 ≠ 技术重复!技术重复只能降低技术误差,不能代替生物学重复
六、实验设计检查清单
在开始实验之前,花 5 分钟过一遍这个清单,能避免后续很多麻烦:
□ 研究目的明确:要回答什么问题?
□ 样本类型确定:细胞/组织/体液?
□ 生物学重复数量:每组至少 3 个?
□ 分组设计合理:实验组 vs 对照组?
□ 样品收集方案:如何快速终止蛋白降解?
□ 裂解液配方:是否含蛋白酶/磷酸酶抑制剂?
□ 定量方法:BCA/Bradford?
□ 酶切方案:LCL/FASP/In-gel?
□ 肽段脱盐:C18 SPE?
□ 质谱模式:DDA/DIA/SILAC/TMT/Label-free?
□ 上样量:是否满足质谱检测要求?
□ 数据采集参数:分辨率、碰撞能量、动态排除?
□ 数据库:物种、版本、修饰设置?
□ 分析方法:MaxQuant/Proteome Discoverer?
□ 差异蛋白阈值:Log2FC > ?,AdjP < ?
□ 功能富集分析计划:GO?KEGG?
□ QC 策略:是否安排 QC 样品?
七、给新人的最后几句话
蛋白组学确实有点复杂,但不要被吓到。每个做蛋白组学的专家都曾经是新人,都曾经对着离心机发呆、对着质谱图发愁。
记住三个核心原则:
- 样品质量决定一切——再好的质谱也救不回降解的样品
- 重复是科学的底线——没有生物学重复的数据没有统计意义
- 记录一切——今天你觉得不重要的细节,三个月后你可能根本想不起来
实验室里遇到问题不要怕,多问、多看、多记录。这条路上没有人能一步登天,但只要每一步都走稳了,你离独立完成蛋白组学实验的那天不会太远。加油!