单一平台看到的化学空间是局部的。真实课题往往需要把 LC-MS、GC-MS、NMR 的结果拼到同一份生物学结论里——拼接发生在两个层面:仪器层面的联用(色谱接质谱)与数据层面的融合(多平台峰表整合)。
| 联用 | 分担什么 | 典型应用 |
|---|---|---|
| LC-MS/MS(QqQ, MRM) | 色谱分时间 + 逐离子对定量 | 靶向氨基酸 panel、胆汁酸定量 |
| LC-HRAM-MS(Q-TOF/Q-Orbitrap) | 全扫发现 + DDA/DIA 碎裂 | 非靶向 |
| GC-MS(EI 70 eV) | 高分离 + 谱库比对 | SCFA、TMAO 前体、糖醇 |
| LC-IMS-MS | 加一维 CCS | 脂质异构体、数据去冗余 |
| MALDI-MSI | 组织上直接成像 | 空间代谢组学 |
MALDI 成像值得单独一提:组织切片铺上基质,激光逐点扫描,每个像素一张质谱——最终得到"某个 m/z 在肿瘤边界富集"的空间地图。它把代谢组学从"匀浆后的平均值"升级为"原位分布",是近十年最活跃的方向之一(第 7 章再展开)。
多平台数据合并是工程活,难点在于单位与尺度不统一(NMR 给 mmol/L,MS 给峰面积)。
策略一:先分析后汇总(late fusion)。 各平台独立做差异分析,最后在通路层面汇合——色氨酸在 LC 平台下降、犬尿氨酸在 GC 平台上升,两条证据在"色氨酸-犬尿氨酸通路"节点会师。最稳健,信息损失最少。
策略二:先拼接后分析(early fusion)。 把各平台峰表按样品 ID 拼成大矩阵再建模。理论信息量最大,实践里常被平台间的噪声差异拖垮。
策略三:中间表示融合。 各平台先降维(如各自 PCA 前几主成分),再拼接。计算便宜,多组学研究中常用(类似 DIABLO/mixOmics 的做法):
# mixOmics 多组学整合的概念示例 library(mixOmics) # X1: LC-MS 峰表, X2: NMR 定量表, Y: 分组 res <- block.splsda(X = list(lcms = X1, nmr = X2), Y = group, ncomp = 3) plotDiablo(res, ncomp = 1) # 看两个数据集在第一成分上的相关性
我一般从策略一起步:它能暴露平台间的一致与矛盾,矛盾本身就是发现(要么是假信号,要么是平台特异的化学信息)。
⚠️ 常见坑:多平台数据的样品 ID 对不上(一个平台有复孔、另一个没有),拼表时错位一行,全盘皆错。合并前先做样品 ID 的交集校验,一步都不能省。
给定课题,选平台的推理只有三问:目标物浓度量级多少?需要绝对定量还是相对比较?要不要空间信息?——浓度低选 MS、要绝对定量优先 NMR 或靶向 MRM、要空间选 MSI、化学空间要求全就双柱四针。第 6 章的案例会反复用到这棵决策树。
第 5 章处理这些仪器吐出来的海量数据。
单一平台对代谢组的覆盖率没有一个能过半:RP-LC-MS 强在脂质与中极性物,HILIC 补极性,GC-MS 补有机酸与糖,NMR 补绝对定量。多平台联用后的数据整合才是难点——同一代谢物在不同平台的响应值差几个量级,不能直接拼表。
| 组合 | 覆盖互补 | 整合策略 |
|---|---|---|
| RP + HILIC(同型质谱) | 中等极性 + 强极性 | 各自内标归一后按代谢物合并 |
| LC-MS + GC-MS | 广谱 | 分别注释,Level 1 代谢物做桥 |
| LC-MS + NMR | 深度 + 定量 | NMR 定量锚点,MS 相对值换算 |
| LC-MS + IMS | 减假阳性 | CCS 作第四维过滤 |
# 两平台共同检出 12 个 Level-1 代谢物,用其浓度比值建立换算因子 import statistics as st lc = [1.0, 1.2, 0.9, 1.1, 0.8, 1.3, 1.05, 0.95, 1.15, 1.25, 0.85, 1.0] # LC-MS 相对值 nmr = [52, 61, 47, 55, 44, 66, 54, 49, 58, 63, 45, 53] # NMR 绝对值 uM ratios = [n / l for l, n in zip(lc, nmr)] f = st.median(ratios) cv = st.stdev(ratios) / f * 100 print(f"中位换算因子 = {f:.1f} uM/单位,桥接代谢物 CV = {cv:.0f}%") # CV<15% 说明两平台线性响应一致,可外推到仅 MS 检出的代谢物(半定量)
层次一是样本层整合(同一批样本多平台平行进样,按代谢物建宽表)——最常见也最稳健;层次二是统计层整合(多组学因子分析 MOFA、DIABLO 等跨组学耦合);层次三是知识层整合(用通路数据库把平台特异信号映射到同一反应网络)。失败模式也分三类:换算因子外推到响应曲线非线性区(高浓度代谢物)、桥接代谢物选择偏差(全选氨基酸则对脂质无效)、批次号错位(两平台进样日期不同导致"平台差异"伪装成"生物差异")。联用不是把机器排成一排,而是设计一套让数据可互证的结构。
平台整合还有一个常被低估的产出:交叉验证的注释置信度提升。同一代谢物在 RP 与 HILIC 上保留行为一致(按 logD 预测)、m/z 与 MS/MS 双平台一致、NMR 又在对应化学位移区出峰,三重一致的注释几乎免疫假阳性。做法上只需把两平台的 Level 1/2 清单求交集后互相确认,成本近零而收益显著——多篇高影响力研究正是靠这个朴素步骤清理了文献中的注释混乱。
联用方案的排序逻辑还有一个预算维度值得明说:多数课题组面临"一台高分辨质谱如何最大化产出"的问题,务实答案是先建好 RP-LC 正负双模式这套最大公约数,用两三年积累注释库与质控体系,再按研究方向补 HILIC 或成像——一步到位的多平台采购常见结局是每台都半熟。仪器更新周期五到八年,而方法资产可以跨代继承,把预算优先投在方法沉淀上,是联用时代实验室经营的清醒算法。