4.4 联用技术与平台整合


4.4 联用技术与平台整合

单一平台看到的化学空间是局部的。真实课题往往需要把 LC-MS、GC-MS、NMR 的结果拼到同一份生物学结论里——拼接发生在两个层面:仪器层面的联用(色谱接质谱)与数据层面的融合(多平台峰表整合)。

仪器层面的联用矩阵

联用 分担什么 典型应用
LC-MS/MS(QqQ, MRM) 色谱分时间 + 逐离子对定量 靶向氨基酸 panel、胆汁酸定量
LC-HRAM-MS(Q-TOF/Q-Orbitrap) 全扫发现 + DDA/DIA 碎裂 非靶向
GC-MS(EI 70 eV) 高分离 + 谱库比对 SCFA、TMAO 前体、糖醇
LC-IMS-MS 加一维 CCS 脂质异构体、数据去冗余
MALDI-MSI 组织上直接成像 空间代谢组学

MALDI 成像值得单独一提:组织切片铺上基质,激光逐点扫描,每个像素一张质谱——最终得到"某个 m/z 在肿瘤边界富集"的空间地图。它把代谢组学从"匀浆后的平均值"升级为"原位分布",是近十年最活跃的方向之一(第 7 章再展开)。

数据层面的融合:三种策略

多平台数据合并是工程活,难点在于单位与尺度不统一(NMR 给 mmol/L,MS 给峰面积)。

策略一:先分析后汇总(late fusion)。 各平台独立做差异分析,最后在通路层面汇合——色氨酸在 LC 平台下降、犬尿氨酸在 GC 平台上升,两条证据在"色氨酸-犬尿氨酸通路"节点会师。最稳健,信息损失最少。

策略二:先拼接后分析(early fusion)。 把各平台峰表按样品 ID 拼成大矩阵再建模。理论信息量最大,实践里常被平台间的噪声差异拖垮。

策略三:中间表示融合。 各平台先降维(如各自 PCA 前几主成分),再拼接。计算便宜,多组学研究中常用(类似 DIABLO/mixOmics 的做法):

# mixOmics 多组学整合的概念示例 library(mixOmics) # X1: LC-MS 峰表, X2: NMR 定量表, Y: 分组 res <- block.splsda(X = list(lcms = X1, nmr = X2), Y = group, ncomp = 3) plotDiablo(res, ncomp = 1) # 看两个数据集在第一成分上的相关性

我一般从策略一起步:它能暴露平台间的一致与矛盾,矛盾本身就是发现(要么是假信号,要么是平台特异的化学信息)。

⚠️ 常见坑:多平台数据的样品 ID 对不上(一个平台有复孔、另一个没有),拼表时错位一行,全盘皆错。合并前先做样品 ID 的交集校验,一步都不能省。

挑平台的决策树

给定课题,选平台的推理只有三问:目标物浓度量级多少?需要绝对定量还是相对比较?要不要空间信息?——浓度低选 MS、要绝对定量优先 NMR 或靶向 MRM、要空间选 MSI、化学空间要求全就双柱四针。第 6 章的案例会反复用到这棵决策树。

本节要点回顾

  • 联用在仪器与数据两个层面发生
  • MALDI-MSI 把代谢组学带进原位空间(详见第 7 章)
  • 三种融合策略:late fusion 最稳,early fusion 信息大风险大
  • 样品 ID 校验先于一切拼表
  • 挑平台三问:浓度量级、定量要求、空间要求

第 5 章处理这些仪器吐出来的海量数据。

平台组合的覆盖账

单一平台对代谢组的覆盖率没有一个能过半:RP-LC-MS 强在脂质与中极性物,HILIC 补极性,GC-MS 补有机酸与糖,NMR 补绝对定量。多平台联用后的数据整合才是难点——同一代谢物在不同平台的响应值差几个量级,不能直接拼表。

组合 覆盖互补 整合策略
RP + HILIC(同型质谱) 中等极性 + 强极性 各自内标归一后按代谢物合并
LC-MS + GC-MS 广谱 分别注释,Level 1 代谢物做桥
LC-MS + NMR 深度 + 定量 NMR 定量锚点,MS 相对值换算
LC-MS + IMS 减假阳性 CCS 作第四维过滤

用桥接代谢物换算平台间响应

# 两平台共同检出 12 个 Level-1 代谢物,用其浓度比值建立换算因子 import statistics as st lc = [1.0, 1.2, 0.9, 1.1, 0.8, 1.3, 1.05, 0.95, 1.15, 1.25, 0.85, 1.0] # LC-MS 相对值 nmr = [52, 61, 47, 55, 44, 66, 54, 49, 58, 63, 45, 53] # NMR 绝对值 uM ratios = [n / l for l, n in zip(lc, nmr)] f = st.median(ratios) cv = st.stdev(ratios) / f * 100 print(f"中位换算因子 = {f:.1f} uM/单位,桥接代谢物 CV = {cv:.0f}%") # CV<15% 说明两平台线性响应一致,可外推到仅 MS 检出的代谢物(半定量)

整合的三个层次与失败模式

层次一是样本层整合(同一批样本多平台平行进样,按代谢物建宽表)——最常见也最稳健;层次二是统计层整合(多组学因子分析 MOFA、DIABLO 等跨组学耦合);层次三是知识层整合(用通路数据库把平台特异信号映射到同一反应网络)。失败模式也分三类:换算因子外推到响应曲线非线性区(高浓度代谢物)、桥接代谢物选择偏差(全选氨基酸则对脂质无效)、批次号错位(两平台进样日期不同导致"平台差异"伪装成"生物差异")。联用不是把机器排成一排,而是设计一套让数据可互证的结构。

平台整合还有一个常被低估的产出:交叉验证的注释置信度提升。同一代谢物在 RP 与 HILIC 上保留行为一致(按 logD 预测)、m/z 与 MS/MS 双平台一致、NMR 又在对应化学位移区出峰,三重一致的注释几乎免疫假阳性。做法上只需把两平台的 Level 1/2 清单求交集后互相确认,成本近零而收益显著——多篇高影响力研究正是靠这个朴素步骤清理了文献中的注释混乱。

联用方案的排序逻辑还有一个预算维度值得明说:多数课题组面临"一台高分辨质谱如何最大化产出"的问题,务实答案是先建好 RP-LC 正负双模式这套最大公约数,用两三年积累注释库与质控体系,再按研究方向补 HILIC 或成像——一步到位的多平台采购常见结局是每台都半熟。仪器更新周期五到八年,而方法资产可以跨代继承,把预算优先投在方法沉淀上,是联用时代实验室经营的清醒算法。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U