5.5 多组学整合:把数据拼成完整的故事


5.5 多组学整合:把数据拼成完整的故事

本节摘要:基因组、转录组、蛋白组、代谢组各自只拍到一个切面,多组学整合把切面叠成立体。本节梳理三种整合策略与各自的假设前提,并用贯穿案例示范一次完整的跨层解读。

为什么单组学不够

单组学的盲区有明确的分工。转录组看不到翻译后调控——3.1 节给过数字:mRNA 与蛋白丰度的相关性平均只有 0.4 上下;蛋白组看不到代谢物的实时浓度——酶活性变了,代谢流几秒内就转向,蛋白丰度还来不及变;代谢组看不到上游的遗传决定——代谢变化是结果不是原因。真实的生物过程同时发生在所有层:一个信号通路激活,是基因表达、蛋白修饰、代谢通量三线并动的合奏。只看一层,既会漏掉真调控,也会把层内的相关误判为因果。

贯穿案例做最后一次出镜。2.6 节的转录组说通路 P 的基因上调,3.4 节的蛋白组说其中一半的蛋白没跟上(翻译层面被抑制),3.5 节的磷酸化组说另一半被强烈激活。三个切面拼起来,故事从"通路上调"变成了"翻译被压住但激酶活性绕过抑制"——这是单看任何一层都得不到的机制结论,也是多组学的价值本身。

三种整合策略与各自的假设

分层验证(较保守):各层独立分析后,在生物学层面对表——转录组找差异基因、蛋白组找差异蛋白、取交集或做相关性映射,再叠到通路上讲机制。它最稳,因为不强行把数据揉在一起,代价是只能发现层间一致的信号,错失单层独有的调控。

特征级联合(中等):把多层矩阵拼起来(同一批样本的基因表达与蛋白丰度横向连接),在联合矩阵上做聚类或回归。假设是各层对同一批样本可配对、量纲差异已处理(各层标准化后加权)。混合模型与多视图方法(MOFA 系)更精细:为每层学一组共同因子加层特异因子,回答"哪些变异是跨层共享的、哪些是某层独有的"。

配对单细胞或多模态(前沿):同一细胞同时测 RNA 与表面蛋白(CITE-seq)、RNA 与染色质可及性(Multiome),在细胞分辨率上直接配对多层。还有计算配对的路线:对分开测的 scRNA 与 scATAC 样本,用共享特征(基因活性评分)把细胞对齐(如 Seurat 的锚点法)。它最接近"真正的多组学",但技术与统计都年轻——对齐质量要靠已知标志基因人工验证,不能盲信。

策略 输入 回答什么 主要风险
分层验证 各层独立结果 层间一致的结论 错失单层独有信号
联合建模 配对的多层矩阵 跨层共享与特异的因子 量纲与加权处理不当
细胞级多模态 同细胞多层测量 层间因果的细胞分辨率 对齐与整合的偏差

一次跨层解读的完整示范

把整合落成步骤。第一步对齐样本:转录组与蛋白组是同一批肿瘤样本(配对设计在多组学里价值极大,能在样本内直接算层间相关)。第二步分别做内部分析:转录组差异基因、蛋白组差异蛋白、磷酸化修饰差异位点,各自完成归一化与多重校正——5.3 节的成分性与 2.6 节的 size factor 在各层内都不可省。第三步层间映射:把基因-蛋白-修饰位点按中心法则关系连接(基因 EGFR → 蛋白 EGFR → 磷酸化位点 pY1068),计算配对样本内的层间相关,把显著背离相关的层间矛盾对(mRNA 高而蛋白平)单独列出——这些矛盾对恰恰是翻译调控的候选位点。第四步通路级叠合:在 KEGG 通路图上叠加三层的变化方向与幅度,找三层同向的通路(高置信激活)与方向冲突的通路(需要解释的调控开关)。第五步落回验证:挑两条预测做湿实验确认——Western blot 验证蛋白层面、激酶活性实验验证磷酸化层面。

# 层间映射的最小实现:基因-蛋白配对相关(数据为同批样本) gene_prot <- merge(rna_deg, prot_quant, by = "symbol") cor(gene_prot$log2FC_rna, gene_prot$log2FC_prot, method = "spearman", use = "complete.obs") # 经验区间:通路激活场景约 0.5 上下;接近 0 的基因子集是翻译调控的候选名单

系统生物学的野心与边界

多组学的终点指向系统生物学:把测得的变化装进定量模型(代谢网络模型、基因调控回路),从"描述相关"走到"预测干预"。基因组尺度的代谢模型(GSMM)已经能预测敲除某酶后代谢流的走向,因果推断方法开始把扰动实验(CRISPR 筛选、药物处理)的组学数据变成因果网络。边界同样清楚:观测性组学数据的相关性结构天然受混杂变量污染,层间因果的断言必须靠扰动实验背书——这也是为什么"多组学 + 扰动设计"正在取代"多组学 + 巧妙讲故事"成为高影响力论文的标配。

整合分析的报告规范

多组学论文的审稿风险集中在可核查性,报告规范值得照单执行。样本配对关系要交代:哪些层测了同一批样本、哪些层是独立队列(独立队列只能做方向对照,不能做样本内相关)。各层的预处理要分别写清:归一化方法、批次处理、统计阈值——跨层分析继承了每层的全部假设,任何一层偷懒,整条结论链都要打折。层间映射的依据要给出处:基因与蛋白的对应按中心法则直接映射,修饰位点与蛋白的对应要引知识库编号,反卷积的参考图谱要注明版本。

数据与代码的交付格式也在形成惯例:各层的处理后矩阵连同脚本入库,跨层分析用可执行的 notebook 呈现,让审稿人能顺着 notebook 从矩阵复算到结论。这个领域方法迭代快,两年后的读者能按你的记录重跑,就是分析质量最硬的背书。

整合失败的三种典型方式

多组学项目的失败方式比成功方式更有教学价值。其一是"强扭层间":把不同队列、不同平台的多层数据强行做样本内相关,算出的层间相关混着平台效应与批次效应,数字漂亮但不可信——层间比较的前提是配对设计或至少同队列同批次。其二是"显著性搬运":把每层各自的显著基因列表取交集,交集小就改阈值凑大——阈值一调,故事随行,这种整合没有证据价值。其三是"故事先行":先定机制叙事,再回头在各层数据里找支持片段,反例与矛盾层被忽略——多组学数据量大,想找支持性证据总是能找到的。

健康的整合流程自带证伪环节:预设哪些层间一致模式支持结论、哪些模式若出现将反驳结论,然后让数据对号入座。写分析计划时先把"什么结果会让我放弃这个假设"写下来,是多组学(也是一切高维分析)最便宜的质量保险。

💡 关键直觉:多组学整合的本质是"用层级互相钳制对方的解释"。转录组说活跃、蛋白组说沉默、磷酸化说被激活——每多一层证据,故事的自由度就少一分,结论就越接近机制。

全册至此收束:从 FASTQ 的四行结构到多层证据的机制叙事,问题链的每一环都打通了。剩下的,是把这套方法用在你自己的问题上。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U