5.1 单细胞多组学同步检测 本节摘要:多组学技术在同一细胞里同步读出多层信息——CITE-seq 测转录组加表面蛋白,Multiome 测转录组加染色质可及性。蛋白层补上了"RNA 量不等于蛋白量"的缺口,染色质层补上了"为什么这个基因开"的因果线索。本节讲两条技术的数据形态、各自的归一化要点与联合分析框架。 一种样品多种组学 RNA 丰度是蛋白丰度的间接代理,这个代理有几处系统性失真:转录因子、信号分子这类关键角色,RNA 的微小变化常对应蛋白的剧烈变化;蛋白还受翻译后调控,寿命与修饰都不写在转录组里。
本节摘要:多组学技术在同一细胞里同步读出多层信息——CITE-seq 测转录组加表面蛋白,Multiome 测转录组加染色质可及性。蛋白层补上了"RNA 量不等于蛋白量"的缺口,染色质层补上了"为什么这个基因开"的因果线索。本节讲两条技术的数据形态、各自的归一化要点与联合分析框架。
RNA 丰度是蛋白丰度的间接代理,这个代理有几处系统性失真:转录因子、信号分子这类关键角色,RNA 的微小变化常对应蛋白的剧烈变化;蛋白还受翻译后调控,寿命与修饰都不写在转录组里。CITE-seq 的解法是把带寡核苷酸标签的抗体和细胞一起孵育,抗体结合表面蛋白后与细胞同进液滴,标签序列像 mRNA 一样被测序——一个细胞同时得到转录组矩阵和蛋白丰度矩阵(ADT 层),几十到几百个"蛋白基因"的测量精度远高于从 RNA 推断。它对免疫研究尤其顺手:T 细胞的耗竭标志 PD-1、记忆分型的 CD45RA 之类,都是蛋白层比 RNA 层清晰的经典指标。
Multiome 走另一条路:同一细胞里同时测基因表达(scRNA)与染色质可及性(scATAC)。开放染色质是转录调控的物理基础——增强子开放、转录因子结合位点裸露,基因才可能表达。拿到同一细胞的配对数据,可以直接回答"这个细胞类型里开放的增强子驱动着哪个基因",把相关证据升级成调控证据,也能给未知亚型找到掌控它的转录因子(与 4.2 节的调控网络互相印证)。
library(Seurat) # CITE-seq:ADT 层与 RNA 层并存于同一对象 pbmc[["ADT"]] <- CreateAssayObject(counts = adt_counts) DefaultAssay(pbmc) <- "ADT" pbmc <- NormalizeData(pbmc, normalization.method = "CLR", margin = 2) # ADT 用 CLR,勿用对数归一化 # 多层联合分群:WNN 按层的信息量自适应加权 pbmc <- NormalizeData(pbmc, assay = "RNA") pbmc <- FindVariableFeatures(pbmc, assay = "RNA") pbmc <- RunPCA(pbmc, assay = "RNA") pbmc <- RunUMAP(pbmc, reduction.name = "wnmap", dims = 1:30)
多组学分析的第一课是"别把 RNA 的习惯带到别的层"。ADT 层的计数分布与 RNA 完全不同(抗体结合带来的背景与饱和),标准动作是居中对数比率变换(CLR)而非总计数对数化;抗体间还存在溢出(一个抗体信号漏到相近表位),严谨的项目要做溢出校正。ATAC 层的数据是"峰"矩阵(基因组上开放区段的计数),维度高且更稀疏,标准路线是词频逆文档频率变换加潜在语义索引(LSI)降维,另配套生成基因活性矩阵(把峰的信号按距离归并到基因上)用于与 RNA 层对齐。这些层特异流程封装在工具里,但参数含义与失败模式需要你心里有图。
联合分析的框架当前以加权最近邻(WNN)为代表:按各层的信息量自动定权重,算出联合的邻居图用于聚类与可视化——RNA 主导的细胞用它,蛋白或染色质信息更可分的细胞让那层多说话。Python 生态对应的是 MuData(muon 框架),把多层 AnnData 装进一个 MuData 对象,配套 WNN 与各层工具。
多组学之外还有一条"找回时间"的技术线值得知道。第四章的拟时序是计算推断,谱系示踪则是给细胞装上可读的"里程表":利用体细胞线粒体突变作为天然条码,或用 CRISPR 编辑条码在细胞分裂时累积可测痕迹,读出细胞之间的真实亲缘关系。谱系信息与转录组叠加后,发育与重编程研究里的"谁变成了谁"从推断变成记录。这条线的分析工具自成体系,常规图谱项目用不到,但读文献遇到 lineage tracing 或 mitochondrial barcoding 字样时应知道它属于这一族——时间分辨的第三种来源,与拟时序、RNA 速率并列。
蛋白层有自己的质控清单,照搬 RNA 的习惯必出错。第一项是抗体结合的背景估计:用同型对照抗体(不识别任何目标蛋白的对照)或未标记细胞的信号分布,定出每个抗体的背景水位,专用方法(如 dsb)还会利用空液滴的抗体信号做更精细的背景扣除——这层校正对低表达蛋白的判读影响巨大。第二项是溢出矩阵:荧光流式的补偿逻辑在寡核苷酸标签体系里同样存在,相邻标签的信号串扰要用实验测得的溢出矩阵解开,面板越大这一步越重要。第三项是抗体失效检测:某个抗体信号整体塌陷或飘移(常因运输与储存不当),它的蛋白测量已经失真,识别方法是把各抗体的信号分布画在一起对比——分布异常的那个抗体单独标记不可用,别让它污染联合分析。
Multiome 数据的 RNA 侧按第三章常规流程走,ATAC 侧有一套独立的验收指标。核小体条带图谱:合格数据的片段分布应呈现单核小体(约两百多碱基)与游离片段的特征双峰,无峰值结构说明核制备失败。TSS 富集:在转录起始位点周围信号应显著富集(经验合格线在八倍以上),它衡量的是染色质测量的信噪比。FRiP(峰内读段占比):落在可重复峰内的读段比例反映信噪比的另一面,随实验目的浮动但过低必有问题。三项验收合格的 ATAC 层,才值得进 TF-IDF 加 LSI 的降维流程;不合格时的常见根源在细胞核制备环节,分析端无药可医——又是上游决定上限的例子。
多组学找回了信息层,欠条还剩一张:空间。下一节看位置信息怎么被测出来,以及空间数据怎么接入你已掌握的分析链。