5.2 空间转录组学实操入门 本节摘要:空间转录组在保留组织切片位置信息的前提下测基因表达,两大技术路线各有取舍——点阵式测全转录组但每点混有多个细胞,原位式达到单细胞甚至亚细胞分辨率但只测预设的几百个基因。本节讲平台选型、最小分析流程,以及空间证据如何反过来修正解离数据的结论。 把位置留下来 肿瘤学里有个经典尴尬:解离数据显示某样本有大量细胞毒性 T 细胞浸润,疗效却很差——空间数据揭开谜底,T 细胞全被挡在肿瘤团块外围的基质层里,根本没有接触肿瘤细胞。位置不只是附加信息,它常常就是机制本身:信号的传递依赖相邻,生态位的形成依赖空间组织。空间转录组把表达测量做在组织切片上,每个数据点自带切片上的坐标,位置从此成为可分析的变量。
本节摘要:空间转录组在保留组织切片位置信息的前提下测基因表达,两大技术路线各有取舍——点阵式测全转录组但每点混有多个细胞,原位式达到单细胞甚至亚细胞分辨率但只测预设的几百个基因。本节讲平台选型、最小分析流程,以及空间证据如何反过来修正解离数据的结论。
肿瘤学里有个经典尴尬:解离数据显示某样本有大量细胞毒性 T 细胞浸润,疗效却很差——空间数据揭开谜底,T 细胞全被挡在肿瘤团块外围的基质层里,根本没有接触肿瘤细胞。位置不只是附加信息,它常常就是机制本身:信号的传递依赖相邻,生态位的形成依赖空间组织。空间转录组把表达测量做在组织切片上,每个数据点自带切片上的坐标,位置从此成为可分析的变量。

点阵式平台的代表思路是把组织切片贴在布满捕获点的芯片上,每个点(直径五十五微米量级,覆盖一到十个细胞)捕获该区域的 mRNA,测的是全转录组,并同步拍一张染色图像供形态学参照。它的短板是"点不是细胞"——每点的信号是多个细胞的混合,分析时要么把点当作空间最小单元直接聚类(得到"组织学区域"级别的结论),要么用解卷积方法把每点拆成细胞类型构成。原位路线反其道而行:用编码探针在组织原位逐分子成像,分辨率到单细胞甚至亚细胞,但只能测预先设计的基因面板(几百个基因起步,扩展到上千)。选型的判断式:要无偏的全转录组与区域级图谱选点阵式,要细胞级精度与明确假设(比如只关心免疫检查点相关基因)选原位式;预算充足且问题重要时两者互补——先用点阵式画区域地图,再在关键区域用原位式放大。
空间数据的分析骨架与第三章同源,只是多了坐标维度。以点阵式数据为例的 Python 主干:
import scanpy as sc import squidpy as sq adata = sq.read.visium("spaceranger_output/") # 点 × 基因 + 空间坐标 + 图像 adata.var_names_make_unique() adata.var["mt"] = adata.var_names.str.startswith("MT-") sc.pp.calculate_qc_metrics(adata, qc_vars=["mt"], percent_top=None, log1p=False, inplace=True) sc.pp.normalize_total(adata, target_sum=1e4) sc.pp.log1p(adata) sc.pp.pca(adata); sc.pp.neighbors(adata); sc.tl.leiden(adata, resolution=0.5) sq.gr.spatial_neighbors(adata, coord_type="grid") # 把坐标织成空间邻居图 sq.gr.nhood_enrichment(adata, cluster_key="leiden") # 哪些群在空间上相互 enriched sq.pl.spatial_scatter(adata, color="leiden") # 带坐标的表达图谱
squidpy 是空间分析的 Scanpy 姊妹包,上面这段就是全转录组点阵数据从读取到邻域分析的完整主干。质控指标与解离数据一致(每点基因数、线粒体比例),但阈值要按平台重估——组织切片上的点天然带着更多环境 RNA,指标分布与液滴数据不同,照搬经验值会错杀。邻域富集(nhood enrichment)是空间分析最"物有所值"的第一步:它检验哪两类点在空间上抱团,是第四章通讯分析缺的那半张证据。
两条互补用法值得单独强调。其一,解卷积映射:用第三章注释好的单细胞图谱当参考,估计每个空间点里各细胞类型的构成(常用工具 cell2location、RCTD),得到"单细胞精度的类型注释 + 空间坐标"的合成图谱——这是当前文献的主流组合拳。其二,注释纠错:解离数据里某个"稀有细胞类型"若在空间上显示只是散落的双联体式分布,而真类型应有清晰的空间结构(如连续的腺体或成片的浸润带),空间证据会直接推翻或坐实注释。分析链条的终局是位置感知的结论:不是"T 细胞存在",而是"T 细胞聚集在侵袭前沿并紧邻表达趋化因子的巨噬细胞"——后一种说法才配得上机制的标题。
原位路线(逐分子成像的一族技术)的数据形态与点阵式不同,分析流程有对应的调整。它的表达矩阵天然是单细胞分辨率——细胞分割由算法在染色图像上完成,每个细胞直接对应一行数据,不需要解卷积;代价是只测几百个预设基因,高变基因选择在这个小面板上进行,聚类分群也要接受"面板外信息不存在"的边界。分析上多出的两个环节值得留意:一是细胞分割质量检查,图像噪声与密集区域会让分割把两个细胞并成一个,边界错误的细胞表达谱是两种细胞的混合,质控时用"细胞面积与 RNA 总量联合分布"能把离谱的分割剔除;二是面板偏差意识,面板没测的基因不参与聚类,某些状态(比如代谢活跃度)在面板式数据里根本不可见,结论要限定在面板覆盖的信号范围内。
空间数据的单元结构与解离数据不同,重复的口径也不同。点阵式一张切片包含成千上万个点,点级统计的功效通常不缺,缺的是生物学重复——结论要跨独立个体成立,至少三个以上供体或独立样本仍是底线,与 4.3 节的伪重复原则一脉相承。原位式还要多算一层:同一张切片上的多个视野共享切割与染色条件,不能当作独立重复。预算有限时的取舍原则:宁可减少每个样本的测序投入,也要保住独立样本数。
表达坐标与染色图像的配准(对齐)是空间数据的独有环节,失败模式是对齐偏移——表达点与形态结构错位半格。轻微偏移对聚类级分析影响有限,但会毁掉单细胞分辨的邻域分析。排查顺序:先检查坐标系的约定(不同导出工具的原点与翻转约定不同,是最常见的乌龙);再用标志结构人工核对(比如按某个形态清晰的结构看表达信号是否落在对应位置);仍无法对齐就回到原始坐标做分析,牺牲图像信息保住空间关系——坐标本身才是空间数据不可再生的资产,图像只是辅助层。
技术与主线到这里全部讲完。第六章离开方法、进入现场:三类真实疾病研究场景里,前面六章的工具如何组合成完整的分析方案。