第 3 章 · 矩阵整形:从质控到细胞图谱 本章要回答的三个问题:一张刚出炉的计数矩阵,凭什么要先过滤再归一化、顺序能不能换?主成分到底取多少个、聚类分辨率怎么调才不是拍脑袋?分出 cluster 之后,凭什么说它是 T 细胞而不是别的? 为什么会有这一章 第二章结束时你手里的矩阵是"生的":死细胞与双联体混在里面冒充稀有细胞类型,测序深度差异制造着批间假差异,两万个基因里九成在大多数细胞里默默无闻。直接拿这张表做聚类,出来的"细胞类型"会混合技术噪声与生物学信号,注释时自相矛盾。
本章要回答的三个问题:一张刚出炉的计数矩阵,凭什么要先过滤再归一化、顺序能不能换?主成分到底取多少个、聚类分辨率怎么调才不是拍脑袋?分出 cluster 之后,凭什么说它是 T 细胞而不是别的?
第二章结束时你手里的矩阵是"生的":死细胞与双联体混在里面冒充稀有细胞类型,测序深度差异制造着批间假差异,两万个基因里九成在大多数细胞里默默无闻。直接拿这张表做聚类,出来的"细胞类型"会混合技术噪声与生物学信号,注释时自相矛盾。矩阵整形要做的,就是把技术噪声一层层剥掉,把生物学信号一步步放大——顺序是固定的:先过滤(坏细胞不配进分析)、再归一化(消除深度差异)、再挑高变基因(只带信号强的基因上路)、再降维聚类(把相似细胞放在一起)、最后注释(给每群细胞起生物学名字)。
这个顺序不是习俗而是逻辑:归一化前不过滤,死细胞的极端深度会扭曲缩放因子;降维前不挑基因,海量零信号基因稀释主成分的生物学含义;注释前不聚类,注释就失去了对象。理解了这层依赖,后面每一节的参数选择都有了锚点。
管线里最值得注意的箭头是最后那个回退:图谱不合理时,第一反应不是换聚类算法,而是回到质控检查阈值——返工成本最低的位置永远是管线的上游。全章六节按这条链依次展开,每节都带可跑代码与参数表。
本章管线的返工集中在三个位置,提前打预防针。第一是质控阈值拍脑袋:不看分布直接抄论文数字,把代谢活跃的组织按外周血阈值砍掉一半真细胞,下游全链作废——所以 3.1 节反复强调"先画图再下刀"。第二是归一化顺序错乱:对 log 之后的数据再归一化、或丢了 counts 层没法做差异表达,都是不可逆的整形事故——遵守"归一化前存原始计数"的纪律可完全避免。第三是聚类分辨率一步到位:直接锁定一个分辨率不再扫描,结果要么碎成渣要么糊成团,还要回头重跑——分辨率扫描加标记基因抽查(3.5 节)的成本极低,却能把图谱的可解释性提高一个档次。这三个触发点的共同解法是把验证动作放在便宜的位置,这也是全章的元方法。
| 节 | 回答的问题 | 关键产出 |
|---|---|---|
| 3.1 质控三指标 | 哪些细胞不配进分析 | 过滤后的干净矩阵 |
| 3.2 双细胞检测 | 潜伏的嵌合细胞怎么除 | 双细胞标记与剔除 |
| 3.3 归一化与缩放 | 深度差异怎么消除 | 可比较的表达值 |
| 3.4 高变基因选择 | 带谁上路 | 一两千个信号基因 |
| 3.5 PCA、UMAP 与邻居图 | 高维怎么压成可看的图 | 降维坐标与图结构 |
| 3.6 聚类注释 | cluster 叫什么名字 | 带标签的细胞图谱 |
本章代码全部建立在第一章的环境与第二章的矩阵之上;若你拿的是现成矩阵,从 3.1 开始即可。走完本章,你将得到一张可解释的细胞图谱——第四章会把它推进到时间轴(轨迹)与因果叙事(通讯与差异表达),那是图谱真正开始回答生物学问题的地方。