矩阵整形:从质控到细胞图谱


文档摘要

第 3 章 · 矩阵整形:从质控到细胞图谱 本章要回答的三个问题:一张刚出炉的计数矩阵,凭什么要先过滤再归一化、顺序能不能换?主成分到底取多少个、聚类分辨率怎么调才不是拍脑袋?分出 cluster 之后,凭什么说它是 T 细胞而不是别的? 为什么会有这一章 第二章结束时你手里的矩阵是"生的":死细胞与双联体混在里面冒充稀有细胞类型,测序深度差异制造着批间假差异,两万个基因里九成在大多数细胞里默默无闻。直接拿这张表做聚类,出来的"细胞类型"会混合技术噪声与生物学信号,注释时自相矛盾。

第 3 章 · 矩阵整形:从质控到细胞图谱

本章要回答的三个问题:一张刚出炉的计数矩阵,凭什么要先过滤再归一化、顺序能不能换?主成分到底取多少个、聚类分辨率怎么调才不是拍脑袋?分出 cluster 之后,凭什么说它是 T 细胞而不是别的?

为什么会有这一章

第二章结束时你手里的矩阵是"生的":死细胞与双联体混在里面冒充稀有细胞类型,测序深度差异制造着批间假差异,两万个基因里九成在大多数细胞里默默无闻。直接拿这张表做聚类,出来的"细胞类型"会混合技术噪声与生物学信号,注释时自相矛盾。矩阵整形要做的,就是把技术噪声一层层剥掉,把生物学信号一步步放大——顺序是固定的:先过滤(坏细胞不配进分析)、再归一化(消除深度差异)、再挑高变基因(只带信号强的基因上路)、再降维聚类(把相似细胞放在一起)、最后注释(给每群细胞起生物学名字)。

这个顺序不是习俗而是逻辑:归一化前不过滤,死细胞的极端深度会扭曲缩放因子;降维前不挑基因,海量零信号基因稀释主成分的生物学含义;注释前不聚类,注释就失去了对象。理解了这层依赖,后面每一节的参数选择都有了锚点。

本章管线全景

管线里最值得注意的箭头是最后那个回退:图谱不合理时,第一反应不是换聚类算法,而是回到质控检查阈值——返工成本最低的位置永远是管线的上游。全章六节按这条链依次展开,每节都带可跑代码与参数表。

读完能解决什么

  • 独立设定三个质控指标的阈值:基因检出数下限常在两百上下、上限常在六千上下、线粒体比例阈值在百分之五到二十之间按组织选,并说明你的样本为什么取这些数;
  • 用 Scrublet 或同类工具做双细胞检测,理解为什么分数阈值要按数据分布调;
  • 在总计数归一化加对数化与 SCTransform 两条路线之间做选型,知道各自的坑;
  • 按拐点与方差贡献率选主成分个数(十到五十是常见区间),按模块度扫描聚类分辨率(零点几到一点几);
  • 用标记基因、参考映射两条路线给 cluster 注释,并用一致性与比例合理性做交叉验证。

常见返工的三个触发点

本章管线的返工集中在三个位置,提前打预防针。第一是质控阈值拍脑袋:不看分布直接抄论文数字,把代谢活跃的组织按外周血阈值砍掉一半真细胞,下游全链作废——所以 3.1 节反复强调"先画图再下刀"。第二是归一化顺序错乱:对 log 之后的数据再归一化、或丢了 counts 层没法做差异表达,都是不可逆的整形事故——遵守"归一化前存原始计数"的纪律可完全避免。第三是聚类分辨率一步到位:直接锁定一个分辨率不再扫描,结果要么碎成渣要么糊成团,还要回头重跑——分辨率扫描加标记基因抽查(3.5 节)的成本极低,却能把图谱的可解释性提高一个档次。这三个触发点的共同解法是把验证动作放在便宜的位置,这也是全章的元方法。

各节怎么分工

回答的问题 关键产出
3.1 质控三指标 哪些细胞不配进分析 过滤后的干净矩阵
3.2 双细胞检测 潜伏的嵌合细胞怎么除 双细胞标记与剔除
3.3 归一化与缩放 深度差异怎么消除 可比较的表达值
3.4 高变基因选择 带谁上路 一两千个信号基因
3.5 PCA、UMAP 与邻居图 高维怎么压成可看的图 降维坐标与图结构
3.6 聚类注释 cluster 叫什么名字 带标签的细胞图谱

先决条件与往下走到哪

本章代码全部建立在第一章的环境与第二章的矩阵之上;若你拿的是现成矩阵,从 3.1 开始即可。走完本章,你将得到一张可解释的细胞图谱——第四章会把它推进到时间轴(轨迹)与因果叙事(通讯与差异表达),那是图谱真正开始回答生物学问题的地方。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U