5.2 RNA-seq从抽提到差异表


5.2 RNA-seq 从抽提到差异表

本节摘要:RNA-seq 把一份 RNA 变成可计数的读段。命运在建库分叉处就定了:polyA 富集丢掉无尾 RNA,核糖体去除决定有多少钱浪费在 rRNA 上,链特异文库才能谈反义转录。差异表达算法很勤快,但批次、完整性、测序深度和重复数不合格时,火山图只是把实验事故画得好看。

上手前先明确

阅读完本节,你应当能够:

  1. 在 polyA 富集和核糖体去除之间按样本类型选择
  2. 说明为何生物学重复优先于把一个样本测到天深
  3. 识别批次在 PCA 上的典型样子
  4. 把差异表里的基因先拿回 qPCR 或蛋白,再写机制故事

建库分叉比算法更致命

RNA 合格是前提,完整性差的样本在 polyA 流程里会偏向 3 端,基因长度和降解缠在一起,差异像幽灵。核糖体 RNA 占细胞内 RNA 的绝大多数,不去掉就等于花钱给核糖体做基因组。polyA 抓有尾 mRNA,对原核、降解、非 polyA 转录本不友好。rRNA 去除保留更广,包括新生 RNA 和某些 lncRNA,去除效率不稳定时批次就来了。

把它当成渔。polyA 是专钓带特定浮标的鱼,渔获干净但湖里很多鱼没有浮标。核糖体去除是先捞走占地方的水草,剩下什么是什么,水草没捞净就全是草。你要看哪一类鱼,决定用哪张网,而不是先捕一网再请统计学家把草解释成鱼。

建库前写死: 真核完整 mRNA 为主 → 常选 polyA 原核 / 降解 / 要非编码 → rRNA 去除 要正负链信息 → 链特异方案 样本跨天处理 → 记录批次,随机化分组

插入片段和读长影响能否看见剪接和基因家族区分。链特异让你知道读段来自哪条链,反义 lncRNA 和重叠基因靠它。非链特异把两边混起来,某些定量会糊。UMI 在低起始量、扩增很重的文库里几乎必要,否则又是 PCR 复印当表达。

选择 留下什么 丢掉什么
polyA 多数成熟 mRNA 无尾组蛋白、很多新生 RNA、原核
rRNA 去除 更广的 RNA 去除试剂偏好造成的空洞
总 RNA 不处理 几乎一切 预算,因为全是核糖体
小 RNA 专库 miRNA 等 长 RNA
单细胞 细胞间异质 深度和 dropout

计数、归一、差异:每一步都在做假设

比对或准比对把读段放到基因或转录本。多重比对的基因家族会打架。转录本水平定量比基因水平更吵,因为异构体共享外显子。差异分析常用负二项一类模型处理过度离散。它们假设样本是可比较的生物学重复。批次不是生物学重复:同一天同一人做的处理组,对另一天做的对照组,算法会热情地找出“差异基因”,其实是试剂批次。

重复数:没有生物学重复的 RNA-seq 几乎不能做正经差异。两个重复极脆。三个是常见起点,效应小或噪声大时要更多。把一个样本分成三份测,是技术重复,不能替代三个动物或三皿独立处理。深度:检测低表达基因要更深,但先保证重复。先深后少,是常见的钱花错方向。

⚠️ 常见坑:用管家基因归一 RNA-seq。高通量计数有自己的规模因子,硬套单基因参照会扭曲。qPCR 的习惯不要原样搬过来。
💡 关键直觉:差异表是“在这些假设下计数不同”,不是“转录被这个处理直接调控”。验证和实验设计把假设变硬。

Spike-in 外源 RNA 可以帮你发现全局下调(细胞整体转录萎缩)这类普通归一会抹掉的事。不用 spike-in 时,至少要问:我的处理会不会让总 RNA 产量变?若会,故事要改写。

图 RNA-seq 事故高发点

图 RNA-seq 事故高发点

工程实践:从核心设施回来之后你要看的数

先看比对率、rRNA 比例、重复率、基因检测数、3 端偏倚。这些比 p 值先读。rRNA 占一半以上,等于有效深度腰斩。重复率极高,低起始量或过度扩增。3 端偏倚,降解或 polyA 在碎 RNA 上的自然后果。

差异表过滤:太低表达的基因先滤,否则多重检验被噪声基因拖累。倍数和统计显著性两维都要,只要 p 值会留下无意义的微小变化。热图不要把全基因组塞进去再聚类,那会画出美丽的噪声。挑有统计支持的基因,并注明选择标准。

验证:挑几个上调下调做 qPCR,不是为了讨好审稿人,是为了抓建库事故。方向完全反的,先查样本对调。只验证最显著的十个不够,也要看你故事里的关键基因,哪怕它不是最显著。

单细胞 RNA-seq 额外有 dropout、双细胞、细胞周期混杂。它回答异质性,不自动比 bulk 更“真”。bulk 仍是处理效应的稳健第一刀。

问题:没有重复能不能发?

作为探索性资源、罕见样本描述,有时可以,但不要做差异检验然后讲机制。一张没有重复的火山图是装饰。

问题:通路富集显著是不是机制成立?

第 5.4 节细说。这里先说:输入基因列表被表达量和基因长度偏倚污染时,通路也会偏。富集是假说发生器,不是结案。

链特异文库的方向统计应接近预期,若正负链糊成一半对一半,可能建库试剂拿错或分析参数把链信息丢了。基因长度偏倚让长基因更容易被叫差异,分析应知情。GC 偏倚让某些物种或某些基因家族系统性变暗。这些偏倚校正能减轻,不能发明不存在的覆盖。单细胞的空转 RNA 和双细胞混杂会造出不存在的中间状态,过滤标准要事先写,不能看完 tSNE 再调到好看。

生物学重复的定义是独立处理。一皿细胞分成三孔,共享了培养史,相关噪声会让 p 值过于乐观。动物实验的窝别、性别是批次因子,应在设计里平衡。RNA-seq 很贵,更应在设计阶段花钱问统计,而不是测完找人“看看有没有差异”。没有差异也是结果。强行做通路包装会把噪声写成机制,伤害下一轮湿实验的方向。

公共数据整合时,实验室来源常常大于处理效应。把别人的对照和自己的处理拼成差异,是批次的经典自杀。重新对齐、看 PCA 按实验室分开还是按处理分开,分开则不要做差异。资源允许就用同一流程重测关键样本。组学的可重复性从这里开始,而不是从换一个更新的软件开始。

建库起始量低于试剂声明时,扩增循环会上去,重复率会上去,定量会假。宁可合并生物学材料,不要用技术重复假装深度。链特异失败时,反义基因定量作废,分析应降级。核糖体去除试剂对某些物种效率差,预实验用廉价测序看 rRNA 比例。批次校正软件在处理与批次完全重合时无法拯救,那是设计错误。随机化进样和随机化建库日期,比事后争论更便宜。差异表的基因名用稳定 ID,别名会在注释版本间跳舞。补充表给出原始计数,让别人能重画火山图。不能重画的组学,权重下降。把可重画当成完成标准,和胶图存档同一级。

有效深度等于总读段减去核糖体再减去重复。报告有效深度,不报告毛读段。三端偏倚用基因体覆盖图看,偏倚与分组重合时差异作废。链特异比例写进质控。单细胞过滤的线粒体比例、基因数阈值事先写,调到图好看属于造假的亲戚。生物学重复的独立性用培养代数和动物编号证明,不是用文件名证明。通路分析用检测基因为背景。用全基因组背景会让高表达通路反复亮起。亮起可以是真,也可以是窗口。窗口要写进讨论。

毛读段不是有效深度。减去核糖体和重复之后还剩多少,才决定低表达基因有没有被看见。三端偏倚与分组重合时,差异表直接作废,不要靠软件硬校正成故事。生物学重复不是一皿分三孔。通路分析用检测基因为背景。公共数据按实验室分开就不要和自己的处理拼差异。可重画的计数表是完成标准。

有效深度说话,毛读段不说话。偏倚与分组重合则表作废。一皿三孔不是生物学重复。检测基因做富集背景。公共数据按实验室抱团就不要拼处理。计数表可重画才算完成。链特异比例写进质控。起始量不够会推高重复率。性别和窝别是批次因子,设计里平衡。

有效深度、偏倚与分组、真重复、检测背景、实验室抱团、可重画计数,六项不过关不进差异。毛读段是发票,不是数据。链特异比例、重复率、性别窝别,都是设计变量。调图好看属于造假亲戚。空也是结果,硬包装通路会伤害下一轮湿实验。

差异放行六项:有效深度、偏倚不与分组重合、真重复、检测背景、不按实验室拼处理、计数可重画。六项不过关,火山图当装饰。毛读段是发票。一皿三孔不是重复。调图好看是造假亲戚。空也是结果。

把建库分叉写进方法第一段:哪张网、几份真重复、哪一天建的库。第一段写不清,后面算法段落等于空转。有效深度、三端覆盖、核糖体比例三张图应先于火山图出现在补充。出现顺序就是你的科学态度。

补充材料的顺序暴露态度:先覆盖图后火山图,是实验;先火山图后覆盖图,是海报。

建库日期与处理分组一旦重合,再好的负二项模型也只是在给日历做差异分析。

链特异性建库才能分清重叠基因和反义转录。核糖体去除失败会让差异表被少数基因劫持。重复必须来自独立培养或独立个体,同一文库切两份不是生物学重复。抽提日的完整性指数要进样本表,降解样本会在主成分上变成假亚型。

批次校正软件不能把处理与建库日期完全重合的设计救回来,随机化必须发生在抽提之前。

要点串联

  • 网决定渔获:polyA 与 rRNA 去除不是可互换贴纸。
  • 完整性分家会造假差异:3 端偏倚像调控。
  • 生物学重复优先于无限深度:技术分管不是生物学重复。
  • 批次不要与处理重合:随机化是设计不是事后软件。
  • 先读 QC 指标再读 p 值:rRNA 比例、重复率、3 端偏倚。
  • 归一假设会抹掉全局变化:怀疑总产量时考虑 spike-in。
  • 差异表要验证:对调、事故、关键基因方向。

下一节从 RNA 清单走到蛋白清单:质谱看见的是肽段,搜库是一场有参数的对赌。


作者与出处
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 转发
评论区 (0)
U