4.2 16S rRNA 测序鉴定全流程


4.2 16S rRNA 测序鉴定全流程

本节摘要:16S rRNA 基因测序是分子鉴定的主力工具:一条约 1500 碱基的保守基因,普适存在、演化缓慢、留有可变区分辨度。本节从挑菌讲到下结论,走完扩增、测序、质控、比对、判读五步,重点讲清相似度阈值的正确用法与三个已知盲区——读完你应当知道它什么时候可信,什么时候必须停手。

本节兑现 3.4 案例的承诺:那里"低置信转测序"送出去的,正是这里要拆开的流程。位置上,本节是 1.2 第四幕(序列时代)与 4.1 证据对应表(门级看 16S)的实操化。

为什么偏偏是 16S

16S rRNA 基因的三重禀赋 1.2 已给过定性描述,这里给定量版本。其一,普适性:所有细胞生命都有核糖体,细菌与古菌各有一套自己的 16S(真核对应物是 18S),数据库覆盖无死角。其二,保守中的变异:全序列可划出九个高变区(V1 到 V9),保守区适合设计通用引物,可变区负责区分物种——一个分子同时供上"能钓到"与"钓得到后分得开"两件事。其三,拷贝数适中且参考库最厚:几十年的文献积累让它成为比对参考序列最完整的分子标记。

但三重禀赋每条都带刻度:拷贝数在不同物种间从一份到十几份不等,拷贝间序列还可以有差异(异质性);高变区的分辨力在不同谱系间严重不均。这些刻度就是后面盲区的伏笔。

流程五步

16S 鉴定操作流水(纯培养物全长路线) 一、模板制备:挑对数期纯培养物,粗提 DNA 即可满足 PCR 二、扩增:通用引物 27F 与 1492R,扩出近全长 1.5 kb 片段 体系要点:设置无模板对照;退火温度按引物报告值 三、测序:Sanger 双向测通,正反两向拼接覆盖全序列 四、质控:切引物、去低质量尾部、拼接后人工核对嵌合体迹象 五、比对:上传序列数据库比对,取最相似参考序列与相似度 判读:结合相似度阈值与建树定位下结论,见下文

放大产物走 Sanger 还是高通量,取决于目的:鉴定一个纯培养物,Sanger 全长路线是金标准;同时鉴定群落里的几十上百种(如环境样品),走扩增子高通量路线,只测一两个高变区——分辨率换通量,代价在 4.4 节细算。

图 1 从菌落到结论的五步流水

相似度阈值的正确用法

1990 年代形成的经验线沿用至今:16S 相似度低于约 98.65%(早期口径 97%)倾向于不同种;低于约 94.5% 倾向于不同属;低于 95% 左右则基本确保不同的科。注意动词——"倾向于",不是"等于"。这些数字来自"与 DNA 杂交金标准的回算拟合",是统计约定而非物理定律,1.3 节的双轨制在此再次显形。

正确的用法是把它当过滤器

  • 相似度低于种级线 → 可以放心写"不同于已描述的种,疑似新种";
  • 相似度高于种级线 → 不能直接写"就是该种",只能说"与某种高度相似"——多株不同的菌 16S 完全一致是常态(近缘种分不开正是本方法第一盲区);
  • 相似度卡在阈值边缘 → 一律加证据:建树看拓扑位置,加测看家基因(如 gyrB、rpoB),或直接上全基因组 ANI(4.3 的正戏)。
比对判读记录示例(示例数据) 待测株编号:S-2417 最优命中:某属某种模式菌株 16S,相似度 99.2% 次优命中:同属另一种模式菌株,相似度 98.9% 判读:高于 98.65% 种级线但两命中差距仅 0.3 个百分点 处置:16S 不足以定种 → 转全基因组 ANI(结果见 4.3 案例) 备注:切勿在报告中只引最优命中省略差距信息

三个已知盲区

盲区一:近缘种不可分。 志贺氏菌与大肠杆菌的 16S 相似度高达 99% 以上——1.3 的公案在 16S 尺度下连证据都不存在。凡属"近期快速辐射"的谱系,16S 的变异速度跟不上分化速度。

盲区二:拷贝异质性。 同一菌株的多份 16S 拷贝若序列不一,Sanger 峰图出现叠峰,拼接结果可能取了少数拷贝的序列,比对结论随之偏移。叠峰信号要人工复核,不能交给软件自动"选多数"了事。

盲区三:数据库投影。 比对的上限是参考库的质量。库里的错标序列(当年定错了名字后来没更正的)会把你的序列"带偏"到错误名字上。防偏手段:优先比模式菌株序列;对最优命中的登记信息做一遍人工核查;多条并列时看库级覆盖率而非单条相似度。

⚠️ 常见坑:直接把测序公司返回的"top1 命中"抄进报告。公司流水线默认输出最优命中名,不输出差距与并列信息——那句"相似度 99.2%"单独看什么都不能证明。报告里必须带着判读上下文。

送检单怎么填、结果怎么验

多数读者不会亲手跑测序仪,流程落到现实里就是一张送检单加一次结果验收。把两头都写规范,中间环节的服务商自然会照单办事。

16S 鉴定送检单(要素版) 菌株编号:S-2417(对应冻存管 LY-24-17) 菌株来源:河滩沉积物分离株,纯培养验纯记录见 2024-11-18 培养条件:淀粉琼脂 28 摄氏度 72 小时,革兰氏阳性分枝丝状体 测序范围:16S 全长约 1.5 kb,引物 27F 与 1492R,双向测通 交付要求:拼接后全长序列(fasta)加双向原始峰图 最优与次优命中各五条(含相似度与登录号) 嵌合体筛查说明 备注:优先比对模式菌株序列库

两个常被忽略的字段各有用处。"交付双向峰图"是给拷贝异质性留检查口——叠峰只有看原始峰图才能发现,拿不到峰图的委托等于放弃盲区二的防线。"要求次优命中各五条"是给并列判读留证据——只报 top1 的返回单,连阈值过滤器的第一步都做不了。

结果验收三步:一看峰图有无叠峰与低质量区(质检步的复核);二看最优与次优命中的差距,按上文过滤器分档;三看最优命中的登记信息是否模式菌株、登记名有无沿革(防数据库投影)。三步全过,才轮到写结论。

建树定位:阈值之外的第二意见

过滤器分档后落在"临界与并列"的菌株,规程给的出路是建树。这一步的原理与限度都值得交代清楚。

原理:把待测序列与候选类群的模式菌株序列一起做多序列比对,构建系统发育树,看待测株落在哪个分支内部、与哪个模式菌株最近。树给出的是"拓扑位置"信息,与"相似度百分比"是两类互补的证据——百分比是距离,树是关系网,临界数字在关系网里常常一目了然。

限度有三条。树形依赖建树方法与参数(邻接、最大似然给出的拓扑可能有出入),单靠一棵树不下种级结论;短序列建树不可靠,全长序列才有定位资格;树上的"最近"若与百分比打架,重复 4.1 的处置哲学——两类证据都摆出来,标明倾向,不下独断。

到这一步还悬而未决的菌株,就是全基因组方法的准客户。4.3 的 ANI 与 dDDH 接棒的逻辑,不是"更快的机器",而是"分辨率不够时的证据升级"——工作链的接力纪律,到这里与第 3 章完全同构。

本节要点回顾

  • 16S 的三重禀赋:普适、保守中有可变区、参考库最厚,每条都带刻度;
  • 流程五步:模板、扩增、测序、质控、比对,全长 Sanger 路线是纯培养物金标准;
  • 阈值是过滤器不是判决书:低于种级线敢说"疑似新种",高于它不敢说"就是该种";
  • 临界与并列一律加证:建树、看家基因、全基因组 ANI,按分辨率需求升级证据;
  • 三个盲区:近缘不可分、拷贝异质、数据库错标投影,每个都有对应的防偏动作。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U