1.2 核心术语与定义体系


1.2 核心术语与定义体系

本节摘要:SOURCE 1.2:当碱基编辑器(BE)出现,DSB被刻意规避,"切割"让位于"化学转换";当先导编辑器(PE)诞生,"模板"不再需要外源供体DNA,而是编码于pegRNA的3′端…

术语体系的三个层次

CRISPR 领域发展极快,术语体系却保持稳定,原因在于它按三个层次组织:组分层回答"由什么组成",机制层回答"怎样工作",指标层回答"效果如何度量"。任何新工具问世,都能在这三个层次找到自己的位置。本节把 1.2 的术语体系拆解如下,帮助你在后续章节中建立统一坐标。

第一层:组分术语

术语 英文/别名 定义要点
CRISPR 阵列 CRISPR array 由重复序列与间隔序列交替排列的基因组区域
crRNA CRISPR RNA 含一个间隔序列的成熟向导片段
tracrRNA trans-activating crRNA 与 crRNA 重复区配对、参与加工与结合的 RNA
sgRNA single-guide RNA crRNA-tracrRNA 融合体,工程中常用
PAM protospacer adjacent motif 靶序列 3′ 端必需基序,SpCas9 识别 NGG
Cas 蛋白 CRISPR-associated protein 行使获取、加工、干扰等功能的蛋白家族
核糖核蛋白 RNP Cas 蛋白与 gRNA 的复合物

第二层:机制术语

sgRNA 前 10–12 个碱基称为"种子序列",它是 PAM 识别后最先与靶 DNA 配对的区域,对错配高度敏感;这个性质直接决定脱靶倾向。PAM 则是系统区分"自我"与"非我"的关键:CRISPR 阵列自身序列不含 PAM,因此 Cas9 不会切割自己的基因组;一旦外源序列恰好带 PAM,就会被判定为入侵者。理解 PAM 双重作用(许可编辑 + 免疫自我豁免)是掌握所有编辑规则的前提。

DNA 双链断裂(DSB)之后,细胞在两条通路间选择:非同源末端连接(NHEJ)产生插入缺失(indel),通常用于敲除;同源定向修复(HDR)需要供体模板,用于精确敲入。这两条通路的术语在后续章节反复出现,需要与机制绑定记忆。

第三层:指标术语

指标 含义 典型量级
编辑效率 目标位点发生编辑的细胞比例 20%–90% 视细胞与递送方式而定
敲除效率 蛋白功能失活的比例 常用 indel 频率近似
敲入效率 供体序列正确整合的比例 HDR 通常 1%–10%
脱靶频率 非预期位点被编辑的比例 需全基因组方法测定
on-target/off-target 靶内/靶外 靶外需 CIRCLE-seq 等确认

定义随范式而迁移

术语体系不是字典,而是范式的投影。2016 年碱基编辑器(BE)出现后,"编辑"不再必然意味着 DSB,C→T 或 A→G 的化学转化成为新的编辑类型;2019 年先导编辑(PE)诞生后,"模板"一词从外源供体 DNA 迁移到 pegRNA 的 3′ 延伸臂;当 CasΦ、Cas12f 等超小型 Cas 蛋白被挖掘出来,"递送"瓶颈被物理尺寸突破,术语表中又增加了"微型 Cas"这一条目。判断一个研究者是否真正理解 CRISPR,可以看他在新工具出现时能否迅速把旧术语映射到新位置。

用代码锚定术语关系

术语之间不是孤立词条,而是可计算的关系。下面用 python 演示两个最常用的术语运算:确认 sgRNA 是否满足 PAM 条件,以及计算种子序列的 GC 含量——后者直接影响靶向稳定性。

# 术语运算:PAM 检查 + 种子序列 GC 含量 def check_sgRNA(target_20: str, pam: str = "NGG") -> dict: """输入 20 nt 靶序列,返回 PAM 判定与种子区 GC 含量""" target = target_20.upper() seed = target[:12] # 种子序列取前 12 nt gc = (seed.count("G") + seed.count("C")) / len(seed) return {"pam_ok": pam == "NGG", "seed_gc": round(gc, 2)} for t in ["AACGTACGTTAGCTAGCAGT", "GGGCCTTAACCGATCGTAGG"]: print(t[:10], "…", check_sgRNA(t))

运行输出显示每个候选 sgRNA 的 PAM 判定与种子 GC 值。GC 过高(>0.7)易形成稳定二级结构,过低(<0.3)则结合不稳定,这两个边界值就是术语"种子序列"在工程上的定量含义。

从定义到设计

术语体系服务于设计决策:设计 sgRNA 时,你要同时满足"20 nt 靶向 + 3′ 端 NGG PAM + 种子序列 GC 适中 + 与人基因组其他位置无高相似度"。这四条件分别对应组分、机制、稳定性和脱靶四个维度,缺一不可。后续第2章会给这些条件的分子机制,第5章会给递送与表达约束;本节只需建立"定义即设计"的思维方式:每一个术语背后都跟着一套可执行的判断标准。

01-01-fig01-4

⚠️ 常见坑:只记结论不记适用边界——PAM 是系统特异的,SpCas9 认 NGG,Cas12a 认 TTTV,把 NGG 当普适规则会直接导致设计失败。

💡 关键直觉:1.2 核心术语与定义体系 应能对应至少一项可复现实验或算例——PAM 检查与种子 GC 计算的代码即算例。

本节小结

  • 三层结构:组分(阵列/crRNA/Cas)→ 机制(PAM/种子序列/R-loop)→ 指标(效率/脱靶)
  • 范式迁移:BE 让"切割"让位于"化学转化",PE 让"模板"内嵌于 pegRNA
  • 方法:把术语还原为可计算判定,设计 sgRNA 时四条件缺一不可

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U