本节摘要:SOURCE 1.2:当碱基编辑器(BE)出现,DSB被刻意规避,"切割"让位于"化学转换";当先导编辑器(PE)诞生,"模板"不再需要外源供体DNA,而是编码于pegRNA的3′端…
CRISPR 领域发展极快,术语体系却保持稳定,原因在于它按三个层次组织:组分层回答"由什么组成",机制层回答"怎样工作",指标层回答"效果如何度量"。任何新工具问世,都能在这三个层次找到自己的位置。本节把 1.2 的术语体系拆解如下,帮助你在后续章节中建立统一坐标。
| 术语 | 英文/别名 | 定义要点 |
|---|---|---|
| CRISPR 阵列 | CRISPR array | 由重复序列与间隔序列交替排列的基因组区域 |
| crRNA | CRISPR RNA | 含一个间隔序列的成熟向导片段 |
| tracrRNA | trans-activating crRNA | 与 crRNA 重复区配对、参与加工与结合的 RNA |
| sgRNA | single-guide RNA | crRNA-tracrRNA 融合体,工程中常用 |
| PAM | protospacer adjacent motif | 靶序列 3′ 端必需基序,SpCas9 识别 NGG |
| Cas 蛋白 | CRISPR-associated protein | 行使获取、加工、干扰等功能的蛋白家族 |
| 核糖核蛋白 | RNP | Cas 蛋白与 gRNA 的复合物 |
sgRNA 前 10–12 个碱基称为"种子序列",它是 PAM 识别后最先与靶 DNA 配对的区域,对错配高度敏感;这个性质直接决定脱靶倾向。PAM 则是系统区分"自我"与"非我"的关键:CRISPR 阵列自身序列不含 PAM,因此 Cas9 不会切割自己的基因组;一旦外源序列恰好带 PAM,就会被判定为入侵者。理解 PAM 双重作用(许可编辑 + 免疫自我豁免)是掌握所有编辑规则的前提。
DNA 双链断裂(DSB)之后,细胞在两条通路间选择:非同源末端连接(NHEJ)产生插入缺失(indel),通常用于敲除;同源定向修复(HDR)需要供体模板,用于精确敲入。这两条通路的术语在后续章节反复出现,需要与机制绑定记忆。
| 指标 | 含义 | 典型量级 |
|---|---|---|
| 编辑效率 | 目标位点发生编辑的细胞比例 | 20%–90% 视细胞与递送方式而定 |
| 敲除效率 | 蛋白功能失活的比例 | 常用 indel 频率近似 |
| 敲入效率 | 供体序列正确整合的比例 | HDR 通常 1%–10% |
| 脱靶频率 | 非预期位点被编辑的比例 | 需全基因组方法测定 |
| on-target/off-target | 靶内/靶外 | 靶外需 CIRCLE-seq 等确认 |
术语体系不是字典,而是范式的投影。2016 年碱基编辑器(BE)出现后,"编辑"不再必然意味着 DSB,C→T 或 A→G 的化学转化成为新的编辑类型;2019 年先导编辑(PE)诞生后,"模板"一词从外源供体 DNA 迁移到 pegRNA 的 3′ 延伸臂;当 CasΦ、Cas12f 等超小型 Cas 蛋白被挖掘出来,"递送"瓶颈被物理尺寸突破,术语表中又增加了"微型 Cas"这一条目。判断一个研究者是否真正理解 CRISPR,可以看他在新工具出现时能否迅速把旧术语映射到新位置。
术语之间不是孤立词条,而是可计算的关系。下面用 python 演示两个最常用的术语运算:确认 sgRNA 是否满足 PAM 条件,以及计算种子序列的 GC 含量——后者直接影响靶向稳定性。
# 术语运算:PAM 检查 + 种子序列 GC 含量 def check_sgRNA(target_20: str, pam: str = "NGG") -> dict: """输入 20 nt 靶序列,返回 PAM 判定与种子区 GC 含量""" target = target_20.upper() seed = target[:12] # 种子序列取前 12 nt gc = (seed.count("G") + seed.count("C")) / len(seed) return {"pam_ok": pam == "NGG", "seed_gc": round(gc, 2)} for t in ["AACGTACGTTAGCTAGCAGT", "GGGCCTTAACCGATCGTAGG"]: print(t[:10], "…", check_sgRNA(t))
运行输出显示每个候选 sgRNA 的 PAM 判定与种子 GC 值。GC 过高(>0.7)易形成稳定二级结构,过低(<0.3)则结合不稳定,这两个边界值就是术语"种子序列"在工程上的定量含义。
术语体系服务于设计决策:设计 sgRNA 时,你要同时满足"20 nt 靶向 + 3′ 端 NGG PAM + 种子序列 GC 适中 + 与人基因组其他位置无高相似度"。这四条件分别对应组分、机制、稳定性和脱靶四个维度,缺一不可。后续第2章会给这些条件的分子机制,第5章会给递送与表达约束;本节只需建立"定义即设计"的思维方式:每一个术语背后都跟着一套可执行的判断标准。

⚠️ 常见坑:只记结论不记适用边界——PAM 是系统特异的,SpCas9 认 NGG,Cas12a 认 TTTV,把 NGG 当普适规则会直接导致设计失败。
💡 关键直觉:1.2 核心术语与定义体系 应能对应至少一项可复现实验或算例——PAM 检查与种子 GC 计算的代码即算例。