本节摘要:SOURCE 2.1:这个比喻形象,却极具误导性——剪刀是刚性工具,其刃口位置固定、动作单一、无反馈机制;而真实的Cas9蛋白,在结合sgRNA后形成的是一个具有四重构象门控的动态分…
把 Cas9 比作"分子剪刀"只描述了功能结果,遮蔽了其本质:它是一台由 RNA 编程的分子机器。结构生物学是打开这台机器内部的黑箱的唯一途径。2014 年,Jinek 团队用 X 射线晶体学解出 SpCas9-sgRNA 复合物的 apo 结构(分辨率约 2.6 Å),揭示了两个不对称的叶状结构;同年至 2015 年,Nishimasu 等进一步解析了结合靶 DNA 的三元复合物结构,PAM 识别、R-loop 与切割活性位点的空间关系由此变得清晰。冷冻电镜(cryo-EM)随后补齐了动态构象的拼图,让"四重构象门控"成为可检验的假说。
SpCas9 全长 1368 个氨基酸,分子量约 160 kDa,分为两大叶:识别叶(REC lobe)与核酸酶叶(NUC lobe)。
| 结构域 | 氨基酸区间 | 主要功能 |
|---|---|---|
| 桥螺旋 | 约 60–90 | 连接 REC 与 NUC 叶,传递 sgRNA 信号 |
| REC1 | 约 94–402 | 识别 gRNA:DNA 杂交体,感应 R-loop |
| REC2 | 约 402–500 | 参与杂交体识别的辅助模块 |
| REC3 | 约 500–700 | 结构重排,为 HNH 激活做准备 |
| HNH | 约 775–855 | 切割模板链(target strand) |
| RuvC-I/II/III | 多个不连续区段 | 三个亚域聚合成一个活性位点,切割非模板链 |
| PI | 约 1099–1368 | PAM 识别域,读取 NGG |
关键的空间逻辑是:HNH 与 RuvC 各自负责一条链,且它们必须协同才能完成双链切割。单独失活 HNH(如 D10A 突变)得到 nickase(nCas9),只切一条链;两个活性位点都失活(D10A + H840A)得到 dCas9,完全丧失切割能力但仍能结合 DNA——这一改造是第4章碱基编辑与 CRISPRi/a 的底盘。
结构域信息最适合做成机器可读的数据结构,下面的 python 把每个结构域映射为区间,并支持查询任意残基落在哪个结构域,方便你在阅读文献时快速定位突变位点。
# SpCas9 结构域区间(参考 PDB 注释的常用划分) DOMAINS = [ ("Bridge_helix", 60, 90), ("REC1", 94, 402), ("REC2", 402, 500), ("REC3", 500, 700), ("HNH", 775, 855), ("RuvC", 1, 60), # RuvC-I 位于 N 端 ("RuvC-II", 855, 1000), ("RuvC-III", 1000, 1099), ("PI", 1099, 1368), ] def locate(residue: int) -> list: """返回残基所属的全部结构域名称""" return [name for name, lo, hi in DOMAINS if lo <= residue <= hi] # 关键工程位点 for r in [10, 840, 1333]: print("残基", r, "->", locate(r))
运行结果会显示:残基 10 属于 RuvC-I(D10A 即破坏 RuvC 活性),残基 840 属于 HNH(H840A 即破坏 HNH 活性),残基 1333 位于 PI 域(该区突变可改变 PAM 偏好)。
把"看结构"当作理解 Cas 蛋白的起点时,需要先分清两种主流手段的适用边界,因为它们给出的信息维度不同。X 射线晶体学要求蛋白结晶,能给出接近原子分辨率的静态坐标,适合确定活性位点与底物的精确接触;冷冻电镜无需结晶,能直接拍摄溶液中的复合物,更适合捕捉 R-loop、HNH 翻转等动态构象。实际研究中两者互补:先用晶体结构确定静态骨架,再用 cryo-EM 与单分子 FRET 追踪构象变化。
| 手段 | 分辨率 | 状态 | 典型贡献 |
|---|---|---|---|
| X 射线晶体学 | 1.5–3.5 Å | 结晶态 | 活性位点、PAM 接触原子细节 |
| 冷冻电镜 | 2.5–4.5 Å | 溶液态 | 构象多样性、R-loop 结构 |
| 单分子 FRET | 时间分辨 | 动态过程 | HNH 翻转速率、杂交进程 |
| 突变-功能分析 | 无直接结构 | 功能验证 | 结构假说的因果检验 |
以 HNH 翻转为例:晶体结构只给出翻转前后的两个端点态,真正证明"翻转是 R-loop 驱动的"靠的是 cryo-EM 捕获的中间态与 FRET 记录的动力学曲线。因此,阅读结构论文时应始终问一句:这个结论是静态坐标、动态构象还是功能突变推出来的?三种证据的可检验强度并不相同。
Cas 蛋白按效应复合物划分为两大类:Class 1 多亚基(I、III、IV 型),Class 2 单蛋白(II、V、VI 型)。工程化主流几乎全部集中在 Class 2,因为它只需一个效应蛋白,包装与递送都更简单。
| 系统 | 类型 | 靶标 | PAM/靶向规则 | 切割方式 |
|---|---|---|---|---|
| SpCas9 | II | DNA | NGG(3′ 端) | 平末端,双活性位点 |
| Cas12a | V | DNA | TTTV(5′ 端) | 交错切口,单 RuvC |
| Cas13 | VI | RNA | PFS 宽松 | 单 HEPN 活性位点 |
| CasΦ | V | DNA | 5′ 端 TBN | 小型化单蛋白 |
| Cas12f | V | DNA | 5′ 端基序 | 约 400–700 aa 微型酶 |
Cas12a 只依赖一个 RuvC 活性位点,却能依次切开两条链,且其 crRNA 成熟由自身完成(不需要 Cas6/tracrRNA),递送负担更轻。CasΦ 与 Cas12f 的尺寸约为 Cas9 的一半甚至三分之一,为 AAV 等容量受限载体提供了可能——这一点与第5章递送约束直接呼应。
结构生物学不只是"看",更是"设计"的输入。高保真变体 SpCas9-HF1 在 REC 域引入四个突变(N497A、R661A、Q695A、Q926A),通过削弱非特异性接触降低脱靶;eSpCas9 则在 REC 域改造以限制 HNH 的不当激活。这些变体都建立在"识别叶如何感应杂交体"的结构假说之上。同理,超小型 Cas 的挖掘依赖对 PAM 相互作用的精确理解,因为尺寸缩小必须以 PAM 宽容性或特定性的可接受为代价。可以说,第4章每种新编辑器背后,都有一张结构坐标图在支撑。

⚠️ 常见坑:只记结论不记适用边界——HNH 翻转的前提是 R-loop 稳定,在靶标序列 GC 过低或 PAM 识别受阻时,即使结构完整也不会切割。
💡 关键直觉:2.1 Cas蛋白的结构生物学 应能对应至少一项可复现实验或算例——结构域区间查询代码就是可复现算例。