3.3 基于配体的设计与虚拟筛选:从旧分子找新线索


文档摘要

3.3 基于配体的设计与虚拟筛选:从旧分子找新线索 本节摘要:当靶点结构缺失或不可靠时,已知的活性分子本身就是图纸。本节讲药效团抽象(活性分子共享的相互作用模式)、QSAR 的建模纪律(训练测试分离、适用域、交叉验证)、相似性检索的边界,以及千万级虚拟库的分级筛选流水线——每一级都在淘汰不同的东西。 库房里的旧分子是资产 接本章主线:项目组的激酶家族化合物档案里,躺着上百个测过活性的旧分子——有的活性好但毒性差,有的活性弱但骨架新颖。没有共晶结构时,这批数据就是设计拍的全部依据。基于配体的设计(LBDD)的哲学:活性分子之所以有活性,是因为它们共享某些决定结合的特征;把这些特征提出来,就得到了设计的坐标系。

3.3 基于配体的设计与虚拟筛选:从旧分子找新线索

本节摘要:当靶点结构缺失或不可靠时,已知的活性分子本身就是图纸。本节讲药效团抽象(活性分子共享的相互作用模式)、QSAR 的建模纪律(训练测试分离、适用域、交叉验证)、相似性检索的边界,以及千万级虚拟库的分级筛选流水线——每一级都在淘汰不同的东西。

库房里的旧分子是资产

接本章主线:项目组的激酶家族化合物档案里,躺着上百个测过活性的旧分子——有的活性好但毒性差,有的活性弱但骨架新颖。没有共晶结构时,这批数据就是设计拍的全部依据。基于配体的设计(LBDD)的哲学:活性分子之所以有活性,是因为它们共享某些决定结合的特征;把这些特征提出来,就得到了设计的坐标系。

第一种抽象是药效团:一组空间排列的特征点——氢键供体、氢键受体、带电基团、疏水中心——加上它们之间的距离约束。把多个已知活性分子叠合,找出它们共同满足的最小特征集合,就得到药效团模型。它像一个三维的锁孔模板:新分子若能把特征点"对上",就有活性潜力。药效团的价值在于可解释——每个特征对应一个物理相互作用,化学家能直接读懂。

第二种抽象是QSAR(定量构效关系):把分子转成描述符向量(1.4 节的第二张数据卡),用统计模型学习"描述符 → 活性数值"的映射。它输出的是一个数字(预测活性),价值在于排序与优化方向。

QSAR 的建模纪律

QSAR 是被玩坏过很多次的工具,坏法几乎都一样:训练集上拟合得漂亮,上了新分子一塌糊涂。纪律五条:

一次规范的 QSAR 会话(示例数值): 数据: 96 个同系列分子,活性 pIC50 范围 4.2 – 8.1(负对数) 描述符: 42 个(拓扑、电性、疏水性) 切分: 72 训练 / 24 测试(按骨架分层,不让同骨架跨集) 交叉验证(训练集内五折): 交叉验证 R²(q²) = 0.61 ← 诚实指标 外部测试: 预测 R² = 0.57, 平均误差 0.48 个对数单位 适用域检查: 新分子与训练集描述符空间的距离在阈值内才出预测 红线对照: 只报训练 R² = 0.93、不报 q² → 过拟合,不可信 随机切分让近似分子同跨两集 → 泄漏,测试虚高 给适用域外的分子硬出预测 → 外推,等于掷骰子

q² 与外部测试 R² 的差值就是"水分"。适用域概念尤其重要:模型只在训练分布附近有效,一个与训练集骨架完全无关的新分子,预测值没有意义——这与 2.3 节基因组选择"跨群体预测衰减"是同一条定律的化学版:模型不预言它没见过的世界

图:分级虚拟筛选流水线

图:分级虚拟筛选流水线

相似性:便宜但要有边界

最简单的配体方法是不建模:拿一个已知活性分子当探针,用分子指纹在全库算相似度,取最像的一批。它便宜、快、不依赖任何假设,是"库里可能已有类似物"这类问题的首选。边界也清楚:相似性检索天然收敛于已知骨架——你找到的永远是"探针分子的近亲",跳不出化学型。要新骨架,靠药效团(保留相互作用模式、放开具体骨架)或下一节的从头生成。品种线的类比很有意思:相似性检索像在骨干种质里选(快但多样性有限),药效团像按性状规格在全球种质库里搜(慢但可能带来全新来源)——第 1.2 节的多样性逻辑在化学库里同样成立。

虚拟筛选的账本与命中率

把流水线放进第 1.1 节的账本:虚拟筛选拍省的是合成拍的无效分子。高质量虚拟筛选把实验命中率(测试分子中有活性的比例)从随机盲筛的百分之零点几提到百分之几到几十,意味着同样的合成预算能覆盖更多活性机会。但命中率不是唯一指标——骨架多样性同样重要:全库高打分分子若都是同一家族的变体,等于把鸡蛋放进一个化学型的篮子里,后期毒性一旦集中爆发,整个系列报废。所以流水线最后一站是"顶层加多样性代表"的组合挑选,工程上这称为集合选择问题。

⚠️ 常见坑:训练集混入"仅活性分子"。活性数据值钱,但负样本同样值钱——模型要学的是区分,只有正例的模型学不会边界。档案里测过没活性的分子,一条都不能丢。

💡 关键直觉:LBDD 的本质是"从历史数据里学规律",它的可信度上限等于数据质量——混杂不同测定体系的活性值、不加清洗地混用单位,是模型失灵的头号原因,先洗数据再建模。

常见追问

没有已知活性分子时怎么办? LBDD 的原料是活性数据,冷启动的项目有三条路:先跑基于结构的方法(3.2 节,需要结构或可靠模型);用近亲靶点的活性数据做迁移(家族保守口袋的抑制剂常可作起点,再优化选择性);或做一次小规模多样性筛选(几百到几千个代表分子)人为制造"已知活性"——数据是方法的前提,没有就先花小钱造一点。

QSAR 模型多久重训一次? 触发式而非日历式:新增一批实测数据(尤其覆盖了原适用域外的新骨架)时重训;发现预测系统性偏差时重训(比如某新系列实测普遍低于预测两倍以上,说明模型在该区域失真)。每次重训保留旧模型做对照——新模型必须在保留测试集上赢过旧模型才允许上线,这条纪律防止"越训越差"的倒退悄悄发生。

药效团模型和 QSAR 会打架吗? 会,而且打架是有价值的信号。药效团说"特征点必须对上",QSAR 说"这个描述符与活性正相关",两者对同一分子给出相反判断时,通常意味着存在未建模的因素(诱导契合、水分子介导的结合、活性构象差异)。此时最优动作不是投票,而是挑几个分歧分子做实验——分歧点就是新知识的藏身处。

虚拟筛选的产出管理也值得一句提醒:每轮筛选的"命中清单"与"淘汰原因"都要按 5.3 节的轮次登记存档。三个月后没人记得"这批分子为什么没进合成队列",下一轮就会把同样的分子再筛一遍——虚拟筛选的复筛成本虽低,但合成验证的名额被反复占用才是真浪费;一个命中分子被独立提名三次而三次都被淘汰,它自己就是一份值得阅读的失败档案。

本节要点回顾

  • 两种抽象:药效团给出可读的相互作用模板,QSAR 给出可排序的预测值;一个定性一个定量,常配合使用。
  • 五条纪律:分层切分、报 q²、外部测试、适用域、不外推——QSAR 的可信度全在纪律里。
  • 三级漏斗:规则初筛淘汰明显不合格、药效团粗排淘汰特征不符、对接精筛淘汰姿态冲突;数量级逐级坍缩。
  • 多样性挑选:顶层高打分加骨架代表,化学型的篮子风险要用组合选择对冲。
  • 数据卫生:活性档案先统一测定体系与单位,负样本保留入库。

已知分子的世界里捞完了,新骨架从哪里来?下一节让生成模型亲手造分子,再用 ADMET 双闸把守出口。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U