3.4 从头设计与 ADMET 双闸:生成新骨架并把关出口


文档摘要

3.4 从头设计与 ADMET 双闸:生成新骨架并把关出口 本节摘要:从头设计(De Novo)不依赖库里的分子,直接按规格生成新结构;它解开"库不够用"的困境,也把 ADMET(吸收、分布、代谢、排泄、毒性)从"后期问题"提前为生成约束。本节讲多目标并行优化的逻辑、ADMET 五个科目各自的工程含义、类药规则与结构警示的落地检查,以及可合成性这道常被遗忘的闸。 库的尽头 虚拟筛选再高效,也只能在"已经存在的分子"里挑——类药化学空间的可枚举部分与理论化学空间相比仍是很小的角落。当项目需要避开竞品专利、或家族靶点的已知骨架集体翻车(同一毒性机制)时,出路只有一条:造库里没有的分子。从头设计的两条路线: 结构驱动生长:从 3.

3.4 从头设计与 ADMET 双闸:生成新骨架并把关出口

本节摘要:从头设计(De Novo)不依赖库里的分子,直接按规格生成新结构;它解开"库不够用"的困境,也把 ADMET(吸收、分布、代谢、排泄、毒性)从"后期问题"提前为生成约束。本节讲多目标并行优化的逻辑、ADMET 五个科目各自的工程含义、类药规则与结构警示的落地检查,以及可合成性这道常被遗忘的闸。

库的尽头

虚拟筛选再高效,也只能在"已经存在的分子"里挑——类药化学空间的可枚举部分与理论化学空间相比仍是很小的角落。当项目需要避开竞品专利、或家族靶点的已知骨架集体翻车(同一毒性机制)时,出路只有一条:造库里没有的分子。从头设计的两条路线:

  • 结构驱动生长:从 3.2 节的口袋出发,算法在热点位置逐原子、逐片段地生长分子,像在锁孔里灌蜡成型。优点是每一步都有结构解释,缺点是容易长出合成化学家摇头的结构。
  • 生成模型驱动:训练神经网络学习分子的分布,然后按"目标性质"为条件采样新结构(变分自编码器、强化学习、大模型式序列生成——机制留到第 4 章展开)。优点是能跳出局部骨架,缺点是同样面临可合成性问题,且需要严格的化学合法性过滤(价键、环张力、稳定性)。

无论哪条路线,从头设计的输出都要过同样的三重过滤:化学合法性、可合成性、性质达标。第三项就是本节的另一半主角——ADMET。

串行的教训与并行的原则

历史上大量项目按"先把活性做到最强,再查毒性"的次序推进,结局高度雷同:活性纳摩尔级的明星分子,在肝毒性或心脏通道上暴雷,整个系列推倒重来——因为成药性缺陷长在骨架上,优化晚期才发现等于宣布骨架死刑。现代实践的转折点就在这里:活性、选择性、ADMET、可合成性作为多目标并行优化,从第一个分子起就同时打分。代价是每一步的优化空间变小(顾此失彼是常态),收益是不会在终点前才发现死路。

图:串行流程与并行流程的对比

图:串行流程与并行流程的对比

ADMET 五科目速览

ADMET 是五个科目的合称,每个科目都有"便宜的计算预测 → 中等成本的体外实验 → 昂贵的体内实验"三级证据链:

科目 关键问题 常用早期读数 典型雷区
吸收(A) 口服能否进血 透膜性预测、溶解度 高亲脂低溶解的"砖头分子"
分布(D) 去哪、待多久 血浆蛋白结合率预测 高蛋白结合拉高表观剂量
代谢(M) 谁来拆、拆成什么 细胞色素酶抑制与诱导预测 抑制关键代谢酶引发药物相互作用
排泄(E) 怎么走 清除率预测 高清除导致一天三服依从性差
毒性(T) 伤哪里 结构警示、心脏通道筛选 肝毒性、心脏复极延长

其中"代谢"科目值得多说一句:细胞色素 P450 酶系是体内的化学焚烧炉,分子若强烈抑制某个 P450,同服的其他药物代谢就会被拖慢,血药浓度异常抬升——药物相互作用是上市后撤药的高频原因,也因此成为早期筛选的固定动作。

落地检查:一次类药与警示会话

第一道闸便宜到可以在生成循环里每步都跑。拿一个假设的从头设计产物做检查:

候选分子 G-17(生成模型输出,骨架为全新并环体系) 分子量 437 ✓(≤ 500) 油水分配对数 3.4 ✓(≤ 5,透膜与溶解的折中区间) 氢键供体 2 ✓(≤ 5) 氢键受体 7 ✓(≤ 10) 可旋转键 6 ✓(柔性适中,熵罚可控) 结构警示扫描: 含一个芳基肼片段 ✗ —— 已知警示结构,与基因毒性风险相关 处置:不合成。将警示片段写入生成模型的负反馈, 要求下一批采样避开该子结构;G-17 的其他参数保留为参照。 结论:五规则全过不等于安全——结构警示是独立的一票否决项, 两个检查必须都跑。

会话体现的正是"出生条件"原则:警示结构不进合成队列,而且它的存在本身回灌给生成条件,让淘汰变成学习。这与 2.3 节"负样本进模型"是同一件事的两面——试验圃的两条线,都在把失败变成约束条件的更新。

可合成性:最后一道常被遗忘的闸

生成模型最尴尬的输出是"纸面完美、化学家造不出来"的分子。可合成性评估包括:逆合成路线是否存在、步数几步、原料是否可购、收率风险多大。实践中用"合成可及性打分"先粗筛,再由化学家复核顶层分子。一个诚实的项目账本是:每合成一个分子的预算固定时,可合成性筛选直接决定循环的转速——八个步骤、低收率的分子,等于烧掉三个一步分子的预算。

⚠️ 常见坑:拿计算预测当免检通行证。ADMET 预测模型的适用域有限,进入候选阶段的分子必须补体外实验(透膜、微稳定性、通道筛选),预测只是排队优先级。

💡 关键直觉:从头设计把"分子"变成了可编程对象——规格写成约束,生成交付候选,闸门保证质量。第 4 章的生成模型与强化学习,就是这套编程范式的引擎升级。

常见追问

生成模型造的分子会不会 infringe 专利? 会,这个风险真实存在:模型在海量专利化合物的数据上训练,采样时可能生成落进他人权利要求范围的结构(权利要求常覆盖整个类似物系列,不只登记的分子)。对策是流程化的:生成输出的必经一步是专利边界检查(6.3 节 FTA 的自动化版),命中权利要求范围的分子直接过滤或标注。更主动的做法是把"绕开权利要求"写进奖励(与训练集相似度惩罚同构)——把专利约束当作设计空间的一部分,而不是事后警报。

ADMET 优化到什么程度算"够"? 门槛是相对的,与给药途径和适应症挂钩:静脉注射的制剂豁免比口服宽(不要求透膜与口服稳定性);肿瘤药物的治疗窗口容忍度常高于慢病药物(患者获益权重高);罕见病用药的标准又会因人群小而调整。工程做法是把"够"翻译成项目规格表——立项时写下每科目的目标区间(比如口服生物利用度大于三成),优化达标即停,不为单科目追求极致而牺牲整体平衡。

失败分子要留多少档案? 越全越好,最低限度三件套:结构(含完整表示)、测试条件、失败原因分类(活性、毒性、可合成性、稳定性)。这些负样本是 QSAR 的边界数据(3.3 节)、生成奖励的校正集(4.4 节)、也是专利规避的先验(别人踩过的坑就是你的自由运营空间的地图)——5.3 节说失败记录是 DMTA 最难执行的纪律,它的价值在这里全部兑现。

本节要点回顾

  • 两条生成路线:口袋驱动的逐原子生长(可解释)与生成模型的条件采样(可跳出旧骨架),输出都要过化学合法性过滤。
  • 并行原则:活性、选择性、ADMET、可合成性从第一天同时约束,串行流程的终点暴雷不可挽回。
  • 五科目证据链:每科目都有计算-体外-体内三级,预测定优先级,实验定结论。
  • 类药与警示:五规则是便宜的初筛,结构警示独立一票否决,两者都过才排队。
  • 可合成性即转速:合成预算固定时,路线长度与收率直接决定循环每轮的候选容量。

分子线的设计拍至此闭环。但四道工序每天都在产生数据——结构、活性、性质、失败。下一章讲这些数据如何变成组织的预测引擎。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U