5.2 分子侧工具箱:对接、模拟与化学数据库 本节摘要:分子侧工具按"精度换代价"排成三级:对接(快而糙,管排序)、分子动力学(中等代价,看动态)、自由能计算(贵而准,管决赛);化学数据库按用途分三类:实体可购库、生物活性档案、虚拟可合成库。本节讲三级模拟与三类库的选型逻辑,以及把 3.2、3.3 节方法落到具体工具的路径。 精度的三级台阶 第 3 章讲方法时回避了一个现实问题:同一个"评估分子与口袋结合"的任务,工具成本可以差四个数量级。工程选型的本质是把精度花在刀刃上: 层级 | 典型耗时(单分子) | 能回答 | 不能回答 | 在循环中的位置 分子对接 | 秒到分钟级 | 相对排序、姿态假设 | 绝对亲和力、动态行为 | 大规模初筛(3.2/3.
本节摘要:分子侧工具按"精度换代价"排成三级:对接(快而糙,管排序)、分子动力学(中等代价,看动态)、自由能计算(贵而准,管决赛);化学数据库按用途分三类:实体可购库、生物活性档案、虚拟可合成库。本节讲三级模拟与三类库的选型逻辑,以及把 3.2、3.3 节方法落到具体工具的路径。
第 3 章讲方法时回避了一个现实问题:同一个"评估分子与口袋结合"的任务,工具成本可以差四个数量级。工程选型的本质是把精度花在刀刃上:
| 层级 | 典型耗时(单分子) | 能回答 | 不能回答 | 在循环中的位置 |
|---|---|---|---|---|
| 分子对接 | 秒到分钟级 | 相对排序、姿态假设 | 绝对亲和力、动态行为 | 大规模初筛(3.2/3.3 节) |
| 分子动力学模拟 | 小时到天级(含轨迹分析) | 口袋开合、水路、结合稳定性 | 精确能量差(采样有限) | 对决赛分子的机制核验 |
| 自由能微扰计算 | 天级,且需多状态 | 同系列分子的相对亲和力差 | 跨骨架的绝对比较 | 决赛圈优化的最终裁决 |
三级不是替代关系,是漏斗:对接从十万分子里挑出百个;动力学挑出的问题分子(口袋在模拟中"吐出"配体)降级处理;自由能计算对最后几个候选系列的类似物做精算——一个氢换成氟,亲和力升降几何,这一步的答案直接指导最后一轮合成。开源与商业工具在三级都有成熟选项:开源对接引擎是行业标准级的免费选择,商业套装强在集成与可视化,分子模拟领域开源生态同样强劲(第 8 章分子动力学教程文集的常客)。
一次三级联用会话(决赛圈项目): 背景:两个系列进入决赛(各 6 个类似物),预算只够再合成 4 个 对接(半小时):两系列全部姿态正常,无冲突 → 都保留 动力学(两天):系列 A 的配体在两条轨迹中滑出口袋, 系列 B 稳定 → A 系列风险降级 自由能微扰(四天):B 系列内计算相对结合自由能, 预测 B-3 比 B-1 强 1.1 千卡每摩尔(约一个数量级), B-5 与 B-1 相当(差 0.2 千卡,在误差内) 决策:合成 B-3(预测最优)+ B-5(结构差异代表)+ B-1(基准) + A 系列一个突变友好变体(对冲) 备注:自由能微扰的结果是"同系列相对值",跨系列的 A vs B 之争要靠实验,不能拿计算值硬比。

实体可购库回答"世界上已经有什么分子能买":商业化聚合目录收录亿级化合物,每条记录链接到供应商。虚拟筛选命中后第一动作是查它——能买的绝不自合成,这是最简单也最常被忽略的省钱纪律。生物活性档案回答"什么分子对什么靶点测过多强":公共活性数据库收录数千万条测定记录,是配体设计(3.3 节)与机器学习的训练粮仓;用它的最大纪律是清洗——不同实验室、不同测定体系的活性值混在一起,不归一化就建模等于自我投毒。虚拟库回答"还能造出什么":按已知反应规则把 building block 组合枚举,可到千亿级规模,每条附合成路线评估——它把 3.4 节"从头设计"的可合成性约束前置到了库的生成规则里。
分子侧开源生态成熟度很高:开源对接引擎的效果在基准测试中与商业套件互有胜负;开源化学信息学库(结构处理、描述符、指纹的计算底座)是几乎所有自建流程的地基;动力学模拟的开源软件包是学术界标准。商业套装的价值集中在集成体验、可视化与合规文档(在申报场景有价值,见第 6 章)。选型账本三条:团队工程能力强、流程自建,开源为主;团队小、要快速起量,商业套装买时间;申报导向的项目,商业工具的验证文档可以省下合规解释成本。
⚠️ 常见坑:跨体系比较对接打分。不同软件、不同参数甚至不同蛋白 preparations 的打分没有可比性,把文献里的打分与自测打分直接排一张表,是初筛阶段最典型的假精确。
💡 关键直觉:分子侧工具箱的主旋律是"分级花钱"——对接是望远镜,动力学是显微镜,自由能是游标卡尺,一件仪器干一件仪器的活。
虚拟筛选该筛多大的库? 库的大小不是美德,与验证能力匹配才是。经验公式:把"能买能合成的验证容量"(比如每轮一百个分子)乘以"预期命中率"(虚拟筛选命中常在百分之几到百分之十几)——你的漏斗出口宽度决定了进口宽度的意义。亿级虚拟库筛出十万个候选却只能测一百个,等于漏斗倒过来用。正确姿势是先用多样性算法把候选浓缩到可验证量级,让每一张合成订单都带着明确假设。
动力学模拟需要跑多长? 取决于问题:看结合姿态稳定性,百纳秒级常够;看缓慢构象变化(别构口袋开合),微秒级起步。更重要的纪律是重复轨迹——单条轨迹的结论在统计学上近乎轶事,至少三五条独立轨迹看结论是否可重复。算力预算固定的项目,"多条短轨迹"几乎总是比"一条长轨迹"更划算。
结构预测的模型能替代共晶吗? 在"排优先级"层面能(3.2 节已定位),在"设计决策"层面谨慎。可行的中间路线:用预测结构做初步对接与漏斗设计,一旦系列进入优化期,尽早补一个实验结构校准关键残基的侧链与结合水——预测结构的系统误差(比如口袋略微偏大)会把整个系列往错误方向优化,实测结构是纠偏的锚点。
工具链要不要上云? 分子侧的计算负载高度突发(虚拟筛选与自由能计算的峰值可以是日常的百倍),弹性资源对峰值友好;但结构文件与化合物库常涉及保密与合规(6.3 节),跨境数据流动要过法务。折衷与 5.1 节品种侧同构:敏感数据与日常任务本地跑,可匿名化的批量计算(库筛、参数扫描)按需上云——关键是把任务拆分的边界设计好,别让每一次弹性扩容都要重新谈一次合规。
两侧工具箱都齐了,最后一环是把它们与湿实验咬合成闭环——下一节讲 DMTA 系统与 AI 框架的适配层。