第 6 章 · 荐书引擎:QSAR 与 QSPR 建模 章节摘要:检索只能回答"像不像",建模才能回答"多强"。本章把 QSAR(定量结构-活性关系)与 QSPR(定量结构-性质关系)的完整工作流走一遍:从带标签数据出发,经描述符与数据划分,到模型训练、严格验证与适用域圈定。本章的两条主线分别是方法阶梯(从汉施方程到三维场方法再到机器学习)与验证纪律(没有 Y-随机化与适用域的模型不配进项目会议)。学完本章,你能独立建一个经得起质询的活性预测模型。 学习目标 读完本章,你应当能够: 说清 QSAR 四要素(数据、描述符、算法、验证)与一条龙工作流的先后依赖; 解释汉施方程三项参数(疏水、电子、立体)的化学含义及其历史地位;
章节摘要:检索只能回答"像不像",建模才能回答"多强"。本章把 QSAR(定量结构-活性关系)与 QSPR(定量结构-性质关系)的完整工作流走一遍:从带标签数据出发,经描述符与数据划分,到模型训练、严格验证与适用域圈定。本章的两条主线分别是方法阶梯(从汉施方程到三维场方法再到机器学习)与验证纪律(没有 Y-随机化与适用域的模型不配进项目会议)。学完本章,你能独立建一个经得起质询的活性预测模型。
读完本章,你应当能够:
模型的价值不在训练集分数,而在它敢不敢对域外分子说"我不知道"。
建模工作流是一个状态循环而非单向流水线:数据处于什么状态(第3章)、特征如何表示(第4章)、划分怎么设计(第5章的聚类派上用场),共同决定模型上限;验证与适用域则决定这个模型能不能被信任、被谁使用。方法在阶梯上攀升——汉施方程只用三项理化参数,机器学习吞下上百列描述符,图神经网络(第8章)甚至不要描述符——但验证纪律对每一层方法一视同仁。
6.1 建模工作流与经典方法——从汉施方程的三参数讲到 CoMFA 的三维场方法,再落到机器学习阶梯;一个 EGFR 类靶点的最小可运行 QSAR 案例,含真实量感的指标判读(RMSE 零点九个对数单位意味着什么)。
6.2 模型验证、适用域与 Y-随机化——为什么随机划分会撒谎;骨架划分与交叉验证的正确姿势;Y-随机化怎么识破偶然相关;适用域的相似度圈定法。以"模型答辩三连问"案例收尾,交付一份诚实的模型说明卡。
两节是"造引擎"与"验引擎"的关系:6.1 负责把模型造出来,6.2 负责把它拷问清楚。顺序不可颠倒——验证意识要在建模之前就位:划分策略在训练前定死(不能看过测试集再决定怎么切),适用域在应用前圈好(不能先看预测结果再挑着信)。两节合起来是本章对行业的核心承诺:一个诚实的模型,加一份它自己知道自己不能干什么的使用说明。
6.1 造引擎 6.2 验引擎 ┌─────────────────┐ ┌─────────────────────┐ │ 数据 → 特征 → 划分 │ │ 骨架划分防抄袭 │ │ 汉施 → 场方法 → 机器学习 │ │ Y 随机化防偶然 │ │ 最小可运行案例 │ │ 适用域防越界 │ └────────┬────────┘ └──────────┬──────────┘ └──────────┬─────────────────────┘ ▼ 第7章:引擎装上筛选流水线开始荐书
本章需要第3章的干净活性数据、第4章的描述符计算、第5章的聚类划分思想;统计上需要回归与相关系数的常识,交叉验证与 Y-随机化都会从零讲起。工具在 RDKit 之外引入 scikit-learn,仍是开源生态标配。
往后的路标:本章的模型直接是 7.1 节基于配体的虚拟筛选的排序引擎;验证纪律(尤其适用域)是 10.2 节行业最佳实践的核心条款;第8章的深度模型改变的只是方法层,验证与适用域的纪律原封不动地继承。