第 4 章 · 索引卡片房:分子描述符与指纹 章节摘要:图书馆靠卡片索引让百万藏书可查,化学信息学靠描述符与指纹让百万分子可算。本章讲清两套索引体系:描述符把分子折算成有物理含义的数字(分子量、脂水分配系数、拓扑极性表面积),指纹把结构压成定长比特串(MACCS 键、摩根圆环指纹);再补上特征工程的收尾功夫——特征选择与降维。三者是把"结构"翻译成"可计算特征"的全部桥梁,第5章的相似检索与第6章的建模都在这批特征上展开。 学习目标 读完本章,你应当能够: 按维度(零维到三维)给常见描述符归类,说出每类的计算成本与信息含量; 用 RDKit 一次算出理化五件套(分子量、脂水系数、极性表面积、氢键供体与受体数); 用类药五规则 Screening 一批分子,解释每条违反意味着什么;
章节摘要:图书馆靠卡片索引让百万藏书可查,化学信息学靠描述符与指纹让百万分子可算。本章讲清两套索引体系:描述符把分子折算成有物理含义的数字(分子量、脂水分配系数、拓扑极性表面积),指纹把结构压成定长比特串(MACCS 键、摩根圆环指纹);再补上特征工程的收尾功夫——特征选择与降维。三者是把"结构"翻译成"可计算特征"的全部桥梁,第5章的相似检索与第6章的建模都在这批特征上展开。
读完本章,你应当能够:
描述符回答"分子像什么样",指纹回答"分子和谁像"——一个是体检报告,一个是面容特征。
两套索引的分工:描述符是有语义的物理量,少数几个就能刻画药代动力学轮廓,适合当模型的输入特征与分子的体检指标;指纹是无语义的比特串,靠海量位信息支持亚秒级的相似比较,适合当检索的钥匙。特征工程是两者的后勤:描述符矩阵动辄上百列,冗余与噪声并存,不清理就喂给模型,等于把没归档的卡片堆塞进检索柜。
4.1 描述符分类体系:从原子计数到拓扑指数——按维度整理描述符大家族;重点拆解理化学五件套的计算口径与类药五规则的判读逻辑;用一个批量体检案例演示描述符的第一用途:快速筛掉"不像药"与"不可能"的分子。
4.2 分子指纹:把结构压成比特串——键式指纹与圆环指纹两条技术路线;摩根指纹的逐层哈希机制、折叠与碰撞;"追查一个比特位"的调试案例让指纹从黑箱变玻璃箱。
4.3 特征选择与降维——为什么描述符矩阵必须瘦身;过滤法、包裹法、嵌入法三条选择路线的取舍;主成分分析画出化学空间图,比较两个库的重叠与空白。
三节是"体检报告、面容特征、档案整理"的关系:4.1 的描述符有明确语义,是模型的输入与人的判读对象;4.2 的指纹牺牲语义换取比较速度,是检索的燃料;4.3 的特征工程横跨两者——无论喂给模型的是描述符还是指纹衍生特征,冗余处理与可视化检查都逃不掉。4.1 在前是因为它的语义坐标系能帮你看懂 4.3 的降维结果:主成分没语义时,回到描述符去找解释。
4.1 描述符 4.2 指纹 4.3 特征工程 ┌────────────┐ ┌────────────┐ ┌────────────┐ │ 语义数字档案 │ │ 无语义比特串 │ │ 瘦身与作图 │ │ 理化五件套 │ │ 圆环哈希 │ │ 主成分空间 │ └─────┬──────┘ └─────┬──────┘ └─────┬──────┘ │ 体检指标 │ 检索钥匙 │ ▼ ▼ ▼ 第6章建模输入 第5章相似检索 两者的后勤保障
本章需要第2章的分子图概念(指纹在图上计算)与第3章的干净数据(脏数据算出的描述符全是白算)。数学上只需要平均值、方差与一点线性代数常识,主成分分析会从"换角度看数据"的角度讲清直觉。
往后的路标:4.1 的理化学五件套将在 7.3 节的类药性过滤里再当主角;4.2 的指纹是第5章每一节的地基;4.3 的主成分化学空间图会在第5章多样性分析中升级成正式工具。本章的卡片房立起来之后,图书馆才真正"可检索"。