4.1 描述符分类体系:从原子计数到拓扑指数 本节摘要:分子描述符是把结构折算成数字的函数——从最朴素的原子计数到考虑三维形状的几何指数。本节按维度整理这个大家族,重点讲透理化五件套(分子量、脂水系数、极性表面积、氢键供受体数)的计算口径与类药五规则判读,并用一次批量体检案例演示描述符的看家用途:在几秒内告诉一批分子谁像药、谁有问题。 第4章开张,先立语义坐标。描述符是化学信息学的体检报告:每个数字都有明确含义,人能直接判读,模型能直接食用。第2章的分子图在此被逐项"验血",第6章建模吃的特征,多半就从这里出。 先把"分子数字档案"摊开 描述符按计算时用了多少结构信息分维度,维度越高信息越丰富,成本与构象依赖也越高。
本节摘要:分子描述符是把结构折算成数字的函数——从最朴素的原子计数到考虑三维形状的几何指数。本节按维度整理这个大家族,重点讲透理化五件套(分子量、脂水系数、极性表面积、氢键供受体数)的计算口径与类药五规则判读,并用一次批量体检案例演示描述符的看家用途:在几秒内告诉一批分子谁像药、谁有问题。
第4章开张,先立语义坐标。描述符是化学信息学的体检报告:每个数字都有明确含义,人能直接判读,模型能直接食用。第2章的分子图在此被逐项"验血",第6章建模吃的特征,多半就从这里出。
描述符按计算时用了多少结构信息分维度,维度越高信息越丰富,成本与构象依赖也越高。零维只数原子与键:分子量、原子计数、环数,快到几乎免费,但区分度最弱——同分异构体全军共享一份零维档案。一维数片段:含几个羟基、几个芳香环,本质是结构键的清单化。二维只用连接关系不问坐标:拓扑极性表面积(按片段贡献加总极性原子表面积)、脂水分配系数(Crippen 逐原子贡献加和)、维纳指数(所有原子对距离之和,刻画"分子拉得多开")、Kappa 形状指数(刻画分支程度)。三维吃坐标:分子体积、溶剂可及表面积、WHIM 类对称性指数——信息最细,代价是必须先有可靠构象(2.3 节的伏笔在此兑现)。另有所谓四维描述符,用构象系综整体做统计,柔性信息进一步入账,但只见于专门工具。
| 维度 | 输入 | 代表描述符 | 计算成本 | 构象依赖 |
|---|---|---|---|---|
| 零维 | 原子键计数 | 分子量、重原子数 | 忽略不计 | 无 |
| 一维 | 片段清单 | 官能团计数 | 极低 | 无 |
| 二维 | 连接关系 | TPSA、Crippen 脂水系数、维纳指数 | 低 | 无 |
| 三维 | 三维坐标 | 体积、可及表面积、WHIM | 中 | 有 |
工程上的第一课是按问题选维度:预测口服吸收,二维理化描述符足够;预测与手性靶点的结合,三维躲不开。用贵描述符回答便宜问题,是用激光刀切黄油。

药代动力学的前半程(吸收、分布)由少数理化量主导,业内惯用五件套概括:分子量(MW)、脂水分配系数(logP,分子在正辛醇与水之间的分配倾向)、拓扑极性表面积(TPSA,与跨膜渗透强相关)、氢键供体数(HBD)与受体数(HBA)。类药五规则(Lipinski RO5)给出口服药物的粗筛线:分子量小于五百、logP 小于五、氢键供体不超过五、受体不超过十——违反两条以上者,口服成药性存疑。要强调这是经验线不是物理定律:违反的上市药不少(天然产物重灾区),它的正确用法是"标记注意",而非"直接枪毙"。
背景。项目从虚拟筛选拿到几十个候选分子,药化同事只问一个问题:"这批里哪些值得先做实验?"完整回答要建模与对接,但描述符体检能在几分钟内给出第一轮排序依据。
操作。RDKit 的描述符模块逐分子计算五件套,一口气完成:
from rdkit import Chem from rdkit.Chem import rdMolDescriptors as rd from rdkit.Chem import Crippen, Lipinski mols = [ ("布洛芬", "CC(C)Cc1ccc(cc1)C(C)C(=O)O"), ("阿霉素", "COc1cccc2c1C(=O)c1c(O)c3c(c1O)C[C@](O)(C(=O)CO)C3Oc1ccccc12"), # 天然产物代表 ("蔗糖", "OCC1OC(O)C(O)C(O)C1O"), ] for name, smi in mols: m = Chem.MolFromSmiles(smi) mw = rd.CalcExactMolWt(m) logp = Crippen.MolLogP(m) tpsa = rd.CalcTPSA(m) hbd = Lipinski.NumHDonors(m) hba = Lipinski.NumHAcceptors(m) flags = sum([mw > 500, logp > 5, hbd > 5, hba > 10]) print(f"{name} MW={mw:.0f} logP={logp:.1f} " f"TPSA={tpsa:.0f} 供体{hbd} 受体{hba} 违反{flags} 项")
结果。布洛芬五项全部合规,违反项为零;阿霉素分子量五百上下、受体数十余,违反两项——它是靠转运机制入胞的抗癌药,口服场景本就不适用;蔗糖供受体双双爆表、TPSA 超过三百,典型的高度亲水分子,跨膜无望——它是食物不是药,体检如实报告。
解读。这份输出演示了描述符的正确打开方式:数字直接对物理直觉负责。TPSA 大说明极性表面积大、跨膜难;logP 高说明亲脂、易进膜但溶解度堪忧;供受体数刻画与水的氢键结合能力。判读时永远结合给药途径——五规则只对口服负责,把它错用到吸入、外用或细胞内给药场景,是初学者最常见的误判。另一个隐藏收益是数据质检:某条记录分子量超过两千或为负,多半是结构写法出错,描述符顺带当了质检员。
变式。体检维度可以按项目裁剪:抗生素项目关心极性下限(太亲脂进不了革兰阴性菌外膜),中枢药物项目关心极性上限与 logP 区间(要过血脑屏障),各领域有自己的"五规则"变体。更进一步,把五件套扩展成上百列描述符矩阵再交给模型挑——那是 4.3 节的主场,而描述符的选择艺术也随之升级为特征工程。
五件套之外还有几项常被塞进体检单的结构性质,各有看家本领。芳香环比例(芳香原子占比)关联平面性与非特异性结合:比例过高,分子容易靠平面芳香体系"贴"上各种蛋白表面,虚高的 promiscuity 风险随之而来。可旋转键密度(可旋转键数除以重原子数)是 Veber 规则的连续版,衡量分子骨架的"柔度"。净形式电荷与可电离基团计数预告溶解度与跨膜行为,也是 7.3 节 ADMET 模型的常用输入。结构警报计数(3.2 节的反应性基团清单命中数)严格说是过滤器不是描述符,但放进体检表顺手且直观。这些补充项与五件套共同构成一张十几行的体检表——覆盖了理化空间的主体,计算成本却几乎为零,是任何库分析的标准起步动作。