1.2 历史演进与里程碑


文档摘要

1.2 历史演进与里程碑 本节摘要:化学信息学约六十年历史,可分四段:手工索引与规则推理时代(1950–1970s)、结构数据库与商业软件时代(1970–1990s)、开放数据与标准化时代(2000s)、智能模型时代(2010s 至今)。本节沿时间线讲透每个里程碑回应的瓶颈,并用"同一个问题在三个年代的解法"这一案例,让你体感技术跃迁的实感。 上一节给了学科的横切面,这一节补纵切面。历史不是年表背诵材料:你今天用的每个工具——规范化 SMILES、MACCS 键、Tanimoto 系数——都是某个年代某群人面对具体瓶颈给出的答案。知道答案的来路,才不会在新工具的营销话术面前失了判断。 把六十年压成一条时间线 手工索引与规则推理时代(1950s–1970s)。

1.2 历史演进与里程碑

本节摘要:化学信息学约六十年历史,可分四段:手工索引与规则推理时代(1950–1970s)、结构数据库与商业软件时代(1970–1990s)、开放数据与标准化时代(2000s)、智能模型时代(2010s 至今)。本节沿时间线讲透每个里程碑回应的瓶颈,并用"同一个问题在三个年代的解法"这一案例,让你体感技术跃迁的实感。

上一节给了学科的横切面,这一节补纵切面。历史不是年表背诵材料:你今天用的每个工具——规范化 SMILES、MACCS 键、Tanimoto 系数——都是某个年代某群人面对具体瓶颈给出的答案。知道答案的来路,才不会在新工具的营销话术面前失了判断。

把六十年压成一条时间线

手工索引与规则推理时代(1950s–1970s)。起点比计算机普及更早:化学文摘社(CAS)用卡片与索引体系管理以爆炸速度增长的文献,Wiswesser 行式符号(WLN)尝试把结构压成打字机可打的字符串。1957 年,雷伊与基尔希在《科学》上展示用数字计算机检索化学记录,结构检索第一次电动化。1960 年代两座里程碑矗立起来:摩根提出分子图的规范化编号算法——今天所有规范化 SMILES 的直系祖先;斯坦福的 DENDRAL 项目(1965 年前后启动)用规则推理从质谱碎片反推分子结构,被广泛视为人工智能在化学中的第一次落地。同年代末,科里的 LHASA 系统尝试用计算机做逆合成分析——第9章的先声。

结构数据库与商业软件时代(1970s–1990s)。存储与检索成为主线。MDL 公司确立 MOL 连接表格式并开发亚结构检索系统,把"结构当数据"从想法变成产品;MACCS 键指纹在这一时期定型,用一组预定义的结构特征问答把分子编码成比特串。1988 年,温格发表 SMILES 语言——以深度优先遍历分子图、用括号与环闭合数字表达结构,因其好读好写迅速流行;同一年代,Willett 等人系统化了分子相似性系数(Tanimoto 系数从指纹时代起成为相似检索标配)。汉施与藤田的 QSAR 方法(1964 年提出,此后数十年打磨)让"结构性质关系"第一次有了统计范式。这一时代的遗产延续至今:你本地的分子文件十有八九仍是 MOL 或 SDF。

开放数据与标准化时代(2000s)。两大标志。其一是表示标准的统一:IUPAC 联合 NIST 推出 InChI 及其固定长度形态 InChIKey(2005 年前后),第一次给出跨数据库通用的分子"身份证号"。其二是数据的公共化:PubChem(2004 年上线)聚合海量小分子与活性数据,ZINC 提供可直接对接筛选的商业化合物库镜像,ChEMBL(2010 年前后由欧洲生物信息学研究所发布)把几十年文献中的活性数据清洗成结构化表格。开源工具链同期成熟,RDKit 逐渐成为结构处理的事实标准。数据的闸门一开,比较学与验证文化随之兴起——同一份数据,全球实验室应能复现同一个模型。

智能模型时代(2010s 至今)。深度学习涌入:图神经网络直接在分子图上学习表示,分子语言模型把 SMILES 当句子训练,生成模型从"筛选已有"转向"创造未有"。2020 年前后蛋白质结构预测的突破改写了结构生物学与药物设计的接口;生成式模型与自动化实验平台(第10.3节)把学科推向"设计-合成-测试-学习"的闭环。值得注意的是,新范式并未淘汰旧资产:指纹检索仍在工业生产线上跑,QSAR 仍是监管提交的常用语言——新工具叠在旧地基上,而非取而代之。

图 1-2:六十年技术演化时间线

图 1-2:六十年技术演化时间线

四个时代各交付了一句证明,合起来就是学科完整的合法性论证。注意每个时代的核心资产都活着:摩根算法活在规范化 SMILES 里,MACCS 键活在相似性检索里,InChIKey 活在每次跨库对账里。

一个问题,三个年代的解法

背景。把历史压缩成可体感的东西,最好的办法是让同一个问题反复出现。这个问题是化学登记员的日常:"这个分子,我们以前登记过吗?"我们让它在三个年代各发生一次。

操作一:1965 年,卡片室。登记员拿到一个新合成的化合物,先画好结构式,翻结构索引卡:按环系分类卡找到"苯环并噁唑类"抽屉,再逐张比对取代基。熟练登记员处理一条记录要用几十分钟,漏检率取决于当天状态。分子相等性靠的是人眼与图规约——把两张结构式转成同一种画法再比较,转画规则就是当年的"规范化算法",它写在培训手册里,跑在人的脑子里。

操作二:1988 年,工作站。登记员把结构画进分子编辑器,软件存成 MOL 连接表。查询交给亚结构检索引擎:系统用摩根式算法给查询分子图的原子编号,再用图匹配算法在数据库里搜索同构分子。处理一条记录要几秒钟,但数据库只有几十万条,响应可接受。分子相等性靠的是图同构判定——正确但昂贵,大库上做全库精确匹配开始吃力,于是大家退而求其次:先用哈希与分子式粗筛,再做精确图匹配。

操作三:今天,一行代码。同一个问题现在这样解:

from rdkit import Chem from rdkit.Chem import inchi new_mol = Chem.MolFromSmiles("c1ccc2[nH]ccc2c1") # 新化合物的 SMILES key_new = inchi.MolToInchiKey(new_mol) # 生成固定长度身份证号 print(key_new) # UJOBWENBFYLQTO-UHFFFAOYSA-N(吲哚) # 在登记库里查这个键:数据库给 InChIKey 列建普通索引即可 hits = registry_db.query("SELECT reg_id, name FROM compounds WHERE inchikey = ?", (key_new,)) print(hits or "库中无此分子,可登记")

字符串等值查询走数据库索引,亿级记录也是毫秒级。分子相等性靠的是规范化标识符:生成 InChI 时算法已替你完成了互变异构与电荷层面的标准化,比较从"图问题"降级成"字符串问题"。

结果与解读。三代解法,人的角色从执行比较退到提交结构,比较本身从人眼到图匹配再到哈希字符串。效率跃迁的代价是隐性的:今天的登记员不再需要懂图同构,但也因此容易在标识符失灵时(混合物、高分子、未标准化的互变异构)束手无策。工具把难事变简单的同时,也把故障从显性变成隐性——这是学习历史的现实理由。

变式。把问题升级一步:"这个子结构,库里哪些分子包含它?"精确标识符立刻失效(子结构不是完整分子),检索退回图匹配的老路——但可以用指纹做预筛:先排除不可能包含该子结构的分子,再对候选做精确匹配。这个"指纹粗筛加精确确认"的组合拳,正是第4章与第5章要拆解的核心机制。

本节要点回顾

  • 四段主线:规则推理证明化学可计算,结构数据库证明检索可规模化,开放数据证明共享可行,智能模型证明设计可生成。
  • 里程碑即答案:摩根算法答"如何给分子唯一编号",SMILES 答"如何让化学家直接读写结构",InChIKey 答"如何跨库认分子",指纹答"如何快速近似比较"。
  • 新旧叠加而非替换:深度学习时代没有淘汰指纹与 QSAR,生产环境中它们仍是第一道工序与监管语言。
  • 历史的方法论:遇到新工具先问"它回应哪个瓶颈",答案能帮你判断它是真突破还是换皮。
  • 通向下一章:SMILES 是本册出场率最高的角色,第 2.1 节就从它的语法规则开讲。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U