第 3 章 · 馆藏与登记:数据来源与治理 章节摘要:没有馆藏就没有图书馆,没有干净数据就没有化学信息学。本章先带你盘点公共数据版图——PubChem、ChEMBL、ZINC 各管哪一段、如何组合取用;再拆解清洗标准化的标准流水线,让"一锅粥"变成"整齐书架";最后落到 FAIR 原则下的数据治理,回答"数据怎样才能在一年后还被自己和别人用起来"。行业共识是:清洗与治理吃掉实际项目一半以上的工时,这一章是全册最不像算法、却最能决定成败的一章。 学习目标 读完本章,你应当能够: 为给定任务(找活性数据、凑采购库、查已上市药)选出正确的公共数据库并组合使用; 把文献中的活性值统一换算为 pIC50,并说出换算背后的统计学含义;
章节摘要:没有馆藏就没有图书馆,没有干净数据就没有化学信息学。本章先带你盘点公共数据版图——PubChem、ChEMBL、ZINC 各管哪一段、如何组合取用;再拆解清洗标准化的标准流水线,让"一锅粥"变成"整齐书架";最后落到 FAIR 原则下的数据治理,回答"数据怎样才能在一年后还被自己和别人用起来"。行业共识是:清洗与治理吃掉实际项目一半以上的工时,这一章是全册最不像算法、却最能决定成败的一章。
读完本章,你应当能够:
数据质量不是道德口号,而是模型上限:垃圾进,垃圾出,再花哨的模型也救不回来。
公共数据版图按"馆藏性质"分三类:登记库(PubChem 之流,管"有哪些分子")、活性库(ChEMBL、BindingDB,管"哪些分子对这个靶点多强")、可获取库(ZINC,管"哪些分子买得到或合得出")。三类库各答一个问题,项目数据需求往往要三库联查。而无论来源多权威,入库前都要过同一条清洗流水线——公共数据是别人按别人的标准登记的馆藏,直接使用等于不做对账就进货。
3.1 公共数据库生态:PubChem、ChEMBL 与 ZINC——三大馆藏的定位、规模与取用方式;用"为激酶靶点准备建模数据集"的完整案例演示活性数据的检索、换算与合并,顺带认识 DrugBank、BindingDB 等专项馆藏。
3.2 数据清洗与标准化实战——把最常见的脏数据形态逐一定罪,给出六步清洗流水线与可运行代码;用"五千条活性记录的清洗前后对照"案例算清洗的经济账,并讨论反应性警报的正确用法。
3.3 FAIR 原则与化学数据管理——可发现、可访问、可互操作、可复用四原则在化学场景的具体对应物;用一个小组登记规范从零到落地的案例,展示治理如何从口号变成表格与流程。
三节是"进货、验货、立规矩"的关系:3.1 解决数据从哪来,3.2 解决数据怎么变干净,3.3 解决干净状态如何长期保持。依赖是单向的——不懂 3.1 的数据形态,3.2 的清洗无从下手;没有 3.2 的标准状态,3.3 的规范就是空文。反过来,3.3 的规范又会反哺 3.1:自有数据登记得越规范,将来与公共库合并的成本越低。
3.1 进货 3.2 验货 3.3 立规矩 ┌────────────┐ 脏数据 ┌────────────┐ 标准状态 ┌────────────┐ │ 公共库盘点 │ ────────▶ │ 六步清洗线 │ ────────▶ │ FAIR 治理 │ │ 三库联查 │ │ 算经济账 │ │ 登记规范 │ └────────────┘ └────────────┘ └────────────┘ ▲ │ └────────── 规范反哺:自有数据与公共库低成本合并 ──────┘
本章需要第2章的全部能力:解析 SMILES、理解分子图、知道 InChIKey 是什么。不需要统计学——活性值换算的原理会用一句话讲透。工具上,RDKit 之外会用到 pandas 做表格处理,均属常见搭配。
往后的路标:清洗完成的"整齐书架"正是第4章描述符计算的输入,第5章相似检索的语料,第6章建模的训练集。可以说第3章是全册的装卸码头——所有数据都在这里上岸、验关、再分拣出海。