4.1 靶标预测:给每个嫌疑人打分


4.1 靶标预测:给每个嫌疑人打分

本节摘要:靶标预测回答"综合所有档案,这个候选与这桩案子关联多大"。本节先盘点公共数据库这个证据总库,再讲监督与无监督两类打分框架的分工,最后实现一个可运行的加权打分器。它承接第 3 章的加权证据表,把人工审阅升级成全候选遍历;暗线推理与网络排序留到 4.2 与 4.3。

推理环节动手前先备料。本节要解决的是排序问题里最朴素的一层:把散落的档案折算成每个候选的分数——不做花哨的推理,只求打分过程透明、可复核。

打分之前先备料

靶标发现的公共数据资源可以按档案柜分类,做预测之前至少要知道每类柜子里放什么、边界在哪:

  • 蛋白档案:序列与功能注释在 UniProt 一类知识库里;三维结构在 PDB 与结构预测数据库里(第 2 章结构勘查已用过);组织表达在正常组织图谱(GTEx 一类)里。
  • 疾病关联档案:GWAS 目录汇集人群关联位点;策展型疾病基因库收录 OMIM 一类有明确孟德尔遗传证据的基因;DisGeNET 一类整合库把文献与数据库的疾病-基因关联压成带证据数的索引。
  • 药物与化学档案:ChEMBL 一类库收录化合物的活性测量(哪个分子对哪个靶标多少浓度起效),DrugBank 一类库收录已上市药物与其已知靶标——它们既是预测的训练数据,也是"药物证据"的来源。
  • 平台型整合:Open Targets 一类平台把上述各柜按统一口径折分合成,等于把本节要讲的打分逻辑做成了公共服务——先用它的分数起步,再按自己项目的疾病特点重建打分,是常见且稳妥的路线。

备料的纪律只有一条:记录版本与日期。这些库都是活的,同一候选两年前的档案与今天的可能完全不同;不可复核的打分表,在立项评审里等同伪造。

两类打分框架的分工

监督框架适合"有标定答案、要泛化到新候选"的任务:拿一批已知疾病基因做正例、抽样做负例,训练分类器学习"致病基因长什么样"。它的威力在特征泛化——模型可能发现致病基因倾向于特定保守性、表达广度、复合物参与度的组合。它的命门也在这里:正负例的构造本身就是假设(罕见病基因的"样子"未必适用常见病),而且出名基因在文献数据里天然更"显眼",模型容易学会"看出名"而不是"看出致病"。打分框架下的对抗手段是负例分层抽样、按证据类型拆特征、以及永不把文献共现单独当强特征。

无监督框架适合"没有可靠标定、找数据自身结构"的任务:相似度打分是代表——候选与已知疾病基因在序列、结构域、互作伙伴、表达模式上越相似,嫌疑越高("同伙相似律":以前科犯的画像圈新嫌疑人)。它不承诺因果,只承诺"物以类聚"这个朴素先验;在罕见病、新突发疾病这类正例稀缺的场景里,无监督路线常常是唯一可行起点。

两类框架的产出都是分数,拼装方式也一致:多路分数按权重合成总分。下面的演算实现一个透明版打分器——权重表与折分规则全部显式,便于按项目疾病调整。

# 靶标候选打分器:五路特征加权 -> 总分 -> 侦查动作分档 features = { # 遗传 疾病关联 表达特异 孤儿状态 安全线索 # (0-1 分,孤儿=家族冷门成员,安全线索=正常组织低表达) "候选M": [0.90, 0.70, 0.85, 0.40, 0.80], "候选T": [0.55, 0.80, 0.60, 0.30, 0.50], "候选L": [0.40, 0.45, 0.75, 0.60, 0.70], "候选W": [0.25, 0.35, 0.65, 0.20, 0.60], } WEIGHTS = {"遗传": 0.40, "疾病关联": 0.20, "表达特异": 0.20, "孤儿": 0.10, "安全": 0.10} KEYS = list(WEIGHTS) def score_and_triage(weights, threshold=0.60): ranked = [] for name, vals in features.items(): total = sum(v * weights[k] for v, k in zip(vals, KEYS)) action = ("A 高优先侦查" if total >= threshold + 0.1 else "B 常规侦查" if total >= threshold else "C 归档观察") ranked.append((name, round(total, 3), action)) return sorted(ranked, key=lambda r: -r[1]) for row in score_and_triage(WEIGHTS): print(row) # 敏感性检查:把遗传权重压到 0.25、机制特征抬升,看榜首是否换人 ALT = {"遗传": 0.25, "疾病关联": 0.20, "表达特异": 0.30, "孤儿": 0.15, "安全": 0.10} print("\n敏感性检查(权重重排):") for row in score_and_triage(ALT): print(row) # 解读:榜首在两套权重下是否易主,决定了这张榜单敢不敢送进收网。

一个具体场景:新发传染病的冷启动

无监督打分最显示身手的场景是正例几乎为零的案子。新发传染病出现时,病毒蛋白与人体蛋白的互作图谱是唯一新数据,历史档案(哪些宿主基因在既往病毒感染里被反复劫持)可以折成先验分:参与内吞、膜融合、先天免疫的基因历来是病毒高发作案区,这类家族先验先给全体宿主基因打底分;再叠加病毒互作蛋白的伙伴网络与表达匹配(病毒嗜好的组织里这些基因是否表达),分数在几个小时内就能产出第一版嫌疑榜。穷尽精确建模是奢望,冷启动阶段要的是"把有限实验资源指对方向"的粗排序——这也是打分器与后面神经网络排序(4.3)的分工边界:数据多时后者上限更高,数据少时前者的透明与稳健更珍贵。

易错点:把数据可用性当证据强度

打分表里最常见的系统性偏差来自"哪个基因被研究得多"。文献丰度、注释完整度、已知互作数量都随出名程度增长,任何未加处理的特征都会给老面孔加分。纠偏动作有三个层面:特征层面拆开"证据"与"热度"(文献共现数量单独一列,永不与遗传证据混权);样本层面在评估时按研究热度分层报告;产出层面给冷门高分候选标注"证据虽少但无反证",避免排序的复利效应把冷门真凶永远压在榜底。

💡 关键直觉:打分器的产出不是排名,是"侦查资源配置建议"。榜首多配警力,榜尾归档,中段按证据类型分流——它是指令的依据,不是结论本身。

常用档案柜速查

档案柜 内容 在打分器里的角色 使用注意
蛋白知识库 序列、功能注释、家族分类 家族先验、保守性特征 注释有层级,别拿关键词当功能
结构与模型库 实验结构与预测结构 可成药性特征、口袋特征 区分实验与预测来源
正常组织图谱 各组织的表达剖面 表达特异性、安全先验 记住批次与供者构成
疾病关联库 GWAS 位点、孟德尔基因、文献关联 遗传与关联特征 关联强度差异巨大,需分级
活性与药物库 化合物-靶标活性测量、已上市药物靶标 药物证据、训练标注 活性测量质量参差,按实验类型过滤
整合平台 多路证据折分合成的公共服务 起步基准 权重是别人的先验,重大决策自建

这张表本身就是打分设计的路线图:特征从哪几柜取、每柜的噪声长什么样、谁的版本问题最致命。打分器翻车的事故报告里,一半以上能追溯到"把某柜的原始密度当成了特征"——比如拿文献词频当疾病关联强度,拿注释条数当功能重要度。备料的最后一道工序永远是问:这个数字在现实世界里是怎么产生的。

备料的常见疑问

平台整合分数能直接当立项依据吗?

能当起点,不能当依据。平台分数的权重是平台方的通用先验,对具体疾病可能系统性失真(罕见病证据稀薄处的分数几乎由文献热度决定)。正确用法:用平台分数圈定大盘、校对自己的打分器,重大立项决策必须用自己重建的、证据分级透明的分数。平台公开各路证据的原始分——这一层才是金矿,直接用总分等于把金矿当砂砾。

特征越多的模型越好吗?

不是。靶标预测的样本量(已知疾病基因数)撑不起高维特征,特征堆量只会把噪声拟合成模式。实践里的甜点位是十几到几十个特征,每个特征有明确的生物学或统计学理由;候选特征先用单变量与证据类型分组筛一遍,进模型的每个都要能被归因工具解释。模型选择上,梯度提升树一类的方法在这类中等规模、异质特征的数据上长期是最优性价比——深度模型的优势要到大规模同质数据(序列、图像)才兑现。

办案手记(要点回顾)

  • 备料四柜:蛋白档案、疾病关联档案、药物化学档案、平台整合服务,版本日期必须记录;
  • 监督框架要标定答案、擅长特征泛化,负例构造与文献热度偏差是它的命门;
  • 无监督相似度打分靠"同伙相似律",是正例稀缺场景的冷启动主力;
  • 打分器要做到权重显式、过程可复核、换权重做敏感性检查;
  • 热度偏差要在特征、评估、产出三个层面同时纠偏,冷门高分候选要特殊标注;
  • 下一站 4.2:统计打分看不到的暗线,去知识图谱里找。

作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U