本节摘要:mRNA 痕迹要换算到蛋白与互作层面才接近作案事实。本节盘点互作检测技术(免疫共沉淀-质谱、邻近标记、酵母双杂交)的视野与噪声,讲"同案犯网络聚集"检验的逻辑与演算——嫌疑分子的伙伴里若聚集着已知作案团伙,嫌疑等级显著上调。它承接 3.2 的转录名单,为 3.4 的证据整合供料。
转录痕迹离作案事实隔着一层:转录不等于翻译,翻译不等于功能,功能还要通过蛋白之间的配合才实现。本节把这层窗户纸捅破——取证对象从"谁在活动"升级为"谁跟谁在活动"。
细胞里的功能几乎都是团伙作案:信号靠复合物逐级传递,转录靠因子组合开关,修复靠支架蛋白聚集工位。这个"团伙作案"的事实给取证提供了特殊角度:看一个嫌疑分子平时跟谁来往。如果他高频接触的蛋白里,聚集着多个已被判与疾病有关的"前科犯",他的嫌疑等级就该上调——这本质上是证词放大:一个关联是孤证,伙伴网络里一片关联就构成指证。
实操中这种检验叫网络富集分析。输入是候选分子的互作伙伴列表,参照是疾病已知基因集(来自 GWAS 目录、文献策展库),统计问题是"伙伴列表与已知基因集的重叠是否超出随机"。重叠显著,嫌疑上调;不显著,也不能洗白——只是这条线索不加分。
检测互作本身有几代工具,视野与噪声特性差别很大,选型和读数都要按工具的脾气来:
| 技术 | 原理 | 视野 | 强项 | 噪声与局限 |
|---|---|---|---|---|
| 免疫共沉淀-质谱(AP-MS) | 抗体钓出诱饵蛋白及其结合伙伴 | 诱饵的直接与间接伙伴 | 天然条件,可捕捉复合物 | 间接互作混入;弱/瞬时结合易丢 |
| 邻近标记(BioID、APEX) | 融合酶在活细胞里给近旁蛋白打标记 | 标记半径内的所有蛋白 | 抓弱结合与瞬时接触,适合膜受体与相分离区 | 标记半径大,"邻居"不等于"同伙" |
| 酵母双杂交(Y2H) | 报告基因读出两蛋白在酵母核内结合 | 成对直接结合 | 直接互作,可规模化建全网 | 假阴假阳都高;亚细胞定位失真 |
| 共表达相关 | 跨样本的表达相关性 | 功能关联(非物理结合) | 免费且易规模化 | 相关不含物理互作信息 |
四类工具读数口径不同,混读是常见错误:邻近标记说"住得近",AP-MS 说"被钓到一起",Y2H 说"能直接贴上",共表达说"步调一致"。取证报告里写互作证据时,必须标注来源技术,并用至少两类技术交叉验证关键结论。
# 同案犯网络聚集检验:伙伴列表与已知疾病基因集的重叠打分 import random random.seed(11) known_disease = {"TGFB1", "PDGFB", "COL1A1", "MMP2", "CTGF", "SP1", "ROCK1", "EDNRA", "COMP", "TNC", "LOX", "ITGB1"} # 已知纤维化前科犯 all_proteins = known_disease | {f"P{i:03d}" for i in range(1, 601)} # 全蛋白背景 # 候选 A:伙伴与疾病基因集重叠(8 个重叠),候选 B:几乎无重叠 partners_a = {"TGFB1", "COL1A1", "LOX", "ITGB1", "P041", "P117", "CTGF", "MMP2", "P203", "P256", "SP1", "P310"} partners_b = {"P088", "P142", "P377", "P455", "P509", "P021", "P333", "P584", "P065", "P419"} def enrichment_score(partners, known, background_size, draws=20000): """超几何直觉的置换检验:随机抽同样数量的伙伴, 统计重叠超过观测值的频率,作为经验 P 值。""" obs = len(partners & known) hits = 0 pop = list(known) + [f"BG{i}" for i in range(background_size)] for _ in range(draws): sample = random.sample(pop, len(partners)) overlap = sum(1 for p in sample if p in known) if overlap >= obs: hits += 1 return obs, hits / draws for name, partners in [("候选A", partners_a), ("候选B", partners_b)]: obs, p = enrichment_score(partners, known_disease, 2000) verdict = "同案犯聚集显著 嫌疑上调" if p < 0.01 else "无聚集 证据不加权" print(f"{name}: 重叠 {obs} 个,经验 P 值 {p:.4f} -> {verdict}") # 输出方向:候选A 的重叠远超随机(P 极小),候选B 无聚集; # 置换检验的好处是不依赖分布假设,样本库规模不规则时依然稳健。
BRCA1 本身的证据链早已闭合(胚系突变携带者乳腺癌与卵巢癌风险剧增),但它的案子里藏着网络取教的经典一幕:BRCA1 蛋白被纯化后,质谱鉴定的结合伙伴里有一个此前默默无闻的蛋白——后来被命名为 PALB2。它充当 BRCA1 与 BRCA2 之间的桥梁:BRCA1 负责在损伤位点落位,PALB2 负责把 BRCA2 与 RAD51 招来启动同源重组修复。三者的胚系突变携带人群的癌症谱系高度一致——网络位置预测疾病表型的教科书案例。
这桩案子给靶标发现的启发是双向的:一是网络取证能"顺藤摸瓜"——从一个已定案的分子出发,把它的功能搭档拖进嫌疑名单(PALB2 自此也成为携带者筛查与靶标研究的对象);二是网络位置能解释疾病特异性——同样的修复通路,哪个成员突变导致哪类癌症、对哪类药物(PARP 抑制剂,见 2.2 合成致死)敏感,答案都写在网络拓扑里。
网络取证最容易翻车的地方是高估"关系"的含义。邻近标记的标记半径覆盖整个相分离凝聚体——一个凝聚体里可能塞着上百个蛋白,互不相干;AP-MS 钓到的是"复合物总表",诱饵的直接结合与间接搭桥混在一起。两条纠偏纪律:一是关键结论必须换技术复测(邻近标记的发现用 AP-MS 或共沉淀确认);二是把互作证据与转录证据交叉——伙伴关系显著 + 伙伴基因协同共表达 + 该模块与疾病表型相关,三线合一时网络证据才敢写进加权证据表的"高置信"栏。
⚠️ 常见坑:直接拿公共互作数据库的全量边当"真相"。这些数据库里不同来源实验的可信度差异极大,高吞吐来源的边要降权使用,关键边要回到原始实验的重复次数与对照设置。
来源通常是策展型疾病基因库与 GWAS 目录的并集,但每个来源都带偏差:策展库偏向研究充分的基因,GWAS 目录偏向常见变异能扫到的区域。两条治理手段:按证据来源给参照集分层,分别做富集(结果跨层一致才稳健);用置换检验替代理论分布,让背景群体的不规则性显式进入检验。参照集本身就是假设——立项文书写明参照集版本,是对自己的基本保护。
不能。位置偏僻有三种截然不同的解释:真的无辜;取证工具没覆盖它的互作(膜蛋白、低丰度蛋白在传统库里系统性缺位);它的作案方式本来就是"独行"的(直接调节代谢或离子流,不需要大团伙)。所以"无聚集"只是不加权的结论,不是洗白结论——网络证据永远只能加分,不能减分,这条不对称在加权证据表里要显式遵守。
方向上能,精度上要打折。两条通路在网络拓扑上越独立(连接稀疏),同时打击的合成致死概率越高——这正是合成致死筛选的理论底座。但拓扑独立不等于生物学独立(共享辅因子、共享亚细胞定位都会制造隐性关联),预测名单只能当实验设计的先验排序,不能当组合处方。真裁决权在成对扰动的实验数据手里。
网络证据进证据表时同样要拆口径:直接结合(哪类技术、是否竞争验证)、复合物共现(钓取来源、背景扣除方式)、功能关联(共表达或遗传互作)。三类证据的置信度天然不同,混写一行"有互作证据"会让下游排序把最弱口径当平均口径用。规范写法带技术标签与验证状态,这是第 4 章算法能正确加权的全部前提。
办案手记(要点回顾)