1.1 把品种和分子当产品:设计迭代循环 本节摘要:定义全书的核心抽象——试验圃循环,即"设计、合成、筛选、晋级"四拍;把育种循环与药物设计的 DMTA 循环逐拍对齐,给出可执行的伪代码与成本账本。这是全册的地基节,后面所有章节都挂在循环的某一拍上。 两份项目书,一张循环图 一家种业公司的项目书这样写:目标是在若干个世代内,把玉米自交系 A 的抗旱指数提升到可推广水平,同时保持产量不低于现有对照。一家生物科技公司的项目书写着:针对某个高频突变的激酶,找到亲和力进入纳摩尔区、口服生物利用度合格的候选分子。
本节摘要:定义全书的核心抽象——试验圃循环,即"设计、合成、筛选、晋级"四拍;把育种循环与药物设计的 DMTA 循环逐拍对齐,给出可执行的伪代码与成本账本。这是全册的地基节,后面所有章节都挂在循环的某一拍上。
一家种业公司的项目书这样写:目标是在若干个世代内,把玉米自交系 A 的抗旱指数提升到可推广水平,同时保持产量不低于现有对照。一家生物科技公司的项目书写着:针对某个高频突变的激酶,找到亲和力进入纳摩尔区、口服生物利用度合格的候选分子。两份文件的术语体系完全不同——前者的关键词是系谱、配合力、表型鉴定,后者是靶点、对接打分、ADMET——但把工作计划拆开,两边都在做同一件事:提出一个候选方案,把它做出来,测试它,决定谁进入下一轮。
这就是本教程的核心抽象,试验圃循环:
药物研发界把这套节奏叫 DMTA:Design、Make、Test、Analyse。四拍与上面的对应关系严丝合缝,唯一的差别是 Analyze 在育种里常被低估——很多育种项目测完数据就结束了,没有把"分析"沉淀为下一轮设计的模型更新,这正是后面第 4 章要补的课。

把循环当成四个函数,每个函数有明确的输入输出,项目管理的很多混乱就能避免:
| 拍 | 品种侧输入 → 输出 | 分子侧输入 → 输出 | 主要成本项 |
|---|---|---|---|
| 设计 | 种质信息、表型数据、模型 → 组合方案或编辑方案 | 靶点结构、配体数据、模型 → 候选分子清单 | 算力与专家时间 |
| 合成 | 亲本与方案 → 杂交群体或编辑植株 | 合成路线 → 化合物实物 | 土地、温室周期;合成外包费用 |
| 筛选 | 群体 → 表型与基因型数据 | 化合物 → 活性与性质数据 | 鉴定成本随重复数线性增长 |
| 晋级 | 数据 → 晋级名单与新模型 | 数据 → 晋级分子与新模型 | 决策错误的机会成本 |
注意最后一行的措辞:晋级拍的产出不只是名单,还有更新后的模型。一个只出名单不出模型的循环,每轮都要从零开始猜;一个能把筛选数据沉淀为预测模型的循环,设计拍会越来越准。第 2 章的基因组选择和第 4 章的机器学习,本质上都是在强化这一条回路。
循环逻辑本身可以用十几行伪代码说清楚。读者不必运行它,重点看结构:预算约束、晋级阈值、模型更新,三个工程要素一个都不能少。
初始化: candidates = 原始种群 或 起始化合物库 for 轮次 in 1..N: # 预算只允许有限轮 designs = model.propose(candidates) # 设计拍:模型给方案 builds = synthesize(designs) # 合成拍:土地或湿实验室 scores = assay(builds, replicates=3) # 筛选拍:带重复的测量 kept = scores.filter(阈值).top(k) # 晋级拍:择优 model.update(kept + 淘汰样本) # 负样本也要进模型 candidates = kept if 遗传进度达标 or 亲和力与ADMET双达标: break
三条工程注释。第一,replicates=3 不是装饰:田间试验不设重复,环境噪声会淹没遗传差异,这是第 7 章品比试验要展开的主题。第二,淘汰样本必须进模型——只喂正样本的分类器学不会边界,药物设计中"失败化合物"档案的价值不亚于成功档案。第三,循环要有终止条件,否则预算会被无声吞掉;品种侧的终止条件是遗传进度与稳定性双达标,分子侧是活性、选择性、成药性三线通过。
同一个循环,两条线的提速手段不同,但账本结构相同。品种侧单轮成本的大头是土地与时间——一轮就是一个生长季,加代技术(如海南南繁、温室加代)本质上是花钱买轮次。分子侧单轮成本的大头是合成与测试外包,并行合成与高通量筛选本质上是花钱买每轮的候选容量。理解这一点,你就能看懂后续章节里所有"提速技术"的定价逻辑:分子标记辅助选择省的是筛选拍里最贵的表型鉴定;虚拟筛选省的是合成拍的无效分子;基因组选择省的是整轮世代。谁最贵,就先优化谁,这是试验圃的第一条经济学。
⚠️ 常见坑:把循环画成圆圈。缺少"模型更新"回路的循环画成圆圈没有问题,但那样每轮的设计水平不变,迭代就退化成重复抽样。画图时务必让晋级拍有一条指向设计拍的加粗箭头。
循环思维会不会过度简化生物系统的复杂性? 会,如果把它当成"生物学只是优化问题"的教条。循环是组织工作的框架,不是对机理的断言——生物系统的非线性、涌现与背景依赖性(1.3 节)都还在,循环只是给了它们一个可以被管理的外观。一个校准动作:每轮回顾时(5.3 节)问一句"这轮有没有模型解释不了的意外",意外的积累就是循环假设需要修正的信号,也是新机理发现的入口。
两条线的技术能直接互相移植吗? 部分能:预测框架(统计模型、验证纪律)几乎无缝,表征学习(4.3 节)本就同源;实验体系则各有物理约束(生长季与化学合成的节律不同)。移植的正确姿势是移植"方法结构"而不是"具体参数"——GS 的交叉验证纪律搬到 QSAR 有效,但 GS 的群体规模经验值搬到药物项目毫无意义。读懂哪些是结构、哪些是参数,是跨行迁移的基本功。
新手上手一个循环项目,先做什么? 先找到"账本":项目目前每轮花多少钱、多少时间、瓶颈在哪一拍(很多项目自己都答不上来)。再看"回路":筛选数据有没有回流到设计(模型更新拍是否活着)。这两个问题的答案暴露的问题,通常比任何技术升级的机会都大——1.1 节的账本与回路,既是世界观也是诊断工具。
下一节盘点循环的第一种原料:品种线的种质资源,看一个育种项目的"原材料仓"长什么样、怎么估值。