本节摘要:测试相按标准方案产出可归因的数据,学习相把数据折算成下一轮的设计参数。本节讲测试方案的三个要件、数据记录的字段纪律、参数反演与假设修正的归因方法,并说明人工智能工具在"学习"环节的正确用法——它们放大设计空间,但不能替你解释机理。
把测试当终点是 DBTL 最常见的变形:测完、汇报、归档,下一轮设计照旧凭感觉。本章坚持另一种定义——测试是设计与学习之间的接口:测试方案在设计相的风险预审里就已写好(5.1 节第三张清单),测试产出的数据在学习相被折算成参数、验证或推翻假设。本节把这条接口线上的三段工作——测什么、怎么记、怎么学——讲清楚。
本节位置承前启后:向前消费 5.2 节的双验证产物与 4.2 节的测量体系,向后把 5.4 节铸造厂的数据管线喂饱。
要件一:对照与重复的结构。每轮测试至少三类对照:阴性对照(无诱导)、基线对照(上一版最优构建)、正控对照(已知强响应构建,用于发现"今天体系不对")。生物学重复不少于三个,且要覆盖不同天——同一天重复测的是操作精度,跨天重复才测得出体系漂移。
要件二:采样时序。动态线路只测终点等于没测:开关的切换时间、振荡器的周期、代谢途径的中间体积累,都藏在对数生长期与稳定期的动态里。采样点设计要跟着模型的预测曲线走——预测哪里变化最快,就在哪里加密采样。
要件三:判定预注册。达标线、统计口径、样本量在开测前写死,不许看完数据再定口径。这条从临床试验学来的纪律,防的是无意识的"测到好看为止"——它浪费的不仅是时间,更是团队对自家数据的信任。
一条荧光读数,脱离上下文就是数字噪声。入库记录的最低字段集:构建编号(关联到 5.2 节的登记档案)、菌株批次、培养基与条件、接种与诱导时刻、测量仪器与定标信息、原始读数与处理口径、操作人。这些字段看似琐碎,学习相做归因时每一条都会被用到——"第三批构建表现异常"的结论,往往就是靠字段比对定位到"这批用的诱导剂是新开的瓶子"。
记录纪律的工程化形态是电子实验记录与结构化模板:表单代替自由文本,仪器直连自动采数,条码扫描代替手抄编号。这不仅是防错,更是让数据"机器可读"——铸造厂的数据管线(5.4 节)直接消费这些结构化记录,人肉转录是自动化链条上最脆的一环。
| 学习动作 | 输入 | 方法 | 输出物 |
|---|---|---|---|
| 参数反演 | 实测曲线 | 曲线拟合、贝叶斯推断 | 更新后的元件参数(强度、降解率) |
| 假设检验 | 对照组差值 | 统计检验、残差分析 | 假设成立与否及置信度 |
| 失效归因 | 异常样本全字段 | 字段比对、复测隔离 | 故障定位与复现方案 |
| 设计更新 | 新参数与模型 | 再仿真、敏感度分析 | 下一版构建清单的变更项 |
表格里四个动作的顺序有讲究:先归因、再反演、后更新——顺序颠倒了,故障数据会污染参数库。
学习相最核心的数学动作是反演:拿实测的输入输出曲线,去解出模型里的元件参数。启动子的真实强度、蛋白的有效降解率、诱导的半激活浓度——这些纸面值与实测值的偏差,就是下一轮设计要校正的量。
反演的实务难点是可辨识性:参数之间常常互相补偿,同一组曲线能被多组参数组合解释。对策有三:其一,测试方案里就为关键参数设计"只让它变"的条件(比如单独扫诱导浓度,固定其余);其二,用贝叶斯方法输出参数的分布而非点值,宽分布本身就在提示"这组数据分辨不出它";其三,接受区间答案——设计需要的往往不是精确值,而是"落在这一档"的分档结论。
反演结果回写元件库时有一条纪律:标注条件。同一启动子在两个宿主、两种拷贝数下的"强度"是四个数,混写一个数等于埋雷——4.1 节"换底盘即重大设计变更"在学习相的对应条款。
每轮测试总会出几个异常构建。侦查的标准流程:隔离复测(排除测量事故)→ 字段比对(这批样本与对照组差了什么)→ 定位层级(构建问题查序列与拷贝数,菌株问题查基因型漂移,条件问题查批次记录)→ 结论入库(写进失败备注,供未来检索)。
一个真实感的例子:某轮三个平行构建中一个诱导后沉默。复测依然沉默,排除测量事故;字段比对显示它与另两个唯一的差别是使用了一批新配的培养基;复测换回旧培养基则恢复——定位为条件问题,新批次培养基的某组分(后查明是痕量重金属污染)恰好是线路的诱导物类似物,本底预激活把动态范围压没了。这个结论的价值超出本轮:它同时给砷检测的现场应用加了一条环境干扰的警示。
机器学习工具近年在学习相的存在感越来越强:从历史数据里学"序列特征到表达量"的映射、给下一轮组合实验挑最有信息量的样本、在巨大的设计空间里预筛候选。这些能力实实在在地放大了每轮迭代能覆盖的设计空间。
但要把位置摆正:模型擅长内插,不擅长外推;擅长关联,不负责机理。训练数据没覆盖过的参数区,模型的预测只是漂亮的插值;它说"这两个特征相关",不回答"为什么相关"。务实的用法是把模型当"预筛器"——它在几十万候选里挑出一百个,湿实验负责最终的裁决与解释。反过来,湿实验的新数据持续回填训练集,模型随迭代越来越好。人负责假设与解释,模型负责搜索与排序——这个分工在可见的未来不会反转。
没有魔法数,但有一个务实的推演:效应量越小、噪声越大,需要的重复越多。经验法则是先跑一个试点(三个重复)估出噪声量级,再按目标检验力反推正式样本量——多数线路级实验落在五到十个生物学重复的区间。比重复数更容易被忽视的是覆盖度:三个重复全在同一天做,测的是操作精度;跨三天各三个,才覆盖体系的日间漂移。预算不变时,把重复摊到不同天,统计效力通常更高。
学习相的落地形态可以很简单:每周例会固定一问——"上一轮数据改变了哪一条设计假设?"要求答案的句式为"我们原以为参数甲在某个区间,数据显示在另一区间,因此下一版做何种改动"。答不出这句话的轮次,说明测试产出的数据没有进入闭环——测量做了,学习没做。这个小仪式的成本是例会五分钟,收益是团队级的闭环习惯。正文讲的方法(归因、反演、更新)是它的技术版,例会一问是它的文化版——后者往往更难建立,也更有价值。
四相在纸面上闭环了。下一节看它被搬进自动化厂房之后的样子:生物铸造厂。