本节摘要:设计相把一句话需求翻译成可执行的序列方案:需求规格化、元件选型、建模仿真、风险预审,最终交付一份构建清单。本节讲清每个环节的输入输出与常用工具,并吸收生物 CAD 与数学建模两大工具族的实操要点——设计质量决定了后面三相的天花板。
"三周内给一版能同时响应砷和汞的方案"——这样的需求直接进实验室就是灾难,因为它没有验收条款、没有优先级、没有边界条件。设计相的第一个动作是把口语需求翻译成规格表:检测物与阈值、响应时间、输出形式、动态范围、宿主约束、成本上限。第 3 章的规格单模板在这里升级成正式版本,多出两栏:优先级(哪些条款可以让步、哪些是红线)与验收方式(用什么实验、什么统计口径判定达标)。
翻译的技巧是逼问"怎么验证":需求方说"灵敏度要高",就追问"在什么背景下、多高算高、用什么单位量"——问不下去的地方,就是设计风险所在。规格表定稿后签字冻结,后续变更走变更流程。这个软件工程味道十足的纪律,在生物项目里的价值只增不减:湿实验的成本远高于改代码,模糊需求造成的返工是以周计的。
规格表到手,选型从三本"目录"开始。元件目录:启动子按强度分档、RBS 按翻译效率标注、阻抑配对按正交性分类——选型时优先取同一批表征数据里的元件,避免跨批次数字对不上(4.2 节的纪律)。骨架目录:拷贝数、抗性、接缝兼容性逐项核对。宿主参数表:底盘的密码子偏好、拷贝数效应、已知的功能基因型缺陷。
选型排序的原则是先组合再优化:先用目录里的标准档位搭出基线版本,跑通后再精调参数。新手最常见的反模式是一上来就定制元件——每个定制件都引入新的不确定性,第一轮迭代就被塞进三四个变量,失败后无从归因。
设计相里最便宜的一轮"实验"发生在计算机里。三个层次的模型按需取用。化学计量模型算代谢通量的理论上限与支路竞争(3.2 节),回答"资源够不够、瓶颈在哪一步"。动力学模型用常微分方程描述元件间的浓度关系,仿真开关的双稳态区间、振荡器的周期范围,回答"参数在这个区间里行为对不对"。统计与机器学习模型不追求机理,从历史数据里学"序列特征到表达量"的映射,给序列设计提候选——蛋白设计与启动子设计里它已是标配。
建模的实战要点是带着问题建模,不追全面:这轮设计的最大不确定项是哪个参数,就建哪个子模型。全途径的精细动力学模型又贵又脆,参数填不满时拟合出来的是幻觉。一个务实的做法是"粗模型定方向、精模型定参数、实验定真相"——三层各管一段。
流程图里的回环值得注意:仿真不达标的组合要回到选型重排,这个回环在软件里转一圈只要几小时——这正是"最便宜的一轮实验"的含义。
生物 CAD 工具族把上述流程装进软件:序列编辑与注释管理设计对象,元件库对接登记系统,规则校验自动检查酶切接口与克隆合法性,仿真插件调用动力学模型,导出模块直接生成构建清单与合成订单。工具生态从开源到商业不一而足,能力差异主要体现在元件库深度与规则库广度上。
用 CAD 的收益不只是省敲键盘的时间,而是设计被结构化了:序列有版本、元件有出处、参数有单位、导出的构建清单可以直接被执行相消费。第 7 章会讲到,这种结构化表示(序列连同功能语义一起存储)是全行业数据标准化的核心诉求——CAD 是数据标准的第一个消费者,也是最好的推广者。
选 CAD 的务实标准有两条:一是与登记系统打通,选型时能直接调元件表征数据;二是导出物可执行,构建清单不用人工转录成订单。至于界面好看与否,工程价值排序里排不进前十。
构建清单发出前有一道容易被省略的工序:风险预审。三张清单过一遍——生物安全:宿主的防护等级、是否涉及致病变体、产物毒性;实验风险:新元件的表达毒性、质粒兼容性、已知失配对;数据风险:这轮设计的关键假设是哪几条、测试时要重点采集什么数据才能验证它们。第三张清单直接决定测试相的方案,预审里省的每一分钟,都会在测试相以天为单位偿还。
设计相的交付物包由此成型:规格表(冻结版)、序列方案(含每个元件的出处与参数)、模型文件与仿真结论、风险预审记录、构建清单。这五份文件的完整度,是判断一个团队设计纪律的快速指标。
正文说"粗模型定方向",这里给出那个粗模型的最小形态。单基因表达的最简两方程模型:信使核糖核酸浓度的变化率等于转录速率乘以调控函数再减去降解;蛋白浓度的变化率等于翻译速率乘以信使核糖核酸浓度再减去降解。写成参数化形式:
dM/dt = 转录强度 × 调控函数f − 降解速率M × M dP/dt = 翻译效率 × M − 降解速率P × P
其中调控函数常用希尔函数描述,参数只有四个量级:转录强度、翻译效率、两个降解速率。这个玩具模型的用途出人意料地大:拿元件目录里的参数填进去,就能估出"这个启动子加这个翻译元件大概给多少蛋白""诱导后多久到达平台期""泄漏本底大概多高"。它当然不准——没有负载、没有噪声、没有生长稀释——但它的数量级判断足以在设计相砍掉一半明显不可行的组合。这正回应正文的三层分工:粗模型排除坏参数区,省下的实验预算才是它的真实产出。
不是编程,是参数意识:拿到任何表征数字先问三个问题——单位是什么、什么条件下测的、跨场景可不可以引用。第二项才是电子表格级的定量推演:用最简表达式把"启动子强度乘以拷贝数乘以翻译效率"这类量级关系算清楚。这两项技能的边际回报高于直接上手建模软件——参数意识缺失的团队,用了再强的工具也是在错误的输入上运行。
设计定了,构建清单在手。下一相把纸面方案变成冰箱里的质粒——构建的三条路线各有各的账。