2.3 基因组选择:把整个圃搬进模型 本节摘要:基因组选择(GS)是数量性状的正确解法:不再逐个找主效基因,而是用参考群体训练全基因组模型,对只有基因型、没有表型的候选个体直接预测育种值(GEBV)。本节讲清它的数学直觉、参考群体构建、准确率评估,以及它为什么同时提升选择强度与缩短世代间隔。 一个思想实验:测产之前先预测 假设你要从三千份候选株系里挑两百份晋级。产量鉴定一季只能测几百份,且成本随重复数上升。传统做法只能先按系谱与少数表型粗筛。基因组选择的提议是:我们过去十年积累了四千份"既有基因型又有产量数据"的材料(参考群体),用它们训练一个模型,学习"哪种标记组合对应高产";然后给三千份候选测基因型(便宜、苗期就能做),模型直接报出每份的预测育种值——播种之前,晋级名单的初稿已经在桌上。
本节摘要:基因组选择(GS)是数量性状的正确解法:不再逐个找主效基因,而是用参考群体训练全基因组模型,对只有基因型、没有表型的候选个体直接预测育种值(GEBV)。本节讲清它的数学直觉、参考群体构建、准确率评估,以及它为什么同时提升选择强度与缩短世代间隔。
假设你要从三千份候选株系里挑两百份晋级。产量鉴定一季只能测几百份,且成本随重复数上升。传统做法只能先按系谱与少数表型粗筛。基因组选择的提议是:我们过去十年积累了四千份"既有基因型又有产量数据"的材料(参考群体),用它们训练一个模型,学习"哪种标记组合对应高产";然后给三千份候选测基因型(便宜、苗期就能做),模型直接报出每份的预测育种值——播种之前,晋级名单的初稿已经在桌上。表型鉴定从"筛子"变成"验证器",只测模型最看好的那批。循环的筛选拍被整体前置,这是 GS 对循环结构最深刻的改动。
GS 的标准模型在 1.3 节的分解式上展开:表型向量等于标记效应之和加残差。问题是标记数(几万)远大于样本数(几千),普通回归无解。破局的一步是承认"单个标记效应都很小",给所有效应套上一个"往零收缩"的约束(岭回归 / GBLUP 框架),让估计变稳定。用一个玩具算例感受:
3 个候选个体,2 个标记(真实场景是几万个标记): 标记编码(0/1/2): 个体A: m1=0, m2=2 个体B: m1=1, m2=1 个体C: m1=2, m2=0 训练得到(收缩后的效应估计): b1 = +0.30, b2 = -0.10 GEBV = Σ 标记编码 × 效应: A: 0×0.30 + 2×(-0.10) = -0.20 B: 1×0.30 + 1×(-0.10) = +0.20 C: 2×0.30 + 0×(-0.10) = +0.60 → 晋级优先 另一条等价路线(GBLUP): 用标记算个体间基因组关系矩阵, 育种值按亲缘关系"分摊"——两种算法在数学上等价,殊途同归。
两条路线的直觉:RR-BLUP 说"每个标记贡献一点",GBLUP 说"跟候选亲缘关系近的参考个体,其表型信息权重大"。理解到这一层,读 GS 论文时看到 GBLUP、贝叶斯变量选择、机器学习变体,就知道它们是在"如何分配权重"上做不同假设。

GS 的命门是预测准确率 r(GEBV 与真实育种值的相关)。它决定 GS 版的选择响应:把 2.1 节公式里的 h² 换成 r 量级的"有效遗传力"。评估准确率的标准动作是交叉验证:把参考群体随机分折,留一折当"伪候选"(模型没见过其表型),预测后与实测算相关,重复多次取平均。汇报模型时只报训练集拟合优度是外行行为——几万参数的模型拟合训练集毫无难度,泛化才算数。
影响准确率的因素按重要性排:参考群体规模与候选群体的亲缘远近(近期同代个体最准)、性状遗传力、标记密度、模型与性状遗传架构的匹配度(显性与上位丰富的性状,线性模型吃亏)。工程上的含义:GS 项目要先问"参考群体跟我的候选群体是不是一个世界"——跨群体、跨世代应用时准确率衰减是常态,模型定期用新数据重训是制度而不是选项。
把 GS 放回第 1.1 节的账本,它动了三行:
⚠️ 常见坑:拿 GS 报告直接选"最高分"而不看不确定度。极端预测值往往也是估计方差最大的区域,稳妥做法是按 GEBV 与可靠性加权排序,或对顶端个体保留实测验证位。
参考群体要多大才够? 没有魔法数字,但有经验区间:主要作物的实用参考群体常从数千个体起步,性状遗传力越低、群体结构越复杂,需要的规模越大。比总量更重要的是三个质量维度:表型年份与地点的覆盖(环境代表性)、与候选群体的亲缘接近程度(2.3 节反复强调的衰减律)、以及系谱与基因型数据的完整对齐。一个小而准的参考群,常常跑赢一个大而杂的。
GEBV 相同的两个个体选谁? 看三个附加信息:一是预测可靠性(模型对该个体的置信度,与亲缘关系远近挂钩);二是多样性价值(与现有骨干亲本的遗传距离——极端近亲的候选即使分高,杂交组合的潜力也有限,这呼应 1.2 节的多样性逻辑);三是实际 Constraints(种子量、育性、配合力记录)。把这三个维度做成排序的次级键,是育种软件里"单列表排名"与"真实决策"之间的差距所在。
GS 与 MAS 能在一个项目里共存吗? 不仅共存,而且互补得很好:主效抗病基因用标记做前景选择(保证关键抗性不丢),数量性状用 GEBV 做全局排序(决定谁晋级),两者在晋级规则里加权合成——本质上这就是 2.1 节选择指数思想的分子时代版本:不同性状用不同精度的信息源,最后在同一张账本上会师。
再多说一句成本账:GS 的边际成本结构对中小项目尤其友好——基因型分型的单价随通量持续下降,而表型鉴定的成本相对刚性;因此"便宜基因型+好模型"替代"昂贵多年表型"的经济性逐年改善。判断你的项目该不该上 GS,最直接的办法是算两套方案的每年遗传增益除以年成本(2.1 节的口径),而不是跟风技术名词。
无论 MAS 还是 GS,改动都还停留在"利用现有变异"。下一节的基因编辑直接在图纸上落笔——变异不够,就写一个出来。