1.3 基因组与表型:品种侧的图纸规则 本节摘要:品种线的图纸是基因组。本节讲基因型如何被组织成可计算的数据(SNP 编码、系谱)、表型如何分解为遗传与环境成分、数量性状与质量性状的工程差别,以及进化适应作为循环对手方的三种形态。读完你能读懂一份育种数据表的列名各代表什么。 一张育种数据表的解剖 任何一个育种项目跑起来,最先出现的总是一张宽表:每行一个株系,列里混着系谱、标记基因型和一摞表型值。新手把它当记录看,老手把它当图纸读。拆开看这张表的三个层次: 第一层是身份与关系。株系编号、系谱(谁是父母本)、世代号。系谱之所以重要,是因为它隐含了个体间的亲缘关系矩阵——两个株系共享的亲本越多,期望的遗传相似度越高。后续基因组选择里用标记算出来的基因组关系矩阵,本质上就是系谱信息的高精度版本。
本节摘要:品种线的图纸是基因组。本节讲基因型如何被组织成可计算的数据(SNP 编码、系谱)、表型如何分解为遗传与环境成分、数量性状与质量性状的工程差别,以及进化适应作为循环对手方的三种形态。读完你能读懂一份育种数据表的列名各代表什么。
任何一个育种项目跑起来,最先出现的总是一张宽表:每行一个株系,列里混着系谱、标记基因型和一摞表型值。新手把它当记录看,老手把它当图纸读。拆开看这张表的三个层次:
第一层是身份与关系。株系编号、系谱(谁是父母本)、世代号。系谱之所以重要,是因为它隐含了个体间的亲缘关系矩阵——两个株系共享的亲本越多,期望的遗传相似度越高。后续基因组选择里用标记算出来的基因组关系矩阵,本质上就是系谱信息的高精度版本。
第二层是基因型。现代育种的主要形态是 SNP(单核苷酸多态性)标记,每个位点上个体被编码为 0、1、2——参考等位基因的拷贝数。几万个这样的位点排开,就是一张二/三值矩阵,是所有下游模型的输入格式。表观遗传修饰、结构变异也在图纸上,但工程主线目前仍是 SNP。
第三层是表型。株高、产量、抗病等级、品质指标,每一列都是"基因型与环境共同作用后的读数"。

育种数据的第一课:你测到的从来不是"基因的好坏",而是基因与环境混合后的读数。统计上把它写成一条加法模型,用一个演算会话展示各成分怎么读:
观测表型 y = μ + G + E + G×E + ε μ 群体均值(全试验的平均水平) G 基因型效应(我们要的部分) E 环境效应(地点、年份、管理差异) G×E 基因型与环境交互(某品种只在旱地好) ε 随机误差(测量噪声、土壤不均) 例:三个地点的品比试验,某品系产量读数 6.9 吨每公顷 μ = 6.5,E(旱地) = -0.3,G(该品系) = +0.8,G×E = -0.05,ε = -0.05 验算 6.5 - 0.3 + 0.8 - 0.05 - 0.05 = 6.9 ✓ 解读:品系本身 +0.8 的遗传优势是真的,但在旱地被环境压掉一部分; 若只看单一地点单年数据,G 与 G×E 无法分开,选种就会误判。
这条分解式决定了后面几乎所有方法的形态:混合线性模型用它来校正环境效应,遗传力从它的方差成分里读出,多环境试验的设计目标就是让 G×E 被估计出来而不是混进误差。第 2 章讲选择响应时,遗传力将作为公式里的乘数出现——它就是 G 的方差占表型方差的比例。
图纸上的改动分两类,工程手法完全不同:
一个常见误判是把数量性状当质量性状做:团队在低分辨率的群体里"定位"出一个产量 QTL,就按主效基因去转育,几个世代后发现效应消失。原因通常是定位群体的假象或 QTL 效应被遗传背景稀释。数量性状的证据标准是效应在多个独立群体中可重复,且解释方差的比例说得清楚。
进化不在你的项目书里,但它同时在跑,而且往往更快。品种侧要警惕三种形态:
把对手循环画进项目图(第 1.1 节那张图旁边再画一个小一号的红色循环),晋级拍就要多回答一个问题:这个候选品种/分子,对手用多久能绕过它?药物侧的对应问题就是耐药突变——肿瘤克隆的选择、抗生素耐药基因的水平转移,逻辑与病原菌小种演变完全同构,第 3 章靶点一节会再遇到它。
⚠️ 常见坑:用单点单年数据做选择决策。E 与 G×E 没被分离时,你选择的往往是"地点"而不是"基因"。
狭义遗传力和广义遗传力有什么区别? 广义遗传力把全部遗传方差(加性、显性、上位)都算作"可遗传",狭义遗传力只算加性成分——能通过选择稳定传递给后代的部分。育种关心的是狭义:显性效应在杂种一代闪耀却无法固定(杂交种二代就分离),上位效应依赖特定组合背景。所以选择响应公式里用的是狭义遗传力;而杂交种育种(利用显性与杂种优势)看的是另一套配合力账本(2.1 节)——两条路线的遗传学根据在此分岔。
怎么提高一个性状的遗传力估计? 遗传力不是性状的固有常数,是"遗传方差占表型方差的比例"——分母里的环境方差可以通过试验手段压缩:增加重复(平均掉微环境噪声)、多点多年(分离并剔除环境效应,1.3 节的分解式)、精细管理(缩小非目标变异)。分子方法的贡献更直接:基因型信息把"个体间的遗传相似度"从系谱猜测升级为实测(2.3 节),等价于在不增加一亩地的情况下提高了有效遗传力。
G×E 一定是坏事吗? 不一定,看项目目标:广适品种希望交互小(到处都能种);区域专用品种恰恰要利用交互(某类环境下的特异优势,7.4 节的管理区逻辑);甚至抗逆育种的核心就是把"逆境下的基因型重排"作为选育信号。工程的要点是把 G×E 从"误差项"变成"设计项"——先测出它,再决定利用它还是消灭它。
图纸的另一侧——分子长什么样、怎么写成数据——是下一节的内容,也是药物线的开工准备。