4.1 评估策略的必要性与挑战 本节摘要:评估策略是 NAS 的"标尺"与"裁判",它决定候选架构的性能反馈有多准、多贵。本节讲清评估的四大作用——指导搜索方向、决定搜索效率、影响最终性能、连接实际应用,再拆解五大挑战:计算成本高、精度效率权衡、泛化偏差、空间适配性、超参数敏感,为第 4 章后续四类评估方法的展开立好框架。 读完这一节你会得到 阅读完本节,你应当能够: 说出评估策略在 NAS 里的四个作用,并各配一个例子 解释"评估是 NAS 的成本主峰"这句话的含义 列出评估策略面临的五大挑战,说明每一条怎么影响搜索 理解"评估精度-评估效率"权衡为什么是 NAS 的核心矛盾 一、问题与直觉:评估是 NAS 最贵的环节 NAS 的搜索循环很简单:搜一个架构,评估它,根据分数调整方向。
本节摘要:评估策略是 NAS 的"标尺"与"裁判",它决定候选架构的性能反馈有多准、多贵。本节讲清评估的四大作用——指导搜索方向、决定搜索效率、影响最终性能、连接实际应用,再拆解五大挑战:计算成本高、精度效率权衡、泛化偏差、空间适配性、超参数敏感,为第 4 章后续四类评估方法的展开立好框架。
阅读完本节,你应当能够:
NAS 的搜索循环很简单:搜一个架构,评估它,根据分数调整方向。这个循环里,搜索策略的"聪明"程度决定方向调整得好不好,但真正吃预算的是评估——每评估一个架构,就是一次完整的训练。搜 1000 个架构,就是 1000 次训练。评估策略选得贵,整个 NAS 的成本直接爆炸;选得省,又可能把好架构误判成差架构。
SOURCE 对评估策略的定位是"生命线"。没有评估,搜索算法不知道往哪走——它收到的唯一反馈就是评估分数。评估不准,搜索就被错误信号带着跑;评估太贵,搜索就只能在极小的预算里打转。评估的"准"与"快"之间的矛盾,是 NAS 所有工程决策的核心矛盾。
更隐蔽的问题是"评估偏差"。完全训练最准,但贵;代理任务便宜,但不一定准——代理任务上的好架构,搬到真实任务上可能平庸。这个"评估分数与真实性能脱节"的问题(即评估偏差),会让搜索算法在一个错误的排行榜上挑冠军。评估策略的工程价值,一半在"怎么算得快",另一半在"怎么算得准且偏差可控"。
作用一:指导搜索方向。评估分数是搜索算法的导航信号。进化算法靠适应度排序挑父母,强化学习靠奖励更新控制器,贝叶斯优化靠分数拟合代理模型——所有策略的"学习"都建立在评估分数上。没有评估,NAS 就是随机瞎逛。
作用二:决定搜索效率。评估成本直接决定搜索预算能支撑多少次评估。完全训练下,一次搜索可能只能评估几十个架构;权重共享下,能评估上万个。评估策略的效率,几乎就是 NAS 的可扩展性。
作用三:影响最终性能。评估不准导致"次优架构当选"。如果评估分数与真实性能的相关性差,搜索算法精心挑选出来的冠军,完全训练后可能还不如随机采样的中位数。评估的准确性是 NAS 结果质量的底线。
作用四:连接实际应用。评估在特定任务、特定数据集上进行,这让 NAS 天然面向应用——搜出来的架构是针对目标任务调优过的,不是"通用最优"。评估策略其实在定义"什么才算好",这个定义应该来自真实应用需求。
挑战一:计算成本高昂。完全训练最准确但最贵,大规模搜索空间里对每个架构都完全训练不可行。这是评估问题的原点。
挑战二:精度与效率的权衡。高精度评估(完全训练)效率低,高效率评估(代理/零成本)精度低。评估策略设计的全部学问,都是在这个权衡上找平衡点。
挑战三:泛化偏差。代理任务、权重共享的评估结果可能与目标任务的真实性能有偏差。评估方法本身可能过拟合到代理任务的特定设置,导致"评估排行榜"与"真实排行榜"不一致。
挑战四:空间适配性。小搜索空间还能承受完全训练,超大空间必须换高效评估。评估策略要跟搜索空间的大小匹配,不能一套方法打天下。
挑战五:超参数敏感。代理任务评估里,数据集大小、训练轮数、输入分辨率都影响评估可靠性。评估方法自己的超参数没调好,评估结果就不可信。
上图是评估在 NAS 循环中的位置:它是搜索算法与架构之间的唯一反馈通道。评估的"准"与"快"直接决定这条通道的质量。
纪律一:先测相关性,再信评估。正式大规模搜索之前,先做一个小实验:随机采样 20-30 个架构,用拟采用的评估策略打分,再完全训练打分,算两组分数的相关性(Spearman 或 Pearson)。相关性低(比如低于 0.5),这个评估策略不能用——它会把搜索引向错误方向。SOURCE 在 4.5 节讲零成本代理时也强调了这个"相关性分析"的步骤,它是所有评估策略的通用验收方法。
纪律二:评估偏差要显式管理。完全训练是"真值",其余全是"近似"。近似必然有偏差,关键是知道偏差的形态:代理任务偏差通常在"代理任务与目标任务越像越小";权重共享偏差在"与独立训练的差距"。用"评估阶梯"控制偏差——粗筛阶段容忍偏差,精筛阶段逼近真值,最终定稿必须回到完全训练。
纪律三:评估策略与搜索策略一起选。评估成本改变搜索策略的可行域:评估便宜(权重共享),进化/随机这类"评估密集"策略变得可行;评估贵(完全训练),必须上贝叶斯优化。第 3.7 节说"评估成本是第一决策变量",评估策略的选型几乎决定了搜索策略的选型。
| 评估维度 | 要问的问题 | 对应挑战 |
|---|---|---|
| 成本 | 一次评估花多少 GPU 小时? | 挑战一 |
| 精度 | 分数与真实性能相关性多高? | 挑战二、三 |
| 稳定性 | 同架构多次评估波动多大? | 挑战五 |
| 适配性 | 搜索空间大小撑得住吗? | 挑战四 |
⚠️ 常见坑:直接用代理任务跑完整个搜索,连最终架构也不完全训练复验。评估偏差在粗筛阶段可以容忍,但最终选出的冠军必须接受完全训练的"终极裁决",否则上线的模型性能可能是幻觉。
💡 关键直觉:评估策略是在"花钱买信息"。完全训练是花大钱买高精度信息,零成本代理是花小钱买噪声信息。NAS 的工程艺术,就是知道什么阶段该买什么档次的信息——先噪声粗筛,再中精度精筛,最后高精度定稿。
理解了"评估是花钱买信息",再看偏差从哪来。第一个来源是代理近似:代理任务、权重共享、零成本代理都不是"真实评估",它们的分数与完全训练分数之间的系统偏差,就是代理近似的代价。第二个来源是评估噪声:随机种子、数据划分、训练超参数都会让同架构的两次评估结果波动,波动越大,排名越不可信——这在第 4.2 节会展开。第三个来源是指标错配:评估用的指标与真实目标不一致(比如用分类准确率评估检测任务),分数"准"了也没用——这在第 5.3 节会展开。三个来源里,代理近似是"故意"的(省钱换来的),噪声是"意外"的(控制实验设计能压),指标错配是"方向性"的(设计目标时就要定)。
SOURCe 在 4.3 节把"一致性"和"可区分性"列为评估策略的设计考虑,这两个词值得单独解读。一致性指"同样的架构、同样的评估,多次跑分数稳定"——它衡量评估的抗噪声能力。可区分性指"不同的架构,评估分数能拉开差距"——它衡量评估的分辨能力。两者有张力:为了可区分性加评估变换(第 3.3 节提过的奖励变换同理),可能放大噪声伤害一致性;为了一致性用完全训练,又牺牲效率。工程上的验收标准:相关性分析(第 4.1 节纪律一)同时检验了这两者——相关性高说明既一致又有区分度。
一个容易忽略的问题:评估策略自己也需要被评估——你怎么知道"代理分数靠谱"?答案是相关性实验,但相关性实验本身又依赖一组"完全训练真值"。这就形成了一个循环:要验证代理,得先有完全训练的数据;要省预算,又不能用完全训练。破解的办法是分阶段验证:先在少量架构(20-50 个)上做一轮"代理 vs 完全训练"的相关性实验,这笔投入是一次性的、可控的,换来的却是整个搜索阶段的评估可信度。SOURCe 在 4.5 节零成本代理部分反复强调相关性分析,正是这个"先小规模自证、再大规模使用"的思路。
评估策略的本质是"信息服务商"——它提供"这个架构值不值得投钱"的情报。完全训练是买"内幕级情报"(贵但准),零成本代理是买"免费小道消息"(便宜但噪声大)。工程决策就是给不同阶段配不同档的情报:粗筛阶段小道消息够用(反正要大量淘汰),定稿阶段必须内幕级情报(一个错判毁掉整个搜索)。记住这个类比,第 4.6 节的评估阶梯就顺理成章了——它就是把"情报采购"分阶段外包的流程设计。
接下来的四节将逐一展开四类评估方法,顺序恰好是"精度从高到低、效率从低到高":4.2 完全训练是"真值锚点",4.3 代理任务第一次用"缩小任务"换效率,4.4 权重共享用"结构共享"换效率,4.5 零成本代理干脆"不训练"直接预测。每节都会标注它相对真值的偏差来源和适用边界——这样读到最后,你手里就有一张完整的"评估定价表",能按任何预算组合出合适的评估方案。
下一节看评估的"真值"——完全训练评估,以及它为什么只能用在最后阶段。
