4.1 评估策略的必要性与挑战


文档摘要

4.1 评估策略的必要性与挑战 本节摘要:评估策略是 NAS 的"标尺"与"裁判",它决定候选架构的性能反馈有多准、多贵。本节讲清评估的四大作用——指导搜索方向、决定搜索效率、影响最终性能、连接实际应用,再拆解五大挑战:计算成本高、精度效率权衡、泛化偏差、空间适配性、超参数敏感,为第 4 章后续四类评估方法的展开立好框架。 读完这一节你会得到 阅读完本节,你应当能够: 说出评估策略在 NAS 里的四个作用,并各配一个例子 解释"评估是 NAS 的成本主峰"这句话的含义 列出评估策略面临的五大挑战,说明每一条怎么影响搜索 理解"评估精度-评估效率"权衡为什么是 NAS 的核心矛盾 一、问题与直觉:评估是 NAS 最贵的环节 NAS 的搜索循环很简单:搜一个架构,评估它,根据分数调整方向。

4.1 评估策略的必要性与挑战

本节摘要:评估策略是 NAS 的"标尺"与"裁判",它决定候选架构的性能反馈有多准、多贵。本节讲清评估的四大作用——指导搜索方向、决定搜索效率、影响最终性能、连接实际应用,再拆解五大挑战:计算成本高、精度效率权衡、泛化偏差、空间适配性、超参数敏感,为第 4 章后续四类评估方法的展开立好框架。

读完这一节你会得到

阅读完本节,你应当能够:

  1. 说出评估策略在 NAS 里的四个作用,并各配一个例子
  2. 解释"评估是 NAS 的成本主峰"这句话的含义
  3. 列出评估策略面临的五大挑战,说明每一条怎么影响搜索
  4. 理解"评估精度-评估效率"权衡为什么是 NAS 的核心矛盾

一、问题与直觉:评估是 NAS 最贵的环节

NAS 的搜索循环很简单:搜一个架构,评估它,根据分数调整方向。这个循环里,搜索策略的"聪明"程度决定方向调整得好不好,但真正吃预算的是评估——每评估一个架构,就是一次完整的训练。搜 1000 个架构,就是 1000 次训练。评估策略选得贵,整个 NAS 的成本直接爆炸;选得省,又可能把好架构误判成差架构。

SOURCE 对评估策略的定位是"生命线"。没有评估,搜索算法不知道往哪走——它收到的唯一反馈就是评估分数。评估不准,搜索就被错误信号带着跑;评估太贵,搜索就只能在极小的预算里打转。评估的"准"与"快"之间的矛盾,是 NAS 所有工程决策的核心矛盾。

更隐蔽的问题是"评估偏差"。完全训练最准,但贵;代理任务便宜,但不一定准——代理任务上的好架构,搬到真实任务上可能平庸。这个"评估分数与真实性能脱节"的问题(即评估偏差),会让搜索算法在一个错误的排行榜上挑冠军。评估策略的工程价值,一半在"怎么算得快",另一半在"怎么算得准且偏差可控"。

二、核心原理:四大作用与五大挑战

作用一:指导搜索方向。评估分数是搜索算法的导航信号。进化算法靠适应度排序挑父母,强化学习靠奖励更新控制器,贝叶斯优化靠分数拟合代理模型——所有策略的"学习"都建立在评估分数上。没有评估,NAS 就是随机瞎逛。

作用二:决定搜索效率。评估成本直接决定搜索预算能支撑多少次评估。完全训练下,一次搜索可能只能评估几十个架构;权重共享下,能评估上万个。评估策略的效率,几乎就是 NAS 的可扩展性。

作用三:影响最终性能。评估不准导致"次优架构当选"。如果评估分数与真实性能的相关性差,搜索算法精心挑选出来的冠军,完全训练后可能还不如随机采样的中位数。评估的准确性是 NAS 结果质量的底线。

作用四:连接实际应用。评估在特定任务、特定数据集上进行,这让 NAS 天然面向应用——搜出来的架构是针对目标任务调优过的,不是"通用最优"。评估策略其实在定义"什么才算好",这个定义应该来自真实应用需求。

挑战一:计算成本高昂。完全训练最准确但最贵,大规模搜索空间里对每个架构都完全训练不可行。这是评估问题的原点。

挑战二:精度与效率的权衡。高精度评估(完全训练)效率低,高效率评估(代理/零成本)精度低。评估策略设计的全部学问,都是在这个权衡上找平衡点。

挑战三:泛化偏差。代理任务、权重共享的评估结果可能与目标任务的真实性能有偏差。评估方法本身可能过拟合到代理任务的特定设置,导致"评估排行榜"与"真实排行榜"不一致。

挑战四:空间适配性。小搜索空间还能承受完全训练,超大空间必须换高效评估。评估策略要跟搜索空间的大小匹配,不能一套方法打天下。

挑战五:超参数敏感。代理任务评估里,数据集大小、训练轮数、输入分辨率都影响评估可靠性。评估方法自己的超参数没调好,评估结果就不可信。

上图是评估在 NAS 循环中的位置:它是搜索算法与架构之间的唯一反馈通道。评估的"准"与"快"直接决定这条通道的质量。

三、工程实践要点:评估策略设计的三条纪律

纪律一:先测相关性,再信评估。正式大规模搜索之前,先做一个小实验:随机采样 20-30 个架构,用拟采用的评估策略打分,再完全训练打分,算两组分数的相关性(Spearman 或 Pearson)。相关性低(比如低于 0.5),这个评估策略不能用——它会把搜索引向错误方向。SOURCE 在 4.5 节讲零成本代理时也强调了这个"相关性分析"的步骤,它是所有评估策略的通用验收方法。

纪律二:评估偏差要显式管理。完全训练是"真值",其余全是"近似"。近似必然有偏差,关键是知道偏差的形态:代理任务偏差通常在"代理任务与目标任务越像越小";权重共享偏差在"与独立训练的差距"。用"评估阶梯"控制偏差——粗筛阶段容忍偏差,精筛阶段逼近真值,最终定稿必须回到完全训练。

纪律三:评估策略与搜索策略一起选。评估成本改变搜索策略的可行域:评估便宜(权重共享),进化/随机这类"评估密集"策略变得可行;评估贵(完全训练),必须上贝叶斯优化。第 3.7 节说"评估成本是第一决策变量",评估策略的选型几乎决定了搜索策略的选型。

评估维度 要问的问题 对应挑战
成本 一次评估花多少 GPU 小时? 挑战一
精度 分数与真实性能相关性多高? 挑战二、三
稳定性 同架构多次评估波动多大? 挑战五
适配性 搜索空间大小撑得住吗? 挑战四

⚠️ 常见坑:直接用代理任务跑完整个搜索,连最终架构也不完全训练复验。评估偏差在粗筛阶段可以容忍,但最终选出的冠军必须接受完全训练的"终极裁决",否则上线的模型性能可能是幻觉。

💡 关键直觉:评估策略是在"花钱买信息"。完全训练是花大钱买高精度信息,零成本代理是花小钱买噪声信息。NAS 的工程艺术,就是知道什么阶段该买什么档次的信息——先噪声粗筛,再中精度精筛,最后高精度定稿。

四、评估策略的机制细节:偏差从哪里来

评估偏差的三个来源

理解了"评估是花钱买信息",再看偏差从哪来。第一个来源是代理近似:代理任务、权重共享、零成本代理都不是"真实评估",它们的分数与完全训练分数之间的系统偏差,就是代理近似的代价。第二个来源是评估噪声:随机种子、数据划分、训练超参数都会让同架构的两次评估结果波动,波动越大,排名越不可信——这在第 4.2 节会展开。第三个来源是指标错配:评估用的指标与真实目标不一致(比如用分类准确率评估检测任务),分数"准"了也没用——这在第 5.3 节会展开。三个来源里,代理近似是"故意"的(省钱换来的),噪声是"意外"的(控制实验设计能压),指标错配是"方向性"的(设计目标时就要定)。

评估一致性与可区分性:两个被低估的指标

SOURCe 在 4.3 节把"一致性"和"可区分性"列为评估策略的设计考虑,这两个词值得单独解读。一致性指"同样的架构、同样的评估,多次跑分数稳定"——它衡量评估的抗噪声能力。可区分性指"不同的架构,评估分数能拉开差距"——它衡量评估的分辨能力。两者有张力:为了可区分性加评估变换(第 3.3 节提过的奖励变换同理),可能放大噪声伤害一致性;为了一致性用完全训练,又牺牲效率。工程上的验收标准:相关性分析(第 4.1 节纪律一)同时检验了这两者——相关性高说明既一致又有区分度。

评估策略的"自证陷阱"

一个容易忽略的问题:评估策略自己也需要被评估——你怎么知道"代理分数靠谱"?答案是相关性实验,但相关性实验本身又依赖一组"完全训练真值"。这就形成了一个循环:要验证代理,得先有完全训练的数据;要省预算,又不能用完全训练。破解的办法是分阶段验证:先在少量架构(20-50 个)上做一轮"代理 vs 完全训练"的相关性实验,这笔投入是一次性的、可控的,换来的却是整个搜索阶段的评估可信度。SOURCe 在 4.5 节零成本代理部分反复强调相关性分析,正是这个"先小规模自证、再大规模使用"的思路。

一个类比:评估策略像买股票的信息服务

评估策略的本质是"信息服务商"——它提供"这个架构值不值得投钱"的情报。完全训练是买"内幕级情报"(贵但准),零成本代理是买"免费小道消息"(便宜但噪声大)。工程决策就是给不同阶段配不同档的情报:粗筛阶段小道消息够用(反正要大量淘汰),定稿阶段必须内幕级情报(一个错判毁掉整个搜索)。记住这个类比,第 4.6 节的评估阶梯就顺理成章了——它就是把"情报采购"分阶段外包的流程设计。

本章的组织预览

接下来的四节将逐一展开四类评估方法,顺序恰好是"精度从高到低、效率从低到高":4.2 完全训练是"真值锚点",4.3 代理任务第一次用"缩小任务"换效率,4.4 权重共享用"结构共享"换效率,4.5 零成本代理干脆"不训练"直接预测。每节都会标注它相对真值的偏差来源和适用边界——这样读到最后,你手里就有一张完整的"评估定价表",能按任何预算组合出合适的评估方案。

  • 四大作用:指导方向、决定效率、影响性能、连接应用
  • 成本主峰:评估是 NAS 预算的最大去向,一次评估=一次训练
  • 五大挑战:成本高、精度效率权衡、泛化偏差、空间适配、超参敏感
  • 相关性验收:先用小规模实验测评估分数与真值的相关性
  • 偏差显式管理:粗筛容忍、精筛逼近、定稿回完全训练
  • 评估决定策略:评估成本是第一决策变量,反作用于搜索策略选型

下一节看评估的"真值"——完全训练评估,以及它为什么只能用在最后阶段。

图4-1 NAS 方法训练开销透视(对数轴,GPU 天)

图4-1 NAS 方法训练开销透视(对数轴,GPU 天)


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U