4.6 评估策略对比与选择


文档摘要

4.6 评估策略对比与选择 本节摘要:把完全训练、代理任务、权重共享、零成本代理四类评估策略摆上对比桌。本节给出精度-效率矩阵与按"搜索空间规模、计算资源、精度要求、任务复杂度、效率要求"五因素选型的决策表,重点讲"评估阶梯"的组装方案——零成本粗筛、权重共享/代理精筛、完全训练定稿,并给出评估全流程的验收纪律。 本节要回答的问题 阅读完本节,你应当能够: 用精度-效率矩阵定位四类评估策略 按五因素决策表为自己的 NAS 实验选出评估策略组合 组装"零成本粗筛→精筛→完全训练定稿"的评估阶梯 说出评估全流程的验收纪律与常见失败模式 一、问题与直觉:没有最好的评估,只有最值的组合 前五节把四类评估策略讲完了,现在要回答工程问题:我的 NAS 实验,到底用什么评估?

4.6 评估策略对比与选择

本节摘要:把完全训练、代理任务、权重共享、零成本代理四类评估策略摆上对比桌。本节给出精度-效率矩阵与按"搜索空间规模、计算资源、精度要求、任务复杂度、效率要求"五因素选型的决策表,重点讲"评估阶梯"的组装方案——零成本粗筛、权重共享/代理精筛、完全训练定稿,并给出评估全流程的验收纪律。

本节要回答的问题

阅读完本节,你应当能够:

  1. 用精度-效率矩阵定位四类评估策略
  2. 按五因素决策表为自己的 NAS 实验选出评估策略组合
  3. 组装"零成本粗筛→精筛→完全训练定稿"的评估阶梯
  4. 说出评估全流程的验收纪律与常见失败模式

一、问题与直觉:没有最好的评估,只有最值的组合

前五节把四类评估策略讲完了,现在要回答工程问题:我的 NAS 实验,到底用什么评估?

先纠正一个常见误解:很多人想在四类里"选一个最好的"。正确答案是——几乎从不需要单独用某一类。完全训练太贵不能全程用,零成本代理太糙不能定稿用。工程现实永远是组合:在搜索的不同阶段,用不同档位的评估。SOURCE 在 4.6 节总结里直接给了组合示例:"先使用零成本代理快速筛选出极少数有潜力的架构,然后使用基于代理任务的评估进行进一步评估,最后使用完全训练评估确定最优架构"——这就是评估阶梯的标准答案。

组合的逻辑可以概括成一句话:评估成本必须与候选数量成反比。候选多的时候(几万到几百万),只能用最便宜的评估粗筛;候选少的时候(几十到几个),才值得用最贵的评估精评。评估策略选型不是"选哪个",而是"每一档漏斗用哪个"。

二、核心原理:精度-效率矩阵与五因素决策

精度-效率矩阵。把四类策略按"评估精度"和"评估效率"两个轴摆开:

评估策略 评估精度 评估效率 计算成本 典型使用阶段
完全训练 最终定稿
代理任务 精筛
权重共享 低-中 精筛(配合策略)
零成本代理 极高 极低 初始粗筛

读表要点:精度与效率呈严格反比,这是评估策略世界的铁律。权重共享的效率比代理任务高一档(子网评估≈一次前向),但精度受 gap 拖累;零成本代理效率登顶,精度垫底。四个策略刚好构成一个"精度降、效率升"的连续谱——评估阶梯就是把谱上的点按顺序踩一遍。

五因素决策。搜索空间规模——空间越大越要上高效评估(权重共享/零成本),小空间可以接受完全训练。计算资源——资源紧时全程低档评估,资源足时高档评估比例可以放大。评估精度要求——对精度要求高的场景(医疗、自动驾驶),精筛与定稿阶段绝不省。任务复杂度——任务越复杂,评估的"单次成本"越高,越要提早用粗筛砍量。搜索效率要求——赶时间就多用零成本,接受精度损失。

上图是评估阶梯的标准形态:漏斗从宽到窄,评估从便宜到贵。每级漏斗的"筛余率"(比如粗筛留 1%、精筛留 10%)决定总预算的分配。

组合变体。标准阶梯不是唯一方案。变体一:跳过零成本,直接从"权重共享粗筛 + 完全训练定稿"两级走——当搜索策略(如 DARTS)本身依赖权重共享时,评估策略要跟策略绑在一起。变体二:代理任务做粗筛、完全训练做定稿的两级组合,适合"空间不太大、不想引入权重共享干扰"的场景。变体三:所有候选都只跑代理任务、完全训练只跑最终冠军——预算最紧时的妥协方案,接受"次优冠军"的风险。

三、工程实践要点:评估全流程的验收纪律

纪律一:相关性贯穿始终。每一档评估上线前,都要先做相关性验收——该档评估的分数与更贵一档分数的排名相关性够不够高。粗筛相关性低,会漏掉真正的好架构;精筛相关性低,定稿的冠军可能是错的。SOURCE 反复强调的相关性分析,应该成为每级漏斗的标准动作。

纪律二:定稿必须完全训练。无论前面用了多少便宜评估,最终冠军必须经过完全训练的"终极裁决"。这不只是流程要求,也是"可复现性"要求——论文报告的性能必须是独立训练的,不是超网络分数、不是代理分数。

纪律三:记录每一级的误判率。粗筛后、精筛后各留一批"被淘汰的架构",用更贵的评估复验,统计被误杀的比例。误判率高说明这一级的代理配置太激进(相关性不够),要回调。这个反馈回路能让评估阶梯越用越稳。

常见失败模式。失败模式一:粗筛代理相关性低,好架构在漏斗第一级就被误杀,后面再准也救不回来。失败模式二:权重共享超网络训练不足(采样不均、轮数不够),gap 巨大,精筛排行榜失真。失败模式三:全程零成本代理直接选冠军——分数是"预判",不是"实测",上线必翻车。

⚠️ 常见坑:把"评估策略"和"搜索策略"分开独立选。DARTS 必须配权重共享评估,贝叶斯优化需要独立的评估接口——评估策略与搜索策略是咬合的齿轮,分开拍板会互相掣肘。

💡 关键直觉:评估策略的选型本质是"给不同规模的候选群定价"——候选越多,每个候选的评估单价必须越低。评估阶梯不是四种方法,而是"单价递减、规模递增"的定价策略。

四、评估阶梯的机制细节与预算分配

三级漏斗的预算分配原则

评估阶梯三级各有定位,预算分配的原则是"前紧后松"还是"前松后紧"?工程经验是:粗筛级(零成本)几乎不花钱,可以筛到极宽;精筛级(代理/权重共享)花中等预算,把候选砍到几十个;定稿级(完全训练)花大头预算,但只服务个位数候选。一个具体的预算示例:总预算 1000 GPU 小时,零成本粗筛花 10 小时,代理精筛花 100 小时,完全训练定稿花 800 小时(重训最终架构 + 复验几个亚军)。注意大头不是"评估候选",而是"定稿重训"——这符合 SOURCe 反复强调的"最终性能必须来自完全训练"。

各级漏斗的筛余率怎么定

筛余率(本级筛选后剩余比例)决定了每级漏斗的宽度。经验区间:零成本粗筛筛余 1-10%(从几万砍到几百);代理/权重共享精筛筛余 10-30%(从几百砍到几十);完全训练定稿选出 1-3 个。筛余率太小,误杀风险高;太大,下一级预算扛不住。调整依据是相关性:相关性高(排名可信)可以大胆筛,相关性低就保守一点。SOURCe 在 4.6 节给的组合示例正是"零成本筛极少数 → 代理评估进一步 → 完全训练确定最优"——三级各自的比例要靠相关性实验校准,没有放之四海的标准值。

评估阶梯与搜索策略的接口

评估阶梯不是孤立流程,它必须对接搜索策略(第 3 章)。接口的规则是"搜索策略在某一档评估上工作,就该用这一档的分数做决策"——贝叶斯优化用零成本/代理分数拟合代理模型,DARTS 用权重共享分数做双层优化,进化用当前档评估分数做适应度排序。如果搜索策略已经收敛出候选,再把这些候选送进下一级更贵的评估重排,就形成了"搜索-评估交替"的完整流水线。注意"重排"可能改变搜索结果——上一级冠军在下一级可能掉队,这是正常的,因为更贵的评估更可信。别把"换档后排名变了"当 bug,它是评估阶梯存在的意义。

一个完整的评估阶梯案例

假设要在 CIFAR-10 上用 Cell 空间搜 28 次层架构,预算约 2000 GPU 小时。第一步:随机采样 20000 个 Cell 结构,用 SynFlow + 参数量组合打分,保留 400 个(筛余 2%)。第二步:400 个进权重共享超网络评估,按共享分数取前 40 个。第三步:40 个跑代理任务(50 epoch + 25% 数据),取前 8 个。第四步:8 个完全训练到收敛,选冠军。第五步:冠军 + 亚军完全训练复验(换种子),确认稳定后报告。整个流程里,零成本粗筛几乎免费,完全训练只用在最后 10 个架构上——这就是"把最贵的评估留给最少的候选"的完整演示。

五、FAQ:评估策略选型的常见疑问

评估策略选型和搜索策略选型谁先谁后?

评估策略先。因为评估成本决定搜索策略的可行域(第 3.7 节已经论证过"评估成本是第一决策变量")。正确的顺序是:先定评估阶梯(每一级用什么、各花多少预算),再根据评估成本选搜索策略。先选搜索策略再补评估,很容易出现"策略很聪明但评估喂不起"的错配。本教程第 3 章末尾和第 4 章都在强调这个顺序,因为它是工程上最常被颠倒的一步。

"评估越便宜越好"对吗?

不对。评估策略的目标是"在预算内拿到足够可信的分数",不是"越便宜越好"。零成本代理最便宜但最不可信,纯用它会选错架构;完全训练最可信但最贵,全程用会预算爆炸。SOURCe 在第 4.6 节的结论是"选择合适的评估策略需要综合考虑"——综合的维度包括空间规模、资源、精度要求、任务复杂度、效率要求,唯独不包括"越便宜越好"。选型的本质是"在可信度与成本之间找平衡点",不是"在便宜里挑最便宜的"。

评估阶梯每一级都要跑满吗?

不用。阶梯是"能力清单"不是"必做清单"——按预算和需求裁剪。预算很紧可以砍掉中间一级(零成本粗筛 + 完全训练定稿的两级版);空间很小可以跳过零成本(候选本来就不多);搜索策略自带评估(DARTS 的权重共享)时,评估阶梯要跟策略的评估耦合设计。SOURCe 在 4.6 节给的组合示例是"通常需要结合多种评估策略","通常"两字说明组合方式有弹性,不是固定三级。

怎么判断评估策略选得"够好"?

看三个信号。第一,相关性实验通过(各级评估与完全训练的秩相关达标);第二,定稿复验稳定(冠军架构换种子重训,性能没有大跳水);第三,误杀率可接受(第 4.6 节纪律三:抽查被淘汰的架构,误杀的好架构比例低)。三个信号都正常,评估策略就是合格的。反之,任何一个信号亮红灯,都要回查评估配置——评估策略的"好"不是一次配置定终身,而是靠持续回检维持的。

  • 精度-效率矩阵:四类策略构成"精度降、效率升"的连续谱
  • 五因素决策:空间规模、计算资源、精度要求、任务复杂度、效率要求
  • 评估阶梯:零成本粗筛→权重共享/代理精筛→完全训练定稿
  • 组合变体:两级、三级按预算灵活组装
  • 相关性贯穿:每级漏斗上线前做相关性验收
  • 定稿必须完全训练:报告性能必须是独立训练结果
  • 误判率回馈:统计每级误杀比例,回调代理配置
  • 定价视角:评估策略是给候选群定单价的策略

下一章进入高级主题——约束、特定数据/任务、理论分析与伦理。

图4-5 评估策略在保真度与成本上的定位图

图4-5 评估策略在保真度与成本上的定位图


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U