第 4 章 · 评估策略 章节摘要:评估策略是 NAS 的"标尺",它决定候选架构的性能反馈有多准、多贵。本章先讲评估为何是 NAS 的成本主峰——每评估一个架构就是一次训练,然后按"精度换效率"的阶梯展开四类方法:完全训练(准但贵)、代理任务(小数据/少轮数/低分辨率)、权重共享(超网络一次训练评估所有子网)、零成本代理(不训练,直接用参数/梯度/信息流指标预测)。最后一节给出评估阶梯的组合使用方案。读完本章,你能为搜索过程设计一套"先粗筛、后精评"的评估流程。
章节摘要:评估策略是 NAS 的"标尺",它决定候选架构的性能反馈有多准、多贵。本章先讲评估为何是 NAS 的成本主峰——每评估一个架构就是一次训练,然后按"精度换效率"的阶梯展开四类方法:完全训练(准但贵)、代理任务(小数据/少轮数/低分辨率)、权重共享(超网络一次训练评估所有子网)、零成本代理(不训练,直接用参数/梯度/信息流指标预测)。最后一节给出评估阶梯的组合使用方案。读完本章,你能为搜索过程设计一套"先粗筛、后精评"的评估流程。
阅读完本章,你应当能够:
金句:评估精度与评估成本是同一枚硬币的两面——NAS 的绝大多数工程决策,本质上都是在为这枚硬币找平衡点。
这张全景图的骨架是一个"阶梯",它的形状值得琢磨。从上往下:完全训练(精度高、成本极高)→ 代理任务(精度中、成本中)→ 权重共享(精度低中、成本低)→ 零成本代理(精度低、成本极低),四档恰好构成一条从左下到右上的斜线——这就是评估策略的"定价曲线"。曲线的工程含义很直接:候选数量与评估档次必须反着配,几万候选配零成本、几百候选配代理/权重共享、几个候选配完全训练。图右侧的"粗筛阶梯"是这条曲线的落地形态,也是 4.6 节要展开的评估漏斗。读完全章后,你应该能闭着眼画出这条曲线,并在任意一个"候选数 × 预算"组合下指出该用哪档评估。
评估如何指导搜索方向、决定搜索效率、影响最终性能;计算成本、精度效率权衡、泛化偏差五大挑战从哪来。
架构采样-训练到收敛-验证集打分的流程;精度最高但成本爆炸,只在小型搜索空间、高精度场景与最终定稿阶段使用。
用简化数据集、缩短训练轮数、降低分辨率、更简单任务四招换效率;核心风险是代理任务与目标任务的相关性断裂。
超网络把全部候选装进一个网络,路径采样训练共享权重,子网直接取权重评估;ENAS/DARTS 靠它把成本降两个数量级,但 gap 与权重干扰是代价。
不训练只看架构:参数量/FLOPs 类复杂度指标,SNIP/Fisher/SynFlow/GraSP 类初始化指标;用相关性与多指标组合控制偏差。
四类策略的精度-效率矩阵,给出"零成本粗筛→权重共享/代理精筛→完全训练定稿"的混合方案,以及按预算与精度要求选型的决策表。
4.1 为什么评估难(成本主峰 + 五大挑战) │ ├──► 4.2 完全训练(精度上限) ├──► 4.3 代理任务(数据/轮数换效率) ├──► 4.4 权重共享(结构共享换效率) └──► 4.5 零成本(不训练直接预测) │ ▼ 4.6 阶梯组合(按预算组装)
四类方法沿"精度降、效率升"排列,最后一节把它们拼成一条流水线——这也是工程上唯一现实的做法。需要特别提醒:这章的阅读顺序与重要性排序并不一致。4.2 完全训练在工程里用得最少,但它定义了"真值";4.5 零成本代理用得最多,但它必须靠 4.2 校准。如果你只想抓重点,4.4(权重共享)和 4.6(阶梯组合)是理解高效 NAS 的两把钥匙——DARTS、ENAS 的搜索效率全部建立在权重共享上,而任何预算有限的实验最后都会收敛到 4.6 的漏斗方案。
评估策略是 NAS 的"经济学"章节——讲的是怎么用预算买信息。阅读时建议始终带着成本视角:每个方法都问"一次评估多少钱、能买到多少可信度"。四类方法的对比表(4.6)是全章的地图,先看它再回读细节,比顺序读更能抓住结构。另外,第 4.1 节的相关性验收、第 4.6 节的"定稿必须完全训练"是本教程反复强调的两条纪律,值得在阅读时特意标注——它们是防 NAS 翻车的第一道防线。