4.2 完全训练评估


文档摘要

4.2 完全训练评估 本节摘要:完全训练评估是对每个候选架构从头训练到收敛、再在验证集上打分的方法——它是 NAS 所有评估策略里的"真值基准"。本节讲清"采样→初始化→训练→评估"四步流程,分析其精度最高、与实际部署一致、无需额外假设的三个优点,以及计算成本爆炸、搜索效率低下、难扩展三个致命缺点,最后给出它的四个适用场景。 学习目标 阅读完本节,你应当能够: 复述完全训练评估的四步流程 说出完全训练评估的三个优点与三个缺点 判断在哪些场景下完全训练评估仍然值得使用 理解"完全训练是真值,其余评估是近似"的坐标系 一、问题与直觉:最笨的方法为什么还是"标尺" 完全训练评估朴素得不像话:采样一个架构,从头训练到收敛,验证集上打一分,完事。

4.2 完全训练评估

本节摘要:完全训练评估是对每个候选架构从头训练到收敛、再在验证集上打分的方法——它是 NAS 所有评估策略里的"真值基准"。本节讲清"采样→初始化→训练→评估"四步流程,分析其精度最高、与实际部署一致、无需额外假设的三个优点,以及计算成本爆炸、搜索效率低下、难扩展三个致命缺点,最后给出它的四个适用场景。

学习目标

阅读完本节,你应当能够:

  1. 复述完全训练评估的四步流程
  2. 说出完全训练评估的三个优点与三个缺点
  3. 判断在哪些场景下完全训练评估仍然值得使用
  4. 理解"完全训练是真值,其余评估是近似"的坐标系

一、问题与直觉:最笨的方法为什么还是"标尺"

完全训练评估朴素得不像话:采样一个架构,从头训练到收敛,验证集上打一分,完事。没有任何代理、没有共享、没有预测,就是最直白的"是骡子是马拉出来遛遛"。

可就是这么笨的方法,在 NAS 里地位特殊——它是唯一不需要额外假设的评估方法。代理任务假设"小任务上的表现能代表大任务",权重共享假设"共享权重的表现能代表独立训练",零成本代理假设"某些架构属性与性能相关"——这些全是假设,都可能错。完全训练没有假设,它的分数就是架构在目标任务上的真实表现。正因为如此,SOURCE 明确把它定位为"最直接、最准确、理论上最准确的评估方法",是所有近似评估的"真值基准"。

但代价也残酷:一个候选架构的完整训练,动辄几百 GPU 小时。搜索空间里有一万个候选,完全训练一万次,预算直接天文数字。这就是为什么完全训练虽然最准,却不能当主评估策略用——它是"标尺",不是"天平"。工程上的正确姿势是:平时用便宜的近似评估,关键时刻(比如最终定稿)把完全训练请出来做裁决。

二、核心原理:流程、优点与缺点

四步流程。架构采样——从搜索空间取一个候选架构。模型初始化——按架构初始化参数。完全训练——用训练集按预设优化器与学习率策略训练,直到验证集性能不再显著提升或达到预设轮数。性能评估——在验证集(或测试集)上打分,作为该架构的评估结果。

三个优点。评估精度高——直接反映候选架构在目标任务上的真实性能,充分训练后模型学到数据特征,分数可靠。与实际部署一致——评估流程与上线流程完全相同,评估分数和部署后性能高度相关,没有"评估一个样、部署一个样"的落差。无需额外假设——不引入代理模型、共享权重等近似,评估结果有坚实的理论基础。

三个缺点。计算成本极高——复杂任务、大搜索空间下,对每个候选完整训练的成本不可承受。搜索效率低下——训练耗时导致搜索极慢,有限时间资源下探索不了多少架构。难以扩展——数据集越大、任务越复杂,完全训练的成本越失控,很难用于大规模 NAS。

维度 完全训练评估的表现
评估精度 最高(真实性能)
计算成本 最高(完整训练)
搜索效率 最低(评估太慢)
假设依赖 无(不引入近似)
部署一致性 最强(流程相同)

三、工程实践要点:完全训练的四个正确用法

用法一:小型搜索空间。当搜索空间小(比如只搜网络深度、滤波器数量这类少量参数),候选数量有限,完全训练的总成本还能接受。这时完全训练是可行的主评估策略,省掉代理假设的麻烦。

用法二:对精度要求极高的场景。医疗诊断、自动驾驶这类场景,模型性能的下限至关重要,值得为精度付出评估成本。SOURCE 明确提到这类场景"为了追求极致的性能,可以考虑使用完全训练评估来确保评估结果的准确性"。

用法三:作为基准评估方法。完全训练是所有近似评估的"校准真值"——验证代理任务评估、权重共享评估、零成本代理是否可靠,都要拿它们的分数和完全训练分数对比。第 4.1 节说的"相关性验收实验"就是这个用途。

用法四:搜索的最后阶段。这是工程上最标准的用法。搜索早期用零成本代理/权重共享快速粗筛,把候选从一万砍到几十;最后对这几个幸存者做完全训练,选出最终冠军。完全训练花在刀刃上,既保住准确性又控制总成本。

实践注意。完全训练也不是"完全一致"的——随机种子、数据划分、训练超参数都会带来评估噪声。同一个架构,换种子跑两次,分数可能差几个点。SOURCE 在第 4.1 节把"评估一致性"列为设计考虑因素:完全训练评估也要控制随机种子、统一数据划分、固定训练协议,让不同架构的分数可比。

⚠️ 常见坑:在大型搜索空间里拿完全训练当主评估策略。一万个候选 × 每次 200 GPU 小时,一次搜索要几百万 GPU 小时——这不是预算问题,是可行性问题。完全训练是"定稿裁决",不是"批量筛选"。

💡 关键直觉:完全训练评估的意义不在"常用",而在"可信"。它是 NAS 里唯一的真值锚点——其他所有评估策略的误差,都是相对这个锚点定义的。评估策略的研发史,本质上是在"如何花更少的钱逼近这个锚点"。

四、完全训练的机制细节与工程化

评估噪声:完全训练"准"但"不绝对准"

完全训练评估最准,但要注意"准"的相对性——它不是没有噪声。同一个架构,换随机种子重训一次,验证集分数可能差零点几个百分点;换数据划分,差异可能更大。SOURCe 在第 4.1 节把"一致性"列为评估设计因素,正是承认这个事实。工程上的应对是控制变量:所有候选用同一套数据划分、同一套超参数、同一种初始化种子策略(固定种子或几种子的平均),让分数差异尽量只来自"架构差异"。否则评估噪声会淹掉架构之间的真实差距,搜索算法在噪声上做决策,跟掷骰子差不多。

训练协议:完全训练不是"随便训"

"完全训练到收敛"听起来简单,工程上有一堆协议要定:优化器(SGD 还是 Adam)、学习率调度(余弦退火还是阶梯下降)、批量大小、正则化(权重衰减、Dropout、Label Smoothing)、训练轮数上限。SOURCe 在第 4.2 节的流程里写了"采用预设的优化算法、学习率策略等训练模型"——这个"预设"正是关键:所有候选必须共用同一套训练协议,任何候选都不许"特调"。一旦允许给某个架构开小灶调学习率,评估就不是在比架构,而是在比"谁被调得多"。

完全训练在 NAS 流程中的三个插入点

第一个插入点:搜索前的小规模相关性实验(20-50 个架构完全训练,校准代理评估)。第二个插入点:搜索后的最终定稿(冠军架构完全训练,拿到可信性能)。第三个插入点:关键节点的抽查(搜索中途每隔一段时间,抽 3-5 个当前候选完全训练,验证代理评估没有系统性漂移)。三个插入点里,第一个和第二个是必须的,第三个是进阶的防漂移手段——它的成本可控,价值在于防止"搜索跑到最后发现代理评估早就偏了"。

完全训练的"性价比"账

完全训练不是"贵"或者"便宜"的定性问题,而是"花在刀刃上"的定量问题。一次完全训练的成本是固定的(比如 200 GPU 小时),它的价值取决于它服务的目的:给 1 个候选定稿,价值高(这是最终决策的依据);给 50 个候选定稿,价值被稀释(前 49 个会被淘汰);给 5000 个候选定稿,纯属浪费(99% 白训)。SOURCe 反复提醒完全训练"难以应用到大规模 NAS 搜索",其本质不是成本高,而是"用在了不该用的规模上"。把完全训练的总预算控制在搜索总预算的 5-20%,是工程上的经验区间。

五、FAQ:完全训练评估的常见疑问

完全训练和"训练到底"是同一个意思吗?

不是。"完全训练"在 NAS 语境里指"按预设协议训练到收敛或固定轮数","训练到底"是个模糊说法。SOURCe 的定义是"直到模型在验证集上的性能不再显著提升或达到预设的训练轮数"——注意它给了两条终止条件,实际工程里通常用固定轮数(为了公平)或早停(为了省钱)。关键是"预设"两个字:所有候选共用同一套终止逻辑,不能有的训练 100 轮、有的训练 300 轮。

完全训练分数能直接决定架构优劣吗?

在"同一套协议、同一套数据划分"的前提下,可以。但如果协议不统一——比如给某些架构调了学习率——分数差距就不能全归因于架构。这解释了为什么 SOURCe 强调完全训练"与实际应用场景一致":它的可信度建立在"评估流程就是部署流程"上,流程一旦不统一,可信度就打了折扣。

完全训练只用于 NAS 吗?

不是,它的适用范围更广——任何需要"真实性能"的场景都在用:模型选型(几个候选架构里挑一个)、论文报告(最终模型的性能数字)、超参验证(确认调参确实有效)。NAS 只是把完全训练当成"真值锚点"来用,这个概念本身的地位不依赖 NAS。理解这一点,就能明白为什么完全训练虽然是"最笨"的评估,却是整个机器学习里最被信任的评估。

完全训练和其他评估的分数能直接对比吗?

能,但必须"对齐协议"。代理任务、权重共享、零成本代理的分数与完全训练分数之间,只有相关性关系,没有等价关系——0.85 的代理分数不等于 0.85 的完全训练分数。对比时必须说明"这是哪个评估下得到的分数",并且最终的横向对比(论文、汇报、模型选型)永远以完全训练分数为准。这条纪律在第 4.6 节会再次强调。

  • 四步流程:采样→初始化→训练到收敛→验证集打分
  • 精度最高:分数就是真实性能,无近似假设
  • 部署一致:评估流程与上线流程相同,无评估-部署落差
  • 成本爆炸:一个候选一次完整训练,大规模搜索不可行
  • 四大用法:小空间、高精度要求、基准校准、最后定稿
  • 评估噪声要控:固定随机种子、数据划分、训练协议
  • 真值锚点:所有近似评估都相对它定义误差

下一节看代理任务评估——第一档"用钱换效率"的评估策略。

图4-2 完全训练与代理评估的精度-算力曲线对比

图4-2 完全训练与代理评估的精度-算力曲线对比


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U