4.4 权重共享评估


文档摘要

4.4 权重共享评估 本节摘要:权重共享评估把所有候选架构"塞进"一个超网络共享权重——只训练一次超网络,所有子网直接取权重评估,成本降两个数量级。本节讲清"构建超网络→权重共享→路径采样训练→子网评估→选架构"五步流程,分析它效率极高但存在权重干扰、采样敏感、过度共享、独立训练差距四个代价,并解释 DARTS、ENAS 为什么都建立在它之上。 读完这一节你会得到 阅读完本节,你应当能够: 解释"超网络(Supernet)"的概念与"路径采样"的训练方式 复述权重共享评估的五步流程 说出权重共享评估的四个代价,特别是"与独立训练的 gap" 说明权重共享为什么是 DARTS、ENAS 等高效方法的共同地基 一、问题与直觉:与其训练一万个网络,不如训练一个"总装车间"

4.4 权重共享评估

本节摘要:权重共享评估把所有候选架构"塞进"一个超网络共享权重——只训练一次超网络,所有子网直接取权重评估,成本降两个数量级。本节讲清"构建超网络→权重共享→路径采样训练→子网评估→选架构"五步流程,分析它效率极高但存在权重干扰、采样敏感、过度共享、独立训练差距四个代价,并解释 DARTS、ENAS 为什么都建立在它之上。

读完这一节你会得到

阅读完本节,你应当能够:

  1. 解释"超网络(Supernet)"的概念与"路径采样"的训练方式
  2. 复述权重共享评估的五步流程
  3. 说出权重共享评估的四个代价,特别是"与独立训练的 gap"
  4. 说明权重共享为什么是 DARTS、ENAS 等高效方法的共同地基

一、问题与直觉:与其训练一万个网络,不如训练一个"总装车间"

代理任务已经省了不少,但每个候选还是要单独训练。权重共享走得更远:让所有候选架构共用一套权重。做法是构造一个超网络——把搜索空间里所有操作都"装"进去的大网络,每个候选架构是超网络里的一条路径(子网)。训练时随机采样路径,更新对应权重;评估时任何子网直接从超网络取权重跑前向,拿分数。训练一次超网络,评估所有子网——这就是 ENAS、DARTS 能把搜索成本压到单卡量级的原因。

SOURCE 在 4.4 节把权重共享称作"最常见的权重共享方法:单路径单次网络(One-Shot Network)"——所有候选嵌进一个超网络,共享超网络权重,训练时采样不同路径。这个设计的价值不只在评估本身:它把"评估"从"训练一个模型"变成了"从训练好的超网络里取一条路径",评估一个子网的成本从几百 GPU 小时降到几分钟。

代价也藏在这个"共享"里。所有子网共用权重,意味着没有一个子网是被"认真"训练过的——每个子网的权重都是"各种路径轮换训练"的混合产物。因此权重共享的分数与独立训练的分数之间有系统性偏差(gap):共享权重下表现好的架构,独立训练后不一定好。这是权重共享评估最大的方法论风险,也是第 3 章 DARTS 类方法"搜完必须重训"的根本原因。

二、核心原理:五步流程与四个代价

五步流程。构建超网络——按搜索空间把所有候选操作装进一个超大网络,每个候选对应超网络中的一条路径。权重共享——所有候选共享同一套权重参数,训练超网络时所有候选同时受益。超网络训练——用训练集训练超网络,训练时采用采样策略,每步随机采样一条路径(对应一个候选架构)更新权重。性能评估——在验证集上直接跑各候选路径,拿共享权重下的分数。架构选择——按分数挑最优架构。

代价一:权重干扰。不同路径共享权重,一个路径的训练会"打扰"其他路径——路径 A 学到的参数可能对路径 B 是噪声。SOURCe 明确指出"一个架构的训练可能会影响其他架构的性能,导致评估结果与真实性能存在偏差"。

代价二:采样策略敏感。超网络训练时怎么采样路径,直接决定评估质量。均匀采样所有路径,超网络"雨露均沾"但都学不精;倾向采样好路径,可能把超网络带偏。采样分布设计是权重共享评估最精细的旋钮。

代价三:过度共享。共享太狠,子网的表达能力被"平均"稀释——每个子网拿到的权重都不完全适合自己,评估分数系统性偏低,且架构之间的区分度变小。过度共享让"排行榜"变扁,搜索算法更难分清好坏。

代价四:与独立训练的 gap。这是终极代价。共享权重训练的子网性能,与独立从头训练的性能之间有差距——共享权重下 A 好于 B,独立训练后可能反超。正因为有这个 gap,DARTS 搜完的架构必须用独立训练重验,ENAS 的最终架构也要重新训练。

为什么它仍然是地基。四个代价听着吓人,但权重共享仍是 DARTS、ENAS、ProxylessNAS 的共同基础——因为它的效率优势太压倒性了。训练一个超网络的成本,约等于训练一个普通网络;而它能提供整个搜索空间所有候选的评估。评估一个子网的成本从"训练一个模型"降到"跑一次前向",这是三个数量级的差距。第 3 章的梯度优化方法如果离开权重共享,连续松弛就无从谈起——因为连续松弛的"混合输出"本身就要所有操作共享超网络权重。

维度 权重共享评估
评估效率 极高(子网评估≈一次前向)
计算成本 低(只训一个超网络)
评估精度 低-中(受干扰与 gap 影响)
核心风险 与独立训练的 gap
代表方法 ENAS、DARTS、ProxylessNAS

三、工程实践要点:权重共享的调优与防线

调优一:采样策略。均匀采样是默认,但对"好路径"倾斜采样能提高超网络在好区域的分辨力。实践上常用"均匀采样 + 按验证集分数加权"的混合——早期均匀铺路,后期向高分路径集中。注意别倾斜过度,否则超网络过拟合到少数路径,评估其他子网时失真。

调优二:控制过度共享。一个常见做法是"部分共享"——不是所有操作共享全部权重,而是共享卷积核权重、保留各路径的归一化层独立。归一化层参数少但影响大,让它们独立能显著减少路径干扰,成本只增一点。

防线:gap 验收。用权重共享评估完成搜索后,把选出的架构独立训练,对比共享权重分数与独立训练分数的关系。如果"共享分数最高的架构"独立训练后不是最好,说明超网络训练有问题(采样偏了、训练轮数不够、干扰太重),需要回头调。

适用边界。权重共享评估在 Cell 空间(第 2 章)上最顺手——Cell 小、路径结构规整,超网络容易构造。换到复杂的异质空间(不同阶段结构差异大),超网络难构造、干扰更严重。空间越规整,权重共享越靠谱。

⚠️ 常见坑:拿超网络的共享权重分数直接当最终架构的性能汇报。共享分数与独立训练分数之间的 gap 可能巨大——这正是 DARTS 被反复批评的"gapsing"问题。正确的流程永远是:超网络选架构,独立训练定性能。

💡 关键直觉:权重共享的本质是"用权重的不精确换评估的廉价"。它让搜索阶段能评估成千上万个子网,但代价是每个分数都不精确。理解了这个交易,就理解了为什么高效 NAS 方法(DARTS、ENAS)都长得像"搜索便宜 + 定稿严格"的孪生结构。

四、权重共享的机制细节与超网络调优

超网络的"路径采样"细节

SOURCe 在 4.4 节把超网络训练描述为"在训练过程中,通常采用采样策略,随机选择超级网络中的一条路径进行训练"。这个"随机采样"的细节决定了超网络质量:均匀采样——所有路径等概率被选,超网络"雨露均沾",但每条路径学得浅;加权采样——偏好好路径,超网络在好区域"学得深",但差路径被冷落,评估它们时分数失真。工程上从均匀采样起步,观察"高分路径是否稳定"来判断要不要切到加权。还有一个细节是"路径批大小"——每次采样几条路径,采样越少、训练越碎,采样太多、单次更新太杂,需要实验找平衡。

超网络训练的轮数与最终性能的关系

超网络训练不足,权重还没收敛,所有路径的评估分数都不可信;训练过度,超网络过拟合到训练集,验证集评估又失真。SOURCe 提到超网络与独立训练的差距时,隐含了一个事实:超网络不是为"某个架构"训练的,而是为"所有架构的平均"训练的——所以它的最优训练轮数通常短于独立训练(学个大概即可),长训反而有害。工程上的经验是"超网络训练到训练损失不再明显下降即可停"——比"训练到收敛"更符合权重共享的逻辑。

权重共享与不同搜索策略的搭配

权重共享的评估能力,决定了它能配什么搜索策略。配梯度优化(DARTS):超网络正是连续松弛的载体,架构参数在超网络上做双层优化,这是"评估与策略深度绑定"的典型。配强化学习(ENAS):控制器生成架构、共享权重评估,评估便宜到控制器可以大量试错。配进化算法:种群个体从超网络取权重评估,进化的评估账单被摊薄。三种搭配的共同前提是超网络训练质量,所以"超网络调不好,策略再聪明也没用"——这在 DARTS 系论文里反复出现。

权重共享的可复现性陷阱

权重共享评估有个工程陷阱:超网络训练有随机性(路径采样、初始化),两次训练的超网络质量不同,评估出的排名可能漂移。SOURCe 提醒"在权重共享评估中表现良好的架构,在独立训练时可能无法达到相同的性能"——排名漂移会让这个差距雪上加霜。工程应对:固定超网络训练的随机种子(可复现);报告时同时给出"共享分数"和"独立训练分数"(透明);最关键的是,最终架构必须独立训练,绝不能用共享分数当最终性能。

五、FAQ:权重共享评估的常见疑问

超网络和普通网络的训练有什么区别?

超网络在训练时"一次只走一条路径",普通网络"每次走完整结构"——这是最核心的区别。SOURCe 把超网络训练描述为"通过采样不同的路径来训练不同的子网络",正是这个"路径级训练"让超网络能覆盖所有候选,也让它的权重从不为任何一个候选"专用"。理解了这个区别,就能理解为什么超网络的评估分数天然低于独立训练——每个候选用的都是"众筹"的权重。

权重共享评估能完全替代独立训练吗?

不能,永远不能。SOURCe 明确说"在权重共享评估中表现良好的架构,在独立训练时可能无法达到相同的性能"。权重共享的价值是"大规模粗筛"——它让你能以极低成本把几万候选砍到几十个,但最终的架构选择、性能报告,必须回到独立训练。这是本教程反复强调的"定稿必须完全训练"纪律在权重共享上的具体应用。

超网络能不能边搜索边训练?

能,而且 DARTS 就是这么干的——搜索与超网络训练交替进行(双层优化)。但要注意:交替训练时超网络权重一直没"稳定过",每一步的评估分数都在漂移,搜索算法在移动的靶子上做决策。工程上更稳的做法是"先训后搜":先把超网络训到一个基本稳定的状态,再开始搜索阶段的评估。两段式牺牲一点灵活性,换来评估基准的稳定。

超网络会过拟合吗?

会。超网络参数量巨大,训练轮数一多同样过拟合训练集。判断标准:验证集评估分数开始下降而训练损失还在降,就是过拟合信号。另一个信号是"高分离散"——搜索阶段分数很好的架构,独立训练后崩得很惨。缓解手段与普通网络一样(早停、正则化),只是要额外注意"采样多样性"——超网络过拟合往往伴随路径采样分布塌缩,保持采样多样性本身就在防过拟合。

  • 超网络概念:所有候选装进一个网络,每个候选是一条路径
  • 五步流程:构建→共享→采样训练→子网评估→选架构
  • 效率革命:子网评估从"训一个模型"降到"一次前向"
  • 四个代价:权重干扰、采样敏感、过度共享、独立训练 gap
  • gap 是核心风险:共享分数好不等于独立训练好
  • 调优两招:采样向高分倾斜、归一化层独立
  • 地基地位:DARTS、ENAS、ProxylessNAS 全部建立在它之上

下一节看评估阶梯的最顶端——零成本代理,不训练直接估分。

图4-3 权重共享超网的采样机制与排序失真

图4-3 权重共享超网的采样机制与排序失真


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U