4.5 零成本代理


文档摘要

4.5 零成本代理 本节摘要:零成本代理不训练模型,直接用架构的静态或初始化属性预测性能——参数量/FLOPs 这类复杂度指标,SNIP/Fisher 信息/SynFlow/GraSP 这类初始化梯度与信息流指标。本节讲清"零成本"为什么成立(性能与架构内在属性相关)、三大类指标各自预测什么,以及用相关性分析、多指标组合、偏差缓解来安全使用它们的方法。 学习目标 阅读完本节,你应当能够: 解释零成本代理"零训练预测性能"的原理 说出复杂度、初始化、信息流三类代理指标及各自的代表 说明 SNIP、SynFlow、GraSP 分别从哪个角度预测架构潜力 用相关性分析、多指标组合、偏差缓解三条纪律安全使用零成本代理 一、问题与直觉:能不能不训练就估分

4.5 零成本代理

本节摘要:零成本代理不训练模型,直接用架构的静态或初始化属性预测性能——参数量/FLOPs 这类复杂度指标,SNIP/Fisher 信息/SynFlow/GraSP 这类初始化梯度与信息流指标。本节讲清"零成本"为什么成立(性能与架构内在属性相关)、三大类指标各自预测什么,以及用相关性分析、多指标组合、偏差缓解来安全使用它们的方法。

学习目标

阅读完本节,你应当能够:

  1. 解释零成本代理"零训练预测性能"的原理
  2. 说出复杂度、初始化、信息流三类代理指标及各自的代表
  3. 说明 SNIP、SynFlow、GraSP 分别从哪个角度预测架构潜力
  4. 用相关性分析、多指标组合、偏差缓解三条纪律安全使用零成本代理

一、问题与直觉:能不能不训练就估分

权重共享把评估成本压到"一次前向",还是得训练超网络。零成本代理的野心更大:连训练都不要,直接看架构长什么样就估分。

凭什么?凭一个经验规律——架构的某些内在属性与其最终性能存在相关性。参数量大的架构通常容量大(但不一定好);初始化时的梯度能反映训练难易;信息能否顺畅地从输入流到输出,能反映网络"通不通"。这些属性不需要训练就能算,所以叫"零成本"。

SOURCE 给零成本代理的核心思想一句话点透:某些架构的内在属性与其最终性能之间存在相关性。比如架构的参数数量、梯度范数、激活值分布都可能与其性能有关。这个"相关性"是零成本代理的命根子——代理指标与真实性能的相关性越高,粗筛越可靠。零成本代理不会替代训练,它的定位是"初始阶段的闪电筛选"——从几百万候选里砍到几百个,后续再上更准的评估。

要注意"零成本"不是真零。SOURCe 提醒:基于初始化的代理(比如 SNIP)需要一次前向+反向传播,只是"成本接近零"。它们比纯静态指标(参数量)贵一点点,但预测能力更强。零成本代理是"极低成本",不是"完全免费"。

二、核心原理:三类指标

第一类:复杂度指标(静态结构)。参数量——模型可学习参数总数,反映容量;FLOPs——一次前向的浮点运算次数,反映计算量;MACs——乘加运算次数,与 FLOPs 类似更关注乘加;网络深度与宽度、连接数也归入此类。这类指标计算最简单(看一眼网络结构就行),但预测能力最弱——性能不只取决于复杂度,还受结构、初始化、优化算法影响。SOURCE 的定位是:更复杂的网络通常表达力更强,但也更容易过拟合、计算成本更高——复杂度是"双刃剑"型指标。

第二类:初始化指标(梯度与权重分布)。这类代理认为随机初始化后的网络状态已经携带"学习潜力"信息。SNIP(基于梯度幅值的剪枝方法)的核心思想:随机初始化下,对给定输入样本,梯度幅值越大的连接越重要——计算网络在初始化状态对少量样本的平均梯度幅值,作为性能代理,梯度幅值大的架构被认为学习能力更强。Fisher 信息——计算初始化状态下 Fisher 信息矩阵的迹等统计量,信息量大被认为泛化更好。GraSP(梯度信号传播)——关注梯度从输出层反向传播到输入层的强度,梯度传播更强的架构更易训练收敛。NWP(网络权重扰动)——考察权重对输入扰动的敏感性。

第三类:信息流指标。SynFlow(突触流)关注信息流强度——计算初始化状态下,从输入到输出的信息流动路径上权重乘积的累积值,信息流越强被认为更易训练、性能更好。SynFlow 强调连接的重要性:信息能否高效从输入传到输出是关键。

为什么能预测性能。三类指标的共同假设是"性能被架构的内在属性决定"——复杂度决定容量上限,梯度分布决定优化难易,信息流决定连通质量。这些属性都在训练开始前就"写在"结构里,所以能预判。但"决定"不是"唯一决定"——数据、训练协议、随机性同样影响最终性能,这正是零成本代理精度上限的由来。

代理类别 代表指标 计算成本 预测视角
复杂度 参数量、FLOPs、MACs 几乎为 0 容量与成本
初始化梯度 SNIP、Fisher、GraSP 一次前后向 学习与优化潜力
信息流 SynFlow 一次前向 连通与信息传递

三、工程实践要点:零成本代理的安全使用纪律

纪律一:相关性分析先行。SOURCE 在第 4.5 节给出了明确方法:在小规模架构集上训练并评估最终性能,计算每个零成本代理指标与最终性能的相关系数(Pearson 或 Spearman)。相关系数越高,代理越可靠。注意相关性只在此数据集、此搜索空间上成立——换个数据集或空间,相关性可能大变。每次新任务都要重新测。

纪律二:多指标组合。单一指标只捕捉性能的一个侧面,组合能互相补位。SOURCE 建议把复杂度类与初始化类结合——比如"FLOPs(限制计算)+ SynFlow(评估连通)"。组合方式从加权平均到训练一个小回归模型都行。组合比单指标稳健,这是工程上的通用经验。

纪律三:偏差缓解。零成本代理有系统性偏好——某些代理偏向特定类型的架构(比如倾向深网络或宽网络),会把搜索引到偏区。缓解手段三件套:用多个不同偏差的指标互相抵消、用校准模型把代理分数映射到更准确的估计、在搜索中引入探索机制(别只追代理高分,留一部分预算试低分架构)。

典型用法。零成本代理是评估阶梯的第一级,负责"广撒网":随机采样(或从搜索空间均匀抽)几万个架构,用零成本代理快速打分,砍到几百个;几百个进代理任务/权重共享精筛,再砍到几十个;最后完全训练定稿。这个"漏斗"设计把零成本代理的"极便宜"和完全训练的"极准确"各自用在正确的位置。

⚠️ 常见坑:直接把零成本代理的分数当最终性能选架构,不做后续精筛。零成本代理只能"粗排"不能"精评"——它的分数噪声大、偏差多,选出来的架构必须经过训练类评估复验。

💡 关键直觉:零成本代理卖的是"预判能力"——训练开始前就知道架构值不值得投钱。它的价值不在准,而在"便宜到可以全量扫描"。把最贵的评估留给最少的候选,是零成本代理在工程里的正确打开方式。

四、零成本代理的机制细节与使用流程

复杂度指标的"双刃剑"属性

参数量、FLOPs 这类复杂度指标是最便宜的零成本代理,但要认清它的局限性。SOURCe 的提醒是"更复杂的网络通常具有更强的表达能力,但也更容易过拟合,且计算成本更高"——复杂度与性能不是单调关系,而是"倒 U 形":太简单欠拟合,太复杂过拟合,中间最优。所以拿复杂度当性能代理,只能识别"明显太小"和"明显太大"的极端架构,对中间地带的排序几乎无信息。工程定位:复杂度指标适合当"过滤阀"(砍掉不满足预算约束的),不适合当"排序器"(给候选排优劣)。

初始化指标的两次计算成本

SNIP、Fisher、SynFlow、GraSP 这类初始化指标,严格说是"半零成本"——它们需要一次前向(可能加一次反向)传播,输入一个小 batch 数据。SOURCe 的描述是"通常只需要进行一次前向或反向传播计算"——成本接近零但确实不是零。对大批量候选(几十万)而言,即使一次前向,累计起来也要一些算力,但相比训练已经便宜几个数量级。工程上让这批"半零成本"指标跑在小批量数据(一个 batch 甚至更少)上,成本几乎可忽略。

零成本代理的工程使用流程

完整的零成本代理流程分五步。第一步:从搜索空间随机采样大批候选(几万到几十万)。第二步:对每个候选算一组零成本指标(复杂度 + 初始化指标组合)。第三步:用这些指标给候选打分排序,砍掉后 90-99%。第四步:幸存者进入代理任务或权重共享精筛。第五步:定期抽样做相关性回检(第 4.1 节纪律),确认粗筛没把好架构误杀。五步里最关键的是第三步的"筛余率"——筛太狠可能误杀好架构,筛太松粗筛没意义,SOURCe 建议的定位是"快速筛选出极少数有潜力的架构",筛余率通常在 1-10% 之间,具体要靠相关性实验校准。

零成本代理的偏差与"架构偏好"

零成本代理有系统性偏好。复杂度类指标天然偏向"大而全"的架构;SynFlow 偏向"连通性强"的结构;GraSP 偏向"梯度传播顺畅"的结构。SOURCe 在第 4.5 节提醒"某些零成本代理可能更倾向于选择某种特定类型的架构"——这种偏好如果与真实最优不一致,会把搜索引偏。缓解手段前面提过多指标组合和校准模型,这里再补一条:保留一定比例的随机样本进下一级——不完全按代理分数筛,给"代理不看好但实际有潜力"的架构留活路。这个"带噪声的筛选"虽然看着不完美,但比纯代理筛选稳健得多。

五、FAQ:零成本代理的常见疑问

零成本代理能在推理阶段用吗?

不能。零成本代理是为"架构搜索阶段"设计的——它的目标是预测架构训练后的性能,帮搜索算法做粗筛。推理阶段模型已经训练好了,直接用真实性能,不需要也没必要再预测。别把零成本代理的用法搞混——它是搜索的"前置筛选器",不是推理的"性能指标"。

零成本代理的分数会随数据集变化吗?

会,而且变化可能很大。SOURCe 在第 4.5 节提醒"零成本代理的有效性可能依赖于特定的任务和数据集"——一个在 CIFAR-10 上相关性很高的代理指标,换到 ImageNet 上可能失效。原因是代理指标捕捉的是"架构的内在属性",而内在属性与"哪个数据集"的性能相关性并不稳定。工程纪律:每次换数据集/任务,都必须重新做相关性实验,不能沿用上一次的结论。

零成本代理和性能预测器是什么关系?

零成本代理是"性能预测器"家族里最便宜的一支。SOURCe 在 4.2 节提到性能预测器是"使用一个机器学习模型(例如神经网络、支持向量机)来预测候选架构的性能"——它需要先训练预测模型,再用来打分。零成本代理是"免训练预测":不训练预测模型,直接用架构属性。两者的定位差异:性能预测器更准但需要训练数据,零成本代理更省但精度更低。工程上可以组合——先零成本粗筛拿数据,再用这些数据训练性能预测器做精筛,两级都便宜。

零成本代理能成为 NAS 的"唯一"评估吗?

不能。它的定位永远是"评估阶梯的第一级"——粗筛、省预算、为后续精筛铺路。SOURCe 在 4.5 节的定位是"在 NAS 的早期阶段,迅速筛选出有潜力的架构,并淘汰掉那些表现不佳的模型"——"早期阶段"四个字划定了它的边界。拿零成本代理当唯一评估,等于用"预判"代替"实测",选出的架构大概率在完全训练后翻车。

  • 零成本原理:架构内在属性与最终性能相关,不用训练就能预判
  • 三类指标:复杂度(参数/FLOPs)、初始化梯度(SNIP/Fisher/GraSP)、信息流(SynFlow)
  • SNIP 逻辑:初始化时梯度幅值大的连接更重要,平均梯度幅值当性能代理
  • 相关性是命根子:Pearson/Spearman 相关性决定代理是否可用,且随任务变化
  • 多指标组合:复杂度类+初始化类结合,比单指标稳健
  • 偏差三缓解:多指标抵消、校准模型、探索机制
  • 漏斗定位:零成本粗筛几万→代理/权重共享精筛几百→完全训练定稿

下一节把四类评估策略摆上对比桌——评估阶梯的完整组装方案。

图4-4 零成本代理:秒级评分与真实精度的相关性

图4-4 零成本代理:秒级评分与真实精度的相关性


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U