4.3 代理任务评估 本节摘要:代理任务评估用"更便宜的任务"近似目标任务——子集训练、缩短轮数、降分辨率、换简单任务。本节拆解这四种代理形式及其成本-精度账,分析相关性风险从哪来,给出"代理任务与目标任务越像越可靠"的选择原则,并讨论它在评估阶梯里的位置——粗筛主力、精筛起步。 本节要回答的问题 阅读完本节,你应当能够: 列出代理任务的四种形式,并各配一个具体例子 解释"相关性"为什么是代理任务评估的生命线 说出代理任务评估的三个优点与四个缺点 判断什么样的代理任务配置适合自己手头的搜索 一、问题与直觉:用"缩小版任务"给架构估分 完全训练评估贵得离谱,但直接砍掉训练又没法评估。代理任务的思路是折中:不砍任务,只把任务"缩小"。
本节摘要:代理任务评估用"更便宜的任务"近似目标任务——子集训练、缩短轮数、降分辨率、换简单任务。本节拆解这四种代理形式及其成本-精度账,分析相关性风险从哪来,给出"代理任务与目标任务越像越可靠"的选择原则,并讨论它在评估阶梯里的位置——粗筛主力、精筛起步。
阅读完本节,你应当能够:
完全训练评估贵得离谱,但直接砍掉训练又没法评估。代理任务的思路是折中:不砍任务,只把任务"缩小"。数据用一部分、轮数跑少一点、分辨率降一档、任务换个更简单的——在缩小版任务上评估架构,用它代表真实任务的性能。
这个思路成立的前提是一个关于相关性的赌注:在代理任务上表现好的架构,在目标任务上大概率也表现好。SOURCE 把这句话说得很清楚:如果代理任务与目标任务之间存在较强的相关性,那么在代理任务上表现良好的架构,在目标任务上也有望取得不错的性能。赌注押中了,评估成本大幅下降;押输了(相关性断裂),评估排行榜就和真实排行榜脱节,NAS 挑出的冠军名不副实。
代理任务的四种形式,本质是在四根"成本旋钮"上做文章:数据量、训练轮数、输入分辨率、任务复杂度。每根旋钮拧下去,成本降一截,相关性也可能跟着降一截。代理任务设计的艺术,就是找到"成本降得够多、相关性掉得够少"的旋钮组合。
形式一:子集训练。只用数据集的一部分训练评估。比如 CIFAR-10 的 10% 或 20% 作为代理数据集。SOURCe 给的例子很具体——10% 的数据意味着评估时间接近原来的十分之一。代价是数据少,模型训练不充分,评估分数方差变大、与全量训练的排名可能错位。
形式二:缩短训练轮数。只训练 5-10 个 epoch 就评估,而不是完全训练需要的数百个 epoch。这是最常用的代理形式。风险是"早停的分数 vs 收敛的分数"排名不一致——有些架构收敛快(前期猛),有些收敛慢(后期发力),5 个 epoch 的排行榜可能误导搜索。缓解手段是测分数与完全训练分数的相关性,确认轮数缩短没有破坏排序。
形式三:降低输入分辨率。图像任务里,把 CIFAR-10 的 32x32 输入降到 16x16 或 8x8。分辨率降意味着计算量指数级下降(特征图面积按平方缩)。风险是低分辨率下某些结构(特别是需要细粒度特征的)被误伤。
形式四:使用更简单的任务。用与目标任务相似但更简单的任务当代理。SOURCE 举例:用图像分类任务作为目标检测任务的代理任务。风险最隐蔽——"相似"的判断有主观性,代理任务与目标任务的相关性必须实测。
相关性风险的两个来源。第一个来源是任务差异:代理任务与目标任务越不像,相关性越低。第二个来源是评估噪声:代理任务本身训练不充分,分数波动大,相关性再被噪声稀释。SOURCE 在 4.3 节列了评估精度可能降低、需要仔细选择代理任务、泛化性问题、超参数敏感四个缺点,本质都是相关性的不同表现。
选择原则。SOURCE 强调"选择合适的代理任务至关重要"。三条实操原则:相关性优先——代理任务与目标任务的差异越小越好,必要时用数据而非任务类型做代理(子集训练比换任务更稳);预算与精度对价——预算紧就往"便宜端"拧(轮数、分辨率),预算有余就往"准端"调;实测验证——选好配置后先做相关性实验,别凭感觉。
| 代理形式 | 成本降幅 | 相关性风险 | 适用场景 |
|---|---|---|---|
| 子集训练 | 大(按数据比例) | 中(方差变大) | 数据充足、预算紧 |
| 缩短轮数 | 大(按轮数比例) | 中高(收敛节奏错位) | 快速迭代验证 |
| 降分辨率 | 指数级 | 中(细粒度特征被伤) | 图像任务 |
| 换简单任务 | 取决于任务 | 高(相关性难保证) | 任务相关性已实测 |
配置原则:能缩数据不换任务。四种形式里,子集训练和缩短轮数是最"忠实"的代理——它们只是缩小目标任务本身,没有换任务。换任务(形式四)的风险最大,除非已经实测过相关性,否则谨慎使用。优先考虑"同一任务缩规模",而非"换成另一个任务"。
相关性实验是标配。正式搜索前,随机采样 30-50 个架构,跑"代理任务分数 vs 完全训练分数"的相关性(Spearman 秩相关)。相关系数低于 0.6 时,代理配置要调整(轮数加一点、数据多一点)。这个实验的算力成本约等于几次完全训练,相比整个搜索预算九牛一毛,但能防止整个搜索白跑。
定位:评估阶梯的第二级。完整评估阶梯是"零成本代理粗筛 → 代理任务/权重共享精筛 → 完全训练定稿"。代理任务的角色是精筛——在零成本代理筛出的几十个架构里,用代理任务跑出更可信的排序,砍到个位数。它比零成本准、比完全训练便宜,正好卡在阶梯中间。
⚠️ 常见坑:缩短训练轮数后不做相关性验证。有些架构收敛慢,前 5 个 epoch 表现平庸,但收敛后反超——轮数太短的代理任务会系统性低估这类架构,导致搜索错过它们。测一次相关性就知道轮数够不够。
💡 关键直觉:代理任务的价值不在"便宜",而在"排序保真"。真正重要的是架构之间的相对排名,不是绝对分数——只要代理任务保住排名,搜索就能正确工作。所以评估代理任务配置的标准只有一个:它与完全训练的排名相关性有多高。
代理任务最常见的坑是缩短训练轮数后,排名与完全训练不一致,根源是"收敛节奏不同"。有的架构前期猛——几个 epoch 就冲高;有的架构后期发力——前 50 个 epoch 平平无奇,200 轮后反超。如果代理任务只跑 10 个 epoch,后期发力型架构会被系统性低估,搜索就错过了它。缓解手段:把代理任务轮数定在"能分辨收敛趋势"的长度(比如完全训练轮数的 20-30%),而不是一味求短;或者用学习曲线外推——跑 20 个 epoch,用曲线的斜率预测 200 轮的分数。SOURCe 在第 4.3 节把"早期停止"列为代理形式,正是承认这个节奏问题的存在。
用 10% 数据训练,架构之间的分数差距会被"训练不充分"的噪声放大或抹平。数据太少时,分数主要反映"谁在这次随机采样上运气好",而不是"谁的结构好"。工程对策:子集比例别压太低(30% 以上通常还算稳);多次采样子集取平均(降方差);在子集上同时缩短轮数(两个旋钮配合,比单压一个更平衡)。SOURCe 给的是"10% 或 20% 的数据"作为示例——示例是量级参考,不是推荐值,具体比例要靠相关性实验定。
第 4.3 节的纪律说"相关性实验是标配",这里给出可执行的四步。第一步:随机采样 30-50 个架构(覆盖空间不同区域)。第二步:每个架构同时跑代理任务评估和完全训练评估(这笔投入是刻意花的,为整个搜索买"保险")。第三步:计算两组分数的 Spearman 秩相关——为什么用秩相关而不是 Pearson?因为 NAS 关心的排名而非绝对分数,秩相关直接度量"排名保真度"。第四步:相关低于 0.6 就回调代理配置(加轮数、加数据、降复杂度),重测直到达标。四步走完,代理任务才真正"上岗"。
代理任务在评估阶梯里的位置是"第二级"——前面有零成本代理粗筛,后面有完全训练定稿。它的独特价值是"精度与效率的中间档":零成本太糙,完全训练太贵,代理任务正好补中间。组合使用时要注意误差叠加:零成本筛掉一批 → 代理任务在幸存者里精排 → 完全训练定冠军,每一级的误差都会传导到下一级,所以每一级都要单独做相关性验收。代理任务的"上游"(零成本)与"下游"(完全训练)验收标准不同,别用同一套参数混过去。
会,这正是 SOURCe 说的"过拟合到代理任务的风险"。如果一个架构在 10 个 epoch 的代理任务上表现好,可能是因为它"收敛快"而非"上限高",搜索会倾向选这类架构,结果筛掉一批"慢热但更强"的候选。缓解手段:定期用完全训练抽查代理任务的排名是否仍然保真;必要时在代理任务里加入"多样性约束"(第 3.3 节奖励设计的思路同样适用)。
能,但别联动得太频繁。代理任务的分辨率(数据量、轮数)与搜索空间的复杂度需要匹配:空间大、候选多,代理任务必须更便宜(否则评估扛不住);空间小、候选少,代理任务可以更接近完全训练。SOURCe 在第 4.1 节提醒"不同的搜索空间和任务特点可能需要不同的评估策略"——这就是联动的依据。调整节奏建议"按阶段调"而非"每轮调":一个搜索阶段内保持代理配置稳定,阶段切换时再调整,否则评估基准漂移,排名失去可比性。
算,SOURCe 在第 4.3 节明确把它列为代理形式之一——"使用较低的精度(例如 FP16)进行训练和评估"。低精度的收益是训练速度提升和显存减半,风险是数值精度损失可能改变收敛行为。对大部分架构而言,FP16 的精度损失很小,排名几乎不受影响——所以它是最"便宜"也最"安全"的代理手段之一,经常被当作默认配置而不是显式代理任务。
有。SOURCe 提的四种代理形式里,"缩短训练轮数"+"保持目标任务不变"是最保底的组合——它没有换任务(相关性最稳),只是压缩了训练量。低于这个组合的保底性排序:降分辨率(图像任务里很稳)> 子集训练(需要足量数据)> 换简单任务(相关性风险最高)。如果时间只够选一种代理方式,选"缩短轮数";如果还能加一种,加"降分辨率"。
下一节看权重共享评估——用"一个超网络"评估所有子网的革命性方法。