5.4 NAS 的理论分析 本节摘要:NAS 在实践中成绩斐然,但理论根基仍然单薄。本节讲清理论分析要回答的四个问题——理解原理、指导设计、评估性能、预测行为,梳理优化理论、泛化理论、随机过程、信息论、代理模型理论五大工具各自能干什么,并展开搜索空间几何、收敛性、泛化界、代理模型精度四条典型研究方向。 学习目标 阅读完本节,你应当能够: 说出 NAS 理论分析的四个目的与五个挑战 解释五大理论工具各回答 NAS 的什么问题 说明"搜索空间几何"分析在实践中的用途 理解代理模型精度理论为什么直接关系到第 4 章的评估可靠性 一、问题与直觉:效果很好,但"为什么好"说不清 NAS 过去几年的处境有点微妙:工程上到处开花——DARTS 在 CIFAR 上几分钟出架构,EfficientNet
本节摘要:NAS 在实践中成绩斐然,但理论根基仍然单薄。本节讲清理论分析要回答的四个问题——理解原理、指导设计、评估性能、预测行为,梳理优化理论、泛化理论、随机过程、信息论、代理模型理论五大工具各自能干什么,并展开搜索空间几何、收敛性、泛化界、代理模型精度四条典型研究方向。
阅读完本节,你应当能够:
NAS 过去几年的处境有点微妙:工程上到处开花——DARTS 在 CIFAR 上几分钟出架构,EfficientNet 刷榜 ImageNet,NAS 已经成了 AutoML 的标配。但要是问一句"NAS 为什么能找到好架构",研究者往往只能给出一堆"直觉上""经验上"的答案,拿不出定理级别的解释。这种"实践跑在理论前面"的状态,就是 NAS 理论分析的出发点。
SOURCE 把理论分析的目的列成四条:理解 NAS 的工作原理——哪些因素决定它找到好架构;指导 NAS 方法的设计——用理论结论设计更有效的搜索;评估 NAS 方法的性能——给出收敛性、泛化能力的理论依据;预测 NAS 的行为——比如搜索时间与性能的权衡。四条目的里,第一条是基础,后三条都是它的推论。
理论分析难在哪?SOURCE 列了四个挑战:NAS 涉及搜索空间、搜索算法、评估策略多个复杂组件,难以建立简单模型;搜索是非凸优化问题,全局最优的理论保证难拿;搜索空间巨大,完全理论分析不现实;代理任务评估与真实任务之间有差距,影响理论结论的准确性。这四个挑战本质上都在说同一件事:NAS 是一个"组件耦合的、非凸的、巨规模的黑盒优化问题",传统优化理论直接套不上。
工具一:优化理论。回答"搜索算法收敛吗、收敛多快、复杂度多高"。这是最直接的工具——进化算法、梯度方法、贝叶斯优化的收敛性分析都归它管。但 NAS 的目标函数是"架构→性能"的黑盒映射,经典凸优化理论用不上,只能退而求其次分析"在理想化假设下的收敛行为"。
工具二:泛化理论。回答"搜出来的架构在新数据上表现如何"。用 VC 维、Rademacher 复杂度这类工具推导泛化界。NAS 的特殊性在于:搜索本身也在"学习"——搜索算法在架构空间里选模型的过程,相当于一个嵌套的学习过程,泛化界的分析比普通监督学习复杂一层。
工具三:随机过程理论。回答"搜索过程的轨迹长什么样"。把搜索过程建模成马尔可夫链、布朗运动等随机过程,分析搜索的路径分布、停留时间、命中概率。这类分析适合进化算法和随机搜索——它们的轨迹天然是随机过程。
工具四:信息论。回答"搜索过程获得了多少信息"。用信息增益、信息瓶颈概念分析"每次评估带来多少信息、搜索如何逐步降低架构不确定性"。这个视角把"搜索"重新理解为"信息获取过程",评估预算就是信息预算。
工具五:代理模型理论。回答"代理模型的预测有多准、误差受什么影响"。这是和第 4 章直接挂钩的工具——零成本代理、贝叶斯优化代理的精度分析都归它管。代理模型理论的结论(比如"相关性多高才够用")能直接指导评估策略配置。
方向一:搜索空间的性质分析。分析搜索空间的结构、连通性、平滑性——空间里有没有全局最优解、容不容易陷入局部最优、架构之间"距离"怎么定义。这个方向看似抽象,其实有直接工程价值:如果分析发现空间是"平滑"的(相邻架构性能接近),随机搜索和贪心策略就够用;如果是"崎岖"的(相邻架构性能跳变),就需要全局探索力强的策略。空间几何决定策略选型,这是把第 3 章的"探索-利用"从经验上升到理论的关键一步。
方向二:搜索算法的收敛性分析。证明或证伪"搜索算法能收敛到最优解、收敛速度如何、受什么因素影响"。DARTS 的双层优化是否收敛、进化算法在多峰空间是否收敛,都是这个方向的题目。收敛性分析能给"搜索要跑多少轮"提供理论依据——比"凭经验跑 50 轮"靠谱得多。
方向三:泛化能力的理论界限。推导 NAS 找到的架构的泛化界。核心问题:搜索空间的表达力越大,泛化界越松——你搜了一个过大的空间,可能找到"训练集上很好但测试集很差"的架构。泛化界把"搜索空间的规模"与"搜索结果的可信度"定量地联系起来,这正好呼应第 2 章"搜索空间决定性能上限"的说法,只是从泛化而非优化角度。
方向四:代理模型精度的理论分析。分析代理模型的精度受哪些因素影响、怎么提高。这与第 4 章零成本代理的"相关性分析"互为表里——实践上我们实测相关性,理论上我们追问"相关性由什么决定"。这个方向的成熟,能让评估策略配置从"试出来的"变成"算出来的"。
| 理论工具 | 核心问题 | 直接指导的实践 |
|---|---|---|
| 优化理论 | 搜索算法收敛吗、多快 | 搜索轮数设置 |
| 泛化理论 | 搜出的架构泛化吗 | 搜索空间规模控制 |
| 随机过程 | 搜索轨迹什么样 | 进化/随机策略分析 |
| 信息论 | 评估带来多少信息 | 评估预算分配 |
| 代理模型理论 | 代理预测多准 | 评估策略配置 |
用空间几何指导策略选型。做正式搜索前,做一个"空间侦察"实验:随机采样一批架构评估,看性能分布和相邻架构的相关性。性能分布宽、相邻相关性高——空间平滑,便宜策略够用;性能分布诡异、相邻相关性低——空间崎岖,必须上全局搜索策略。这个侦察的成本不大,但能避免策略选错整轮白跑。
用泛化界约束空间规模。搜索空间别只追求"大"。SOURCE 在 5.4 节列的方向三里,泛化界把空间规模与泛化风险挂钩。工程直觉:空间大 → 采样密度稀 → 搜索容易过拟合到少数高分架构。控制空间的"有效规模"(通过操作集合精简、深度宽度范围收紧),比空间"更大"更重要。
用代理模型理论校准评估。第 4 章说"相关性分析是评估策略验收标配"——理论方向的贡献,是让你知道相关性该测到多高才算"够"。虽然没有统一的数值阈值,但"代理精度直接决定搜索结果质量"这条理论共识,足以支撑"相关性低于 0.6 就调整配置"的工程守则。
别期待定理级保证。SOURCE 反复强调 NAS 的复杂性——非凸、巨大、组件耦合。工程上不要奢望"NAS 一定能收敛到全局最优"这种保证,而是接受"在良好设计下,NAS 大概率找到足够好的架构"。理论的价值是缩小"不知道"的范围,不是消灭"不知道"。
⚠️ 常见坑:拿"搜索空间很大所以很强"当设计理由。理论分析(泛化方向)恰恰提醒:空间大导致的采样稀疏会让搜索结果过拟合到高分样本。空间要"足够大装下好解",不是"越大越好"。
💡 关键直觉:NAS 理论分析的核心贡献,是把 NAS 的每个工程直觉翻译成可研究的理论问题——"评估要测相关性"翻译成代理模型理论,"空间要够大"翻译成表达力-泛化权衡,"策略要探索利用平衡"翻译成多臂赌博机/采集函数分析。理论不是替代工程,是给工程直觉发"身份证"。
五大理论工具不是平行的五个工具箱,而是按"回答问题的层次"分工。优化理论回答"搜索过程本身"的问题(收敛不收敛、多快);随机过程理论回答"搜索轨迹"的问题(怎么走、停在哪);信息论回答"搜索获取了什么"的问题(每次评估带来多少信息);泛化理论回答"搜索结果"的问题(找到的架构靠不靠得住);代理模型理论回答"评估信号"的问题(代理分数准不准)。五个层次从"搜索中"到"搜索后"排成一条链——SOURCe 列这五类工具的顺序也大致是这个逻辑。理解分工,读理论类论文时就知道该去哪个工具箱找答案。
第 5.4 节的方向一(搜索空间性质分析)给了一个工程上立刻能用的结论:先做空间侦察,再选搜索策略。侦察方法前面提过——随机采样一批架构评估,看性能分布与相邻架构的相关性。空间平滑(相邻架构性能接近)→ 梯度、贪心类利用型策略好用;空间崎岖(相邻架构性能跳变)→ 进化、随机类探索型策略更稳。这个结论把第 3.7 节的"探索-利用"选型从经验升级到了理论指导——SOURCe 把"搜索空间是否包含全局最优解、是否容易陷入局部最优"列为理论分析对象,正是为这类决策提供依据。
方向三(泛化能力的理论界限)给了一个反直觉的工程约束:空间不是越大越好。泛化理论说明,搜索空间的规模与搜索结果的泛化风险相关——空间过大、采样密度不足,搜索容易过拟合到少数高分样本,找到的架构在真实分布上表现差。SOURCe 在 5.4 节把"推导 NAS 找到的架构的泛化能力的理论界限"列为研究方向,工程上的应用是:操作集合精简、深度宽度范围收紧,让空间"够用但不过大"。这个结论与第 2.1 节的"表达力-搜索效率平衡"互为表里——一个是优化视角,一个是泛化视角。
SOURCe 在 5.4 节开头就承认"对其理论基础的理解仍然相对有限",这是全节的底色。理论分析能给的是"结构性指导"(空间几何怎么影响策略、泛化风险怎么随空间变化),给不了的是"精确数值预测"(这个空间最优架构的性能是多少)。工程上对理论的正确态度是"用结论做方向判断,用实验做最终决策"——理论缩小搜索范围,实验拍板最终答案。别期待理论给出定理级别的保证,也别因为理论不完美就全盘不用。
下一节看 NAS 的公平性与伦理——从"技术能不能做到"转到"该不该这么做"。
