1.1 NAS 的背景与动机


文档摘要

1.1 NAS 的背景与动机 本节摘要:NAS(神经网络架构搜索)诞生的直接原因,是人工设计神经网络既贵又慢还靠运气。本节从深度学习的架构依赖讲起,拆解人工设计的耗时、门槛、主观、任务依赖四重困境,说明 NAS 为何要把"架构设计"从手艺变成流水线。 学习目标 阅读完本节,你应当能够: 复述深度学习架构创新的几个关键节点(深度信念网络、AlexNet、ResNet 残差) 列出人工设计神经网络的至少四条局限性,并各配一个具体表现 说清 NAS 的三步基本流程:定义搜索空间、定义搜索策略、性能评估 解释"用算力换经验"这一 NAS 核心动机的含义 一、问题与直觉:架构是深度学习的"隐形成本" 深度学习能走到今天,架构创新的功劳往往被低估。

1.1 NAS 的背景与动机

本节摘要:NAS(神经网络架构搜索)诞生的直接原因,是人工设计神经网络既贵又慢还靠运气。本节从深度学习的架构依赖讲起,拆解人工设计的耗时、门槛、主观、任务依赖四重困境,说明 NAS 为何要把"架构设计"从手艺变成流水线。

学习目标

阅读完本节,你应当能够:

  1. 复述深度学习架构创新的几个关键节点(深度信念网络、AlexNet、ResNet 残差)
  2. 列出人工设计神经网络的至少四条局限性,并各配一个具体表现
  3. 说清 NAS 的三步基本流程:定义搜索空间、定义搜索策略、性能评估
  4. 解释"用算力换经验"这一 NAS 核心动机的含义

一、问题与直觉:架构是深度学习的"隐形成本"

深度学习能走到今天,架构创新的功劳往往被低估。2006 年 Hinton 等人提出深度信念网络(DBN),把"深度学习"四个字带进大众视野;2012 年 AlexNet 在 ImageNet 竞赛里把错误率砍掉一大截,大家才真正相信"深度"这两个字值钱。这之后 VGG 加深、GoogLeNet 加宽、ResNet 加残差、DenseNet 加密集连接,一个比一个复杂,也一个比一个难设计。

问题的另一面是:这些架构没有一个是"算出来的",全是研究者拿时间堆出来的。设计一个能用的网络,要同时拍板层类型(卷积、池化、循环、注意力)、连接方式(顺序、并行、残差、密集)、超参数(卷积核尺寸、步长、通道数、激活函数),还要管网络整体是深是宽。这些选择互相纠缠——你把网络加宽一层,可能就得调学习率,接着发现梯度不稳定,然后又开始怀疑是不是层太多。人工设计本质上是在一个指数级巨大的空间里做局部搜索,而人脑的"搜索策略"只有经验加直觉。

更麻烦的是任务依赖。一个在图像分类上跑得很好的 CNN,搬到 NLP 上大概率水土不服。每换一个任务、一个数据集,之前的架构经验就要打折重来。于是研究者们琢磨:能不能让算法自己干这活?NAS 就是这么来的——它的野心不是帮人调参,而是把"架构设计"这个环节整体自动化。

二、核心原理:人工设计的四重困境

要理解 NAS 为什么值得做,先看清人工设计的四重困境,每一重都对应着 NAS 的某条设计动机。

耗时耗力。一个架构从提出到验证,要经过设计、训练、评估、返工的完整循环,动辄数周数月。SOURCE 里的原话说得直白:这种"迭代和试错"的过程效率低下,而且哪怕花够时间,也不敢保证找到的是最优架构。

依赖专家经验。架构设计没有教科书式的流程,经验才是硬通货。这意味着能设计出好网络的人永远是少数,深度学习再热闹,也绕不开"高手才有资格设计"这个瓶颈。NAS 的自动化价值在这里体现得最充分——它把门槛从"专家"降到了"会用工具的人"。

主观性强。人的直觉会固化。ResNet 的残差连接刚提出时相当反直觉——"跳过一层直接把输入加过去"怎么看都不像正经做法,可它偏偏解决了深度网络难训练的问题。SOURCE 特意举了这个例子:人类经验既可能帮我们走捷径,也可能把我们锁在思维定式里。NAS 没有这些包袱,它可以探索"人想不到"的结构。

任务依赖。图像分类的最优结构和机器翻译的最优结构几乎不可能是同一个。人工设计的架构通常是为特定任务调出来的,泛化到新任务要重新设计。NAS 至少在流程上让"换任务重搜"的成本可控——只要搜索空间和评估策略定义好,换任务只是重跑一次搜索。

上图把这四重困境画成放射状:每一条"局限性"都向下连着一个"后果"。NAS 的每一条动机,几乎都能在这四对关系里找到源头。

三、工程实践要点:NAS 的三步框架与代价

NAS 的基本流程可以压成三步:先定义搜索空间(NAS 能探索的架构范围),再定义搜索策略(怎么在这个范围里找),最后做性能评估(找到的架构表现如何)。SOURCE 给这个流程画过一张循环图——搜索策略生成架构、性能评估给反馈、不满足停止条件就回到策略继续搜,直到产出最优架构。

步骤 管什么 典型问题
定义搜索空间 能探索哪些架构 空间太大搜不完,太小找不到好解
定义搜索策略 怎么在空间里移动 随机、进化、强化学习、梯度、贝叶斯怎么选
性能评估 架构好不好 完全训练太贵,代理评估有偏差

值得提醒的是,NAS 不是免费的午餐。它把人工试错换成了算力消耗,如果评估策略选得贵(比如每个候选都完全训练),一次搜索的账单可能比十个工程师的工资还高。这也是为什么后来的研究重心一直在"降低评估成本"上——这属于第 4 章的主战场,这里先埋个伏笔。

⚠️ 常见坑:把 NAS 当成"跑起来就有好架构"的工具。搜索空间定义得不好(比如操作集合里没有残差连接),再聪明的搜索策略也只能在错误的空间里打转。定义空间本身就在表达先验。

💡 关键直觉:NAS 的动机不是"替代人类专家",而是"把专家的经验拆解成可计算的部分"。搜索空间编码了专家的先验,搜索策略编码了专家的探索方式,评估策略编码了专家的判断标准——专家没被淘汰,专家被结构化了。

四、三个关键的取舍:设计 NAS 实验前必须想清的事

理解了动机,下一步就是把这些动机翻译成实验设计里三个绕不开的取舍。SOURCE 虽然没把它们写成清单,但整节内容都在暗示这三个矛盾,这里替读者整理出来。

取舍一:搜索空间大 vs 小。动机里说"人工设计难以穷尽所有架构空间",那么空间是不是越大越好?不是。空间大了,好架构出现的概率高,但搜索效率直线下降——你只有有限的算力预算。NASNet 选择搜 Cell 而不是搜整网,本质上就是在"表达力"和"可搜索性"之间做取舍:Cell 空间小到搜得动,又大到能覆盖足够多的好结构。这个取舍会贯穿整个教程,第 2 章会把它讲透。

取舍二:搜索策略的聪明 vs 稳定。动机说"NAS 有望发现超越人类直觉的架构",但"发现"这件事本身有成本。强化学习控制器的训练不稳定,进化算法的收敛慢,梯度方法容易陷入局部最优——越是"聪明"的策略,越需要仔细调参。工程上务实的路线是先跑随机搜索当基线(第 3.6 节会讲),再决定要不要为那点性能提升支付策略复杂度。

取舍三:评估精度 vs 评估成本。动机里提到"性能评估计算成本很高",这是 NAS 从诞生起就背着的包袱。完全训练评估最准但最贵,代理评估便宜但可能带偏差。第 4 章会给出"评估阶梯"方案,但这里先记住结论:评估策略的选择,几乎决定了整个搜索预算是"花得值"还是"打水漂"。

这三个取舍不是并列的三件事,而是一条因果链:空间大小决定搜索的难度,策略选择决定搜索的效率,评估精度决定搜索信号的质量——信号质量差,前两个取舍做得再好也是空转。所以"NAS 怎么设计"这个问题的答案,永远是这三者的联合解,而不是任何单一选择。

四个真实案例,理解动机如何落地

  • AlexNet(2012):靠人工设计在 ImageNet 上一战成名,它的成功恰恰是"人工设计上限"的注脚——设计者花了大量精力试错,才定下"5 层卷积+3 层全连接"的组合
  • ResNet(2015):残差连接被证明是解决深层网络训练的关键,但它最初的设计带有强烈的"反直觉"色彩,这说明人工直觉的局限性
  • NASNet(2017):用强化学习搜索 Cell,把搜索对象从整网缩小到重复单元——这就是"用算法换经验"的第一个标志性案例
  • DARTS(2018):把离散搜索连续化,单卡几天出架构——"自动化"从口号变成了工程现实

五、常见问题:对 NAS 动机的四个典型误解

误解一:NAS 是要取代人类专家。 恰恰相反,NAS 把专家的经验拆成了可计算的部分——搜索空间编码了专家对"什么结构值得试"的判断,评估策略编码了专家对"什么算好"的标准。专家不是被淘汰,是被"结构化"了。这个视角在后面理解 DARTS 的搜索空间设计时特别有用。

误解二:NAS 只对超大模型有意义。 第 1.3 节会讲 MobileNetV3、EfficientNet-Lite 这些为移动端设计的轻量架构——NAS 的价值在"小"上同样成立,因为它能把"又小又快又准"的平衡点找出来。资源受限恰恰是 NAS 最需要发挥作用的地方,而不是反过来。

误解三:NAS 是近几年的新概念。 SOURCE 明确追溯过:1990 年代就有 Stanley 的 NEAT 用进化算法生成网络拓扑。NAS 的"新"在于 2016 年后算力足够支撑大规模搜索了——技术本身不新,条件新了。理解这段历史,就不会把 NAS 看成突然冒出来的神秘技术。

误解四:NAS 一定能找到比人工设计更好的架构。 动机里的"有望"两个字是关键词。NAS 找到好架构依赖三个前提:搜索空间装得下好解、评估策略分得清好坏、预算够支撑足够多的评估。三个前提缺一个,NAS 可能还不如一个精心设计的基线。工程上永远把"人工基线"当成参照系,而不是默认 NAS 一定赢。

一句话总结动机

人工设计把架构创新锁在"专家的经验 + 有限的试错"里;NAS 把这两者换成"明确定义的搜索空间 + 可扩展的算力"。前者是手艺,后者是流水线——这就是 NAS 的全部动机,也是它值得学的全部理由。

本节要点回顾

  • 架构是隐形成本:深度学习的性能突破高度依赖架构创新,而人工设计架构耗时、依赖经验、易受直觉束缚
  • 四重困境:耗时耗力、依赖专家、主观性强、任务依赖,是 NAS 的全部动机来源
  • 反直觉的例证:ResNet 残差连接当初被认为是反直觉设计,却解决了深层网络训练难题——这正说明人工设计的盲区
  • 三步框架:定义搜索空间 → 定义搜索策略 → 性能评估,循环到满足停止条件
  • 算力换经验:NAS 把人工试错转成算力消耗,评估成本是最大的隐藏账单

下一节我们看 NAS 的正式定义与三大支柱,把"三步框架"升级成完整的概念体系。

图1-1 NAS系统三大支柱总览

图1-1 NAS系统三大支柱总览


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U