5.2 特定数据类型的 NAS 本节摘要:通用 NAS 按图像数据设计,遇到文本、音频、视频、图、时间序列就水土不服。本节逐个拆解六类数据的特性与搜索空间设计要点:图像用 Cell 空间、文本搜 RNN/Transformer 组件、音频搜 TCN 与频谱特征、视频搜 3D CNN 与时空注意力、图搜 GNN 算子与聚合函数、时序搜自注意力与分解模块,并讨论跨数据类型迁移的潜力。 本节要回答的问题 阅读完本节,你应当能够: 说出六类数据的结构特性与各自最匹配的基础架构 为文本、图、时间序列三类数据设计搜索空间的关键维度 解释为什么"搜到的 CNN Cell 迁移到音频数据"不一定有效 说出特定数据 NAS 的三个核心挑战与两个未来方向 一、问题与直觉:一套搜索空间打不了天下 前几章讲的
本节摘要:通用 NAS 按图像数据设计,遇到文本、音频、视频、图、时间序列就水土不服。本节逐个拆解六类数据的特性与搜索空间设计要点:图像用 Cell 空间、文本搜 RNN/Transformer 组件、音频搜 TCN 与频谱特征、视频搜 3D CNN 与时空注意力、图搜 GNN 算子与聚合函数、时序搜自注意力与分解模块,并讨论跨数据类型迁移的潜力。
阅读完本节,你应当能够:
前几章讲的 NAS 方法,搜索空间几乎都是给图像数据设计的——Cell 里的操作是卷积、池化,堆叠方式是 CNN 那套。这是历史遗留:NAS 先在图像上爆发(NASNet、DARTS 都拿 ImageNet 当主战场),方法自然围绕图像长出来。
但现实世界的数据五花八门。文本是序列,词之间有长程依赖;图数据没有欧几里得结构,节点邻居是"关系"不是"相邻像素";时间序列有趋势和季节成分。把这些数据硬塞进图像专用的搜索空间,就像给长跑运动员配篮球鞋——能穿,但发挥不了优势。SOURCE 的观点很明确:通用 NAS 方法可能无法有效搜索到针对特定数据类型优化的架构,需要根据数据类型的特点定制搜索空间。
定制不是推翻重来,而是回答三个问题:这类数据的"基本运算"是什么(文本靠注意力、图靠消息传递)、结构的"可搜索维度"有哪些(Transformer 的头数/层数,GNN 的聚合函数)、评估的"瓶颈"在哪(长文本训练贵、视频高分辨率烧显存)。三个问题回答完,搜索空间的样子自然清晰。
图像数据。特性:二维像素阵列,局部相关性、平移/尺度/旋转不变性。主流架构 CNN。搜索空间设计最成熟:Cell-based 空间(NASNet/AmoebaNet/DARTS),操作集合含标准卷积、深度可分离卷积、空洞卷积、池化、激活、跳跃连接。宏架构搜 Cell 堆叠方式(深度宽度),微架构搜 Cell 内部操作与连接。这是 NAS 的"母语"场景,其他数据类型的设计都拿它做参照。
文本数据。特性:序列结构、长程依赖、语义歧义、词汇表巨大。主流架构 RNN(LSTM/GRU)或 Transformer。搜索维度:循环单元内部结构(门控机制、激活、连接——Auto-LSTM 就干这个)、Transformer 组件(注意力头数、层数、前馈网络结构、稀疏注意力)、词嵌入方法(Word2Vec、GloVe、FastText 的选择)。评估瓶颈:长文本训练贵、语言模型评估慢,可微 NAS 在文本上用得少,进化/强化学习更常见。
音频数据。特性:一维时序信号,时域+频域双重特征。架构常是 CNN 提频谱特征 + RNN 建模时序。搜索维度:CNN/RNN 组合结构、时间卷积网络 TCN 的层数/卷积核/空洞率、语音识别专用模块(CTC Loss、注意力机制)的组合方式。挑战:噪声鲁棒性、变长音频。
视频数据。特性:图像序列,时空结构。主流架构 3D CNN 或 2D CNN+RNN。搜索维度:3D CNN 结构、2D CNN 与 RNN 的组合、时空注意力机制。挑战:显存爆炸——高分辨率视频帧训练评估成本极高,代理任务几乎是必须的。
图数据。特性:非欧几里得结构、节点边属性、复杂关系模式。主流架构 GNN。搜索维度:图卷积算子(GCN、GAT、GraphSAGE 的选择)、聚合函数(Mean/Max/Sum)、消息传递机制(邻居聚合、多跳聚合)、图池化层。挑战:图结构复杂多样,消息传递机制的设计直接决定表达力。
时间序列数据。特性:随时间变化的序列,趋势与季节成分。主流架构 RNN/Transformer/TCN。搜索维度:模型结构、自注意力机制(捕捉长程依赖)、时间序列分解模块(季节性分解、趋势分解)。应用场景:预测未来趋势、捕捉长期依赖。
跨数据类型迁移。SOURCE 把"能否将在一个数据类型上学习到的知识迁移到其他数据类型"列为有潜力的方向。图像上搜出的 CNN Cell 迁移到音频,结构上能复用一部分(卷积天然适合频谱图),但音频的时序依赖、图的非欧结构无法用图像 Cell 表达。迁移的边界在于"基础运算是否同构"——卷积类结构可跨图像/音频迁移,注意力和循环类结构可跨文本/时序迁移,GNN 几乎只能图内复用。
| 数据类型 | 主流架构 | 搜索关键维度 | 代表方向 |
|---|---|---|---|
| 图像 | CNN | Cell 操作与连接 | NASNet、DARTS |
| 文本 | RNN/Transformer | 循环单元、注意力头数层数 | Auto-LSTM、Transformer-NAS |
| 音频 | CNN+RNN/TCN | 频谱特征、TCN 空洞率 | 声学模型 NAS |
| 视频 | 3D CNN | 时空模块、注意力 | 动作识别 NAS |
| 图 | GNN | 算子、聚合函数、消息传递 | 图卷积算子搜索 |
| 时序 | RNN/Transformer/TCN | 自注意力、分解模块 | 预测模型 NAS |
抓手一:从"基本运算"出发定操作集合。图像空间的操作集合是卷积池化,文本空间就该是注意力头、前馈网络、门控单元,图空间就该是 GCN/GAT/GraphSAGE 算子。操作集合的定义是搜索空间的"母语"——母语选错了,空间再大也表达不出这类数据的规律。定操作集合前,先想清楚"这类数据靠什么运算提取特征"。
抓手二:评估瓶颈要提前规划。SOURCE 专门提醒:长文本序列、高分辨率视频在完整数据集上训练评估的代价很高,需要使用代理任务或采样策略加速评估。特定数据 NAS 的评估策略,常常比搜索策略更关键——文本语言模型的单次评估动辄数天,不提前规划代理任务,搜索根本跑不完。
抓手三:用迁移降低冷启动成本。别从零开始设计空间。图像分类上验证过的 Cell 空间骨架,可以迁移到医学图像这类"同构"数据,只改操作集合的一小部分;Transformer 空间骨架可以迁移到不同 NLP 任务。迁移的前提是验证"结构同构性",别硬搬。
⚠️ 常见坑:把图像搜出的 Cell 直接用于图数据。图的非欧几里得结构没有"像素邻域"概念,卷积类操作无法直接定义——必须换成图卷积、消息传递这类图原生操作,否则搜出来的架构在图上根本跑不起来。
💡 关键直觉:特定数据 NAS 的定制对象是"基本运算",不是"搜索算法"。搜索算法(进化、梯度、贝叶斯)可以通用,但"操作集合 + 可搜索维度"必须按数据类型重画——数据决定了空间的语言,算法只是在这门语言里写诗。
图像 NAS 成熟得最早,Cell 空间、操作集合、评估协议都是现成的。把图像经验迁移到其他数据时,SOURCe 反复提醒的"结构同构性"是检验标尺:音频频谱图是二维的,卷积的"局部相关性"假设仍然成立——图像 Cell 可以部分迁移;文本没有"相邻像素",卷积的局部性假设不成立——必须换注意力/循环单元;图的非欧结构连"邻域"的定义都不一样——必须换消息传递。一个务实的迁移检查:把图像 Cell 的"卷积"换成"目标数据的原生算子"(文本换注意力、图换 GCN),其余结构(堆叠、跳跃、Normal/Reduction 分工)保留——这就是大多数跨数据 NAS 的实际做法。
图数据 NAS 是特定数据 NAS 里结构差异最大的,SOURCe 给了四个搜索维度:图卷积算子(GCN、GAT、GraphSAGE 的选择)、聚合函数(Mean、Max、Sum)、消息传递机制(邻居聚合、多跳聚合)、图池化层。四个维度各有讲究:算子决定"怎么聚合邻居信息",聚合函数决定"聚合的统计量",消息传递机制决定"信息传播几跳",图池化决定"图怎么缩小"。工程上手时从"算子 + 聚合函数"两个维度起步(变化最直接),消息传递和图池化先用固定设计,跑通后再放开。
SOURCe 在 5.2 节明确提醒:长文本序列、高分辨率视频在完整数据集上训练评估的代价很高,需要使用代理任务或采样策略加速评估。文本 NAS 的评估尤其重——语言模型的训练和评估都慢,一个候选动辄数天。工程应对:代理任务(截断序列长度、减少训练步数);权重共享(超网络同时容纳多个 Transformer 变体);以及"先在小语料上粗搜、再在大语料上精评"的两段式。可微 NAS 在文本上用得少,正是因为这个评估瓶颈——进化/强化学习虽然评估多,但可以配便宜评估,反而更可行。
时间序列 NAS 的搜索对象除了模型结构,还包括两个独特维度:自注意力机制(捕捉长程依赖)和时间序列分解模块(季节性分解、趋势分解)。SOURCe 把它们单列,是因为时序预测的性能高度依赖"能不能把趋势和季节分开建模"。工程上的做法:搜索空间里同时包含"结构选择"(RNN/Transformer/TCN)和"分解方式"(要不要分解、分解成几部分),让算法自己发现"这个序列适合分解成趋势+季节建模"——这比人手工选分解方式更能适应不同序列。
结构上类似,但搜索对象不一样。视频 NAS 要搜的时空模块(3D CNN 结构、时空注意力机制)是"空间+时间"联合的,不是简单拼一个图像骨干加一个 RNN。SOURCe 在 5.2 节把视频单独列一类,搜"3D CNN 结构或 2D CNN 和 RNN 的组合结构"以及"时空注意力机制"——它的独特之处在于"时间维度如何与空间维度融合",这是纯图像或纯时序 NAS 都不涉及的。
不完全一样。音频 NAS 关注"音频数据"的通用架构(特征提取、时序建模),语音识别 NAS 关注"语音任务"的完整流程(声学模型+语言模型+解码器,第 5.3 节)。一个偏数据形态,一个偏任务流程。工程上做语音识别用任务视角,做音乐/环境音分析用数据视角——两条线的搜索对象和评估指标都不同。
能迁的是"方法论"(搜索策略、评估阶梯、编码框架),必须重搜的是"搜索空间"(操作集合、结构维度)。SOURCe 在 5.2 节把"跨数据类型的知识迁移"列为研究方向,意思是有潜力但尚未成熟。当前务实的边界:同族数据(图像↔音频频谱图)的操作集合可以部分复用;异族数据(图像↔图)连操作定义都不同,必须从零设计空间。迁移前先做小规模验证,别默认"长得像就能迁"。
SOURCe 的 5.2 节没有单列多模态,但它的框架可以直接延伸:多模态 = 多套搜索空间的组合。每个模态一套原生算子(图像用卷积、文本用注意力),加上"融合模块"的搜索(在哪里融合、怎么融合、融合后怎么处理)。注意组合后搜索空间是各模态空间的乘积——会指数膨胀,所以多模态 NAS 通常先分别搜各模态的子结构,再只搜融合方式,两段式控制空间大小。
下一节看特定任务的 NAS——检测、分割、NLP 各要搜什么。