4.3 NLP与CV中的深度学习应用


4.3 NLP 与 CV 中的深度学习应用

本节摘要:自然语言处理与计算机视觉是深度学习落地最深两大领域。NLP 走过词嵌入、循环网络、注意力到 Transformer 的路线,预训练-微调范式(BERT 理解路线、GPT 生成路线)彻底取代了人工特征工程;CV 则由卷积网络统治,从 AlexNet 到 ResNet 的架构竞赛解决了分类,进而发展出两阶段与单阶段的目标检测、语义与实例分割,Vision Transformer 又把注意力带入视觉。两大领域的技术正在多模态框架下融合。

本节地图

阅读完本节,你应当能够:

  1. 概述 NLP 表示方法的演进(TF-IDF → 词嵌入 → 上下文相关表示);
  2. 列举 NLP 的主要任务与代表模型;
  3. 说明卷积-池化结构在 CV 中的作用链条;
  4. 区分两阶段与单阶段目标检测器;
  5. 区分语义分割与实例分割;
  6. 说出迁移学习在 CV 中为何重要。

一、NLP:从数词到懂语言

深度学习之前,文本被表示成词频统计(TF-IDF)或 N 元组——"苹果发布了新手机"和"手机被苹果发布"在这种表示下几乎无差别,语义完全丢失。

第一步突破是词嵌入:把每个词映射为低维稠密向量,语义相近的词在向量空间相邻,甚至存在"国王减男人加女人约等于女王"这样的代数结构。Word2Vec、GloVe 是静态嵌入的代表;ELMo、BERT 则把表示升级为上下文相关——同一个"苹果"在水果新闻与科技新闻里得到不同向量,语义理解能力大幅跃升。

模型主线上,LSTM/GRU 曾长期担任序列建模主力,注意力机制先作为附加组件增强翻译模型,2017 年 Transformer 全面接管。随后预训练-微调成为标准范式:先在海量无标注语料上自监督预训练(掩词预测或下一词预测),再用少量标注数据微调到具体任务。

NLP 任务 做什么 代表技术路线
文本分类 情感分析、垃圾邮件、主题归类 CNN/微调预训练模型
机器翻译 跨语言转换 Seq2Seq 加注意力 → Transformer
命名实体识别 标出人名地名机构名 Bi-LSTM-CRF → BERT
问答系统 从文本抽取或生成答案 BERT 抽取式、GPT 生成式
文本生成 写作、对话、代码 GPT 系自回归生成
语音识别 语音转文字 CNN 加 RNN 加注意力混合结构

二、CV:让机器看懂图像

卷积网络的典型流水线在 3.2 节已拆解:卷积提局部特征、激活加非线性、池化降采样,堆叠若干轮后接全连接层输出类别。浅层学边缘纹理、深层学部件与物体,层次化表示是性能的来源。

但"分类"只回答"图里主要是什么",应用需要更精细的三级任务:

  • 图像分类:整图一个标签;
  • 目标检测:找出所有感兴趣物体的位置(边界框)与类别。两条路线——两阶段(R-CNN 系列:先生成候选区域再逐一分类回归,精度高速度慢)与单阶段(YOLO、SSD:一次前向直接预测各位置类别与框,快、适合实时);
  • 图像分割:像素级分类。语义分割(U-Net、FCN)给每个像素打类别标签,不区分同类的不同个体;实例分割(Mask R-CNN)在此基础上区分个体——图像里的每一个人单独一块掩码。
任务 输出粒度 回答的问题 代表模型
分类 整图标签 这是什么图 AlexNet、VGG、ResNet
目标检测 边界框加类别 什么在哪里 Faster R-CNN、YOLO
语义分割 每像素类别 哪些像素属于天空 FCN、U-Net
实例分割 像素加个体编号 第几个人在哪里 Mask R-CNN
姿态估计 关键点坐标 关节在什么位置 OpenPose 类

迁移学习是 CV 工程的基石:直接训练高性能视觉模型需要海量标注(如 ImageNet 级别),但拿在大数据集上预训练好的网络,冻结浅层、只微调末几层,就能在小数据集上达到可用精度——医疗影像、工业质检这些标注昂贵的领域全靠这条路。

三、融合:注意力进军视觉,模态走向统一

Transformer 反哺视觉:ViT 把图像切成 16 乘 16 的小块,每块当一个"词",序列输入 Transformer,在大数据上取得了与卷积网络比肩乃至更优的表现。更深远的是多模态:CLIP 用对比学习把图像与文本嵌入同一空间,实现零样本的图文检索与分类;DALL-E 类模型接收文字描述直接生成图像;扩散模型近年又在生成质量上超越了 GAN。语言、视觉、音频正在被"切块加注意力"的统一范式吸收。

一个值得记的判断:领域间的壁垒正在从"架构"层面消失——卷积之于视觉、循环之于语言的历史分工已被统一的注意力架构替代,剩下的差异主要是数据形态与预处理。

💡 关键直觉:选检测模型先看延迟预算。在线视频分析要毫秒级响应就选单阶段(YOLO 系);离线分析追求最高精度、不在乎一图几百毫秒,就选两阶段或其现代变体。

⚠️ 常见坑:在几千张自采图像上从头训练深层卷积网络。没有 ImageNet 级数据量,结果几乎必然过拟合——应当从预训练模型微调起步,这一点对小数据团队几乎是铁律。

四、落地视角:从任务到产品的距离

NLP 落地的三个现实。 其一,预训练模型微调已是标准动作,但微调数据仍要几百上千条标注——零样本能力在变强,但关键业务仍靠领域数据喂。其二,语言模型会"自信地胡说"(幻觉),生产系统必须配检索增强或事实校验层,把生成约束在可靠来源上。其三,部署成本可控性差:大模型推理的显存与延迟开销,常迫使工程上做量化、蒸馏或用小模型加大模型的分工。

CV 落地的三个现实。 其一,数据比模型更贵——工业质检里几百张缺陷图的标注成本轻松超过模型开发成本,缺陷样本稀缺使异常检测路线(而非常规分类)成为主流。其二,环境鲁棒性是隐形门槛:光照、角度、遮挡稍有变化性能即滑落,训练数据必须覆盖部署环境的真实分布,这解释了为什么现场采集比公开数据集重要。其三,延迟与算力约束常决定架构:端侧摄像头里跑的必然是轻量网络,而非学术榜上的巨无霸。

选任务就是选战场。 两领域任务难度与价值的梯度一致:分类最成熟竞争最烈,检测分割次之,生成与多模态最新但工程化最浅。团队切入时建议"成熟任务加自有数据"的组合——技术风险低,数据壁垒构成差异化;反之"新任务加公开数据"的组合风险极高。

常见问题

先解决"有没有模型"还是"有没有数据"? 数据。两个同水平团队,一个有十万条领域标注、一个只有公开数据集,前者的产品大概率胜出——模型人人能下载,数据才是护城河。立项评估时数据资产盘点应先于算法选型。

怎么评估一个视觉模型能不能上车? 三步:在自定义测试集(覆盖部署环境的各种条件)上看指标;按错误类型分解(漏检与误检的代价不同);小流量真实环境试运行。公开榜单分数只能说明"模型不差",不能说明"在你场景能用"。

文本任务用规则还是模型? 用梯度:模式极其稳定的子任务(如固定格式的字段抽取)规则又快又准;语义相关的任务(意图理解、情感、生成)规则维护成本爆炸,尽早模型化。实践中最优解常是"模型加规则兜底"的混合管线。

一节小结

  • NLP 表示演进:词频统计 → 静态词嵌入 → 上下文相关表示,语义逐步被保留;
  • 范式革命:预训练加微调取代人工特征工程,BERT 主理解、GPT 主生成;
  • CV 任务金字塔:分类 → 检测(两阶段精、单阶段快)→ 分割(语义分区域、实例分个体);
  • 迁移学习是 CV 基石:小数据任务从预训练模型微调起步;
  • ViT 与多模态:切块当序列让注意力统一视觉,图文同空间开启零样本能力;
  • 架构壁垒消失:数据形态的差异正在取代架构的差异成为领域分界。

算法能力至此全部讲完。最后一章回到地面:数据、评估、部署与伦理——决定模型能否真正产生价值的工程闭环。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U