第 8 章 计算机视觉


文档摘要

第 8 章 计算机视觉 从最基础的像素开始,一路走到目标检测、语义分割、图像生成乃至三维重建——本章覆盖让机器"看懂"世界的全部核心技术。你将理解图像如何在数学上被表示、卷积神经网络如何从像素中自动学到有用的特征、模型如何定位并勾勒每一个物体、生成模型如何凭空创造出逼真的图像,以及机器人如何在时间和三维空间中感知与导航。 本章简介 计算机视觉(Computer Vision)是人工智能中历史最久、应用最广的领域之一,它的目标是让机器能够从图像和视频中提取信息、理解世界。从手机里的人脸解锁,到自动驾驶汽车识别行人和车道,再到医疗影像里的病灶检测,以及当下最热门的文本生成图像模型——背后都离不开视觉技术。

第 8 章 计算机视觉

从最基础的像素开始,一路走到目标检测、语义分割、图像生成乃至三维重建——本章覆盖让机器"看懂"世界的全部核心技术。你将理解图像如何在数学上被表示、卷积神经网络如何从像素中自动学到有用的特征、模型如何定位并勾勒每一个物体、生成模型如何凭空创造出逼真的图像,以及机器人如何在时间和三维空间中感知与导航。

本章简介

计算机视觉(Computer Vision)是人工智能中历史最久、应用最广的领域之一,它的目标是让机器能够从图像和视频中提取信息、理解世界。从手机里的人脸解锁,到自动驾驶汽车识别行人和车道,再到医疗影像里的病灶检测,以及当下最热门的文本生成图像模型——背后都离不开视觉技术。本章会带你从底层像素出发,依次学习经典图像处理、卷积神经网络、目标检测与分割、视觉 Transformer 与生成模型,最后延伸到视频和三维视觉,建立一整套完整的"机器之眼"知识体系。理解这些内容,不仅能应对 DeepMind、OpenAI 等岗位的面试,更是进入多模态 AI、机器人、AR/VR 等前沿方向的必备基础。

本章小节

  • 图像基础(Image Fundamentals):像素、色彩空间(RGB/HSV/LAB)、针孔相机模型、空间滤波、边缘检测(Sobel、Canny)、直方图、以及 SIFT、ORB 等经典特征描述子——任何模型看到图像之前都要经过的底层处理。
  • 卷积神经网络(Convolutional Networks):卷积、池化、步长、空洞卷积、感受野等核心机制,以及从 LeNet、AlexNet、VGG、ResNet 到 EfficientNet、MobileNet 的架构演进史。
  • 目标检测与分割(Detection and Segmentation):IoU、mAP、锚框、R-CNN 家族、YOLO、SSD、RetinaNet,以及语义/实例/全景分割(U-Net、Mask R-CNN)等。
  • 视觉 Transformer 与生成模型(Vision Transformers and Generation):ViT、DeiT、Swin、DINO、MAE 等自注意力视觉模型,以及 GAN、VAE、扩散模型、流匹配等图像生成方法。
  • 视频与三维视觉(Video and 3D Vision):光流、SlowFast、视频目标跟踪(SORT、DeepSORT)、立体与单目深度估计、NeRF、三维高斯泼溅、SLAM 等。

学习路径

  • 前置知识:建议先学完第 1 到第 7 章,尤其是第 2 章的线性代数(矩阵运算、特征值)、第 3 章的微积分(梯度、泰勒展开、傅里叶变换)、第 4 章的概率统计(直方图、方差、CDF)、第 5 章的优化与概率图模型(CRF、贝叶斯更新、交叉熵),以及最重要的第 6 章深度学习(CNN 基础、卷积、注意力机制、梯度下降、BatchNorm、Dropout、VAE)。第 7 章的 Transformer 与 BERT 是理解 ViT 和掩码图像建模的关键。
  • 后续章节:本章是第 10 章多模态学习的视觉基石——视觉-语言模型(如 CLIP、Flamingo)把本章的视觉编码器和语言模型结合起来。第 11 章自主系统(机器人、自动驾驶)会大量用到目标检测、跟踪、SLAM、深度估计等技术。如果你对生成式 AI 感兴趣,第 8 章的扩散模型和 GAN 是后续生成内容(图像、视频、3D)方向的核心。

关键概念速览

  • 卷积(Convolution):滤波器在图像上滑动、逐位置做加权求和的运算,是 CNN 提取局部特征的基本操作,也是经典图像处理(模糊、边缘检测)的基础。
  • 感受野(Receptive Field):某一层神经元能"看到"的原始输入区域;网络越深,感受野越大,能捕捉的物体结构也越大。
  • IoU / mAP:衡量检测框与真值框重叠程度的指标(IoU),以及跨类别平均后的检测精度指标(mAP),是评估检测模型的事实标准。
  • 锚框(Anchor Box):预定义的一组不同尺度和长宽比的参考框,检测器在其基础上预测偏移量,让边界框回归问题更容易学习。
  • 自注意力(Self-Attention):让序列中每个位置都能"看到"其他所有位置的机制;视觉 Transformer 把图像切成块序列后用它处理空间关系。
  • 扩散模型(Diffusion Model):通过逐步加噪和反向去噪来生成图像的一类模型,是当前图像生成的主流范式,Stable Diffusion 等都建立在它之上。

作者与出处
原作者: HenryNdubuaku
来源:HenryNdubuaku
许可证:Apache-2.0
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U