1.2 计算机视觉在感知系统中的重要性


1.2 计算机视觉在感知系统中的重要性

本节摘要:自动驾驶有多种传感器,为什么 CV 是核心?本节讲摄像头和 CV 的独特价值——语义信息的唯一来源。

本节目标

阅读完本节,你应当能够:

  1. 理解 CV 的独特价值
  2. 对比 CV 和其他传感器
  3. 说明 CV 不可替代的场景

概念脉络

为什么 CV 是感知核心

自动驾驶有摄像头、激光雷达、毫米波雷达、IMU 等传感器,但 CV(摄像头)有独特价值:提供丰富的语义信息

各传感器对比

传感器 测距 测速 语义 全天候 成本
摄像头(CV) 弱(需估计) 强(类别/颜色/文字) 弱(受光照天气)
激光雷达 强(精确) 中(点云形状) 中(受雨雾)
毫米波雷达 强(多普勒) 弱(只知是金属物) 强(全天候)
IMU

CV 的独特价值:语义信息

只有摄像头能提供:

  • 类别识别:这是车、人、自行车、还是交通标志
  • 颜色:红绿灯颜色、车道线颜色
  • 文字:交通标志上的文字、限速数字
  • 纹理:路面材质、车道线类型

激光雷达知道"那有个物体"但不知"是什么",雷达知道"那有金属"但不知"是人还是车"。只有 CV 能回答"那是什么"

CV 不可替代的场景

场景 为什么只有 CV
红绿灯识别 需识别颜色和状态
交通标志识别 需识别文字和符号
车道线类型 需识别颜色(黄/白)和类型(实/虚)
行人意图 需看姿态、头部朝向
可行驶区域 需理解路面语义

CV 的局限

CV 也有局限:

  • 测距弱:单目难精确测距,需双目或融合
  • 受光照影响:强光、阴影、夜间、逆光
  • 受天气影响:雨雾雪遮挡
  • 计算量大:深度学习模型重

这些局限靠多传感器融合弥补(激光雷达精确测距,雷达全天候)。

CV 与其他传感器的关系

CV 不是替代其他传感器,而是互补

  • CV 提供语义(是什么)
  • 激光雷达提供精确 3D(在哪、多远)
  • 雷达提供速度和全天候(多快、恶劣天气)
  • IMU 提供自身运动(我在动)

融合后感知最鲁棒。但 CV 是语义信息的唯一来源,不可替代。

特斯拉的纯视觉路线

特斯拉坚持"纯视觉"(不用激光雷达),靠摄像头+CV,理由:

  • 摄像头信息最丰富
  • 人开车只靠眼睛
  • 激光雷达贵且冗余

但纯视觉对 CV 要求极高,测距靠神经网络估计,争议大。多数厂商(Waymo、百度)用多传感器融合。

⚠️ 纯视觉争议:特斯拉纯视觉省激光雷达降成本,但测距靠 CV 估计不如激光雷达精确,安全性有争议。多数厂商用融合方案。

💡 关键直觉:CV 是语义信息唯一来源(类别/颜色/文字/纹理),其他传感器不知"是什么"。CV 测距弱、受光照天气影响,靠融合弥补。纯视觉(特斯拉)vs 融合(多数厂商)是路线之争。

一节小结

  • CV 核心:提供语义信息(类别/颜色/文字/纹理),其他传感器不能。
  • 对比:CV 语义强但测距弱、受光照天气影响;激光雷达精确 3D;雷达全天候测速。
  • 不可替代:红绿灯、交通标志、车道线类型、行人意图、可行驶区域。
  • 局限:测距弱、受光照天气、计算量大,靠融合弥补。
  • 关系:CV 互补其他传感器,是语义唯一来源。
  • 路线:纯视觉(特斯拉)vs 融合(多数厂商),争议在成本与安全。

下一节概览感知系统。

摄像头信息链:从光子到语义

摄像头的信息链路值得展开。光线经过镜头打到 CMOS 感光元件,产生原始 RAW 数据;ISP(图像信号处理器)把 RAW 转成可用的 RGB 图像,这一步要完成去马赛克、白平衡、降噪、伽马校正、HDR 合成。对自动驾驶而言,ISP 的配置直接影响 CV 的上限:HDR 合成决定强光与阴影下的可读性,自动曝光决定夜间性能,快门策略决定运动模糊。很多感知团队在数据上踩的坑,最后都追溯到 ISP 参数不一致——训练数据用一套 ISP,实车用另一套,模型精度就掉。

原始RAW -> 去马赛克 -> 白平衡 -> 降噪 -> 色彩校正 -> HDR合成 -> 供CV的RGB |<------------- ISP 处理链 --------------->|

这条链里任何一个环节退化,都会表现为感知性能下降。例如雨天后镜头沾水,图像局部模糊,检测模型对远处行人的召回率会明显下跌。所以工程上"摄像头清洗系统、镜头镀膜、ISP 参数自适应"和模型本身同等重要。

语义信息为什么不可替代

从信息内容看,摄像头输出的本质是稠密的 2D 光强分布,神经网络可以从里面解出类别、颜色、文字、纹理、形状、运动光流,甚至语义关系(前车刹车灯亮起)。激光雷达输出的是 3D 点云,能给出精确几何,但点云本身没有颜色和纹理,难以区分"白墙上贴的限速牌"和"白墙"。毫米波雷达输出的是距离与多普勒信息,对金属反射体敏感,但对静止的非金属物体(如锥桶、塑料护栏)几乎无感。也就是说,三种传感器回答问题的能力是不同的:雷达擅长"有东西在靠近",激光雷达擅长"东西在哪个精确位置",摄像头擅长"那个东西是什么、在什么状态下"。自动驾驶的很多决策——比如"红灯读秒还剩 3 秒,要不要提前滑行"——依赖的正是摄像头独有的语义能力。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U