本节摘要:自动驾驶有多种传感器,为什么 CV 是核心?本节讲摄像头和 CV 的独特价值——语义信息的唯一来源。
阅读完本节,你应当能够:
自动驾驶有摄像头、激光雷达、毫米波雷达、IMU 等传感器,但 CV(摄像头)有独特价值:提供丰富的语义信息。
| 传感器 | 测距 | 测速 | 语义 | 全天候 | 成本 |
|---|---|---|---|---|---|
| 摄像头(CV) | 弱(需估计) | 弱 | 强(类别/颜色/文字) | 弱(受光照天气) | 低 |
| 激光雷达 | 强(精确) | 中 | 中(点云形状) | 中(受雨雾) | 高 |
| 毫米波雷达 | 强 | 强(多普勒) | 弱(只知是金属物) | 强(全天候) | 中 |
| IMU | 无 | 无 | 无 | 强 | 低 |
只有摄像头能提供:
激光雷达知道"那有个物体"但不知"是什么",雷达知道"那有金属"但不知"是人还是车"。只有 CV 能回答"那是什么"。
| 场景 | 为什么只有 CV |
|---|---|
| 红绿灯识别 | 需识别颜色和状态 |
| 交通标志识别 | 需识别文字和符号 |
| 车道线类型 | 需识别颜色(黄/白)和类型(实/虚) |
| 行人意图 | 需看姿态、头部朝向 |
| 可行驶区域 | 需理解路面语义 |
CV 也有局限:
这些局限靠多传感器融合弥补(激光雷达精确测距,雷达全天候)。
CV 不是替代其他传感器,而是互补:
融合后感知最鲁棒。但 CV 是语义信息的唯一来源,不可替代。
特斯拉坚持"纯视觉"(不用激光雷达),靠摄像头+CV,理由:
但纯视觉对 CV 要求极高,测距靠神经网络估计,争议大。多数厂商(Waymo、百度)用多传感器融合。
⚠️ 纯视觉争议:特斯拉纯视觉省激光雷达降成本,但测距靠 CV 估计不如激光雷达精确,安全性有争议。多数厂商用融合方案。
💡 关键直觉:CV 是语义信息唯一来源(类别/颜色/文字/纹理),其他传感器不知"是什么"。CV 测距弱、受光照天气影响,靠融合弥补。纯视觉(特斯拉)vs 融合(多数厂商)是路线之争。
下一节概览感知系统。
摄像头的信息链路值得展开。光线经过镜头打到 CMOS 感光元件,产生原始 RAW 数据;ISP(图像信号处理器)把 RAW 转成可用的 RGB 图像,这一步要完成去马赛克、白平衡、降噪、伽马校正、HDR 合成。对自动驾驶而言,ISP 的配置直接影响 CV 的上限:HDR 合成决定强光与阴影下的可读性,自动曝光决定夜间性能,快门策略决定运动模糊。很多感知团队在数据上踩的坑,最后都追溯到 ISP 参数不一致——训练数据用一套 ISP,实车用另一套,模型精度就掉。
原始RAW -> 去马赛克 -> 白平衡 -> 降噪 -> 色彩校正 -> HDR合成 -> 供CV的RGB |<------------- ISP 处理链 --------------->|
这条链里任何一个环节退化,都会表现为感知性能下降。例如雨天后镜头沾水,图像局部模糊,检测模型对远处行人的召回率会明显下跌。所以工程上"摄像头清洗系统、镜头镀膜、ISP 参数自适应"和模型本身同等重要。
从信息内容看,摄像头输出的本质是稠密的 2D 光强分布,神经网络可以从里面解出类别、颜色、文字、纹理、形状、运动光流,甚至语义关系(前车刹车灯亮起)。激光雷达输出的是 3D 点云,能给出精确几何,但点云本身没有颜色和纹理,难以区分"白墙上贴的限速牌"和"白墙"。毫米波雷达输出的是距离与多普勒信息,对金属反射体敏感,但对静止的非金属物体(如锥桶、塑料护栏)几乎无感。也就是说,三种传感器回答问题的能力是不同的:雷达擅长"有东西在靠近",激光雷达擅长"东西在哪个精确位置",摄像头擅长"那个东西是什么、在什么状态下"。自动驾驶的很多决策——比如"红灯读秒还剩 3 秒,要不要提前滑行"——依赖的正是摄像头独有的语义能力。