本节摘要:感知系统是自动驾驶的眼睛和耳朵。本节概览感知系统的组成、数据流和典型架构——建立全局图景。
阅读完本节,你应当能够:

感知系统四部分:
典型自动驾驶车传感器配置:
传感器原始数据 → 预处理(去畸变/同步)→ 各感知任务并行 → 融合 → 环境模型
实时性要求高:每帧 30Hz+(33ms 内),多任务并行在 GPU/NPU 上。
| 架构 | 特点 |
|---|---|
| 模块化 | 检测/跟踪/预测分模块,可解释强 |
| 端到端 | 图像直接到控制,简单但黑盒 |
多数厂商用模块化(可解释、可调试),学术界探索端到端。
现代感知趋势:多摄像头特征统一到 BEV(鸟瞰图)空间,在 BEV 做检测/分割,类似激光雷达视角。代表:BEVFormer、PETR。
感知系统输出给决策规划:
| 指标 | 要求 |
|---|---|
| 延迟 | <33ms(30Hz) |
| 检测精度 | 高召回(漏检致命) |
| 鲁棒性 | 全天候、长尾 |
| 冗余 | 多传感器互备 |
⚠️ 实时性:感知每帧 33ms 内完成,否则决策控制跟不上。模型要轻量+硬件加速,不能只追求精度。
💡 关键直觉:感知系统=传感器→预处理→CV任务→融合→输出。多传感器配置(摄像头+激光雷达+雷达),实时性要求高(30Hz),模块化架构为主,BEV 是趋势。输出障碍物/车道线/标志/地图给决策。
第 1 章结束。下一章讲核心视觉任务。
多传感器融合的第一步是时间同步。摄像头 30Hz 出帧,激光雷达 10Hz 出点云,毫米波雷达 50Hz 出目标,三者的数据到达时刻并不同步。工程上通常以主传感器(一般是摄像头或激光雷达)的时间戳为基准,其他传感器按最邻近时间戳或插值方式对齐。若对齐误差超过几十毫秒,高速场景下的融合结果就会明显错位。
t=0ms 摄像头帧(C1) LiDAR帧(L1) t=33ms 摄像头帧(C2) t=100ms LiDAR帧(L2) 对齐规则:以 C 帧时间为基准,取最邻近的 L 帧 C1->L1, C2->L1, C3->L2 ...
对齐之后是坐标变换。传感器坐标(相机坐标系、雷达极坐标系)要统一到车体坐标系:先做外参标定(传感器相对车体的旋转 R 和平移 t),再做时间对齐,最后统一到车体。这套变换矩阵的精度直接决定融合质量,外参标定是部署团队每年都要反复校验的环节——车辆在产线装配、长期行驶颠簸后,外参都可能漂移。
一套量产感知系统,车上有 6-12 路摄像头、1-5 个激光雷达,感知任务跑在多块计算芯片上。典型的做法是把任务按算力分成多个流水线:前向主感知(检测加分割加车道线)跑在主算力芯片(如 NVIDIA Orin),环视与泊车感知跑在低功耗芯片,预测规划在融合后的环境模型之上再跑。任务之间用固定帧率节拍调度,例如感知 30Hz、融合 10Hz、预测 10Hz、规划 10Hz。这种分级节拍是工程实践里很关键的设计——不是所有任务都要 30Hz,把算力给真正需要它的任务,是控制功耗和发热的现实约束。