3.2 视觉 SLAM 与激光 SLAM:主流流派对比


文档摘要

3.2 视觉 SLAM 与激光 SLAM:主流流派对比 数学框架统一,但传感器不同,工程实现天差地别。视觉 SLAM 和激光 SLAM 是两条平行发展的技术树,各自有顶尖代表作品。 3.2.1 视觉 SLAM 与激光 SLAM 的根本差异 维度 | 视觉 SLAM | 激光 SLAM 传感器 | 相机(单目/双目/RGB-D) | 激光雷达(2D/3D LiDAR) 观测类型 | 2D 像素特征(点、线、面) | 3D 距离点云 优势场景 | 纹理丰富、有语义信息 | 几何结构清晰、长距离精准 弱点 | 弱纹理(白墙)失败、对光照敏感 | 缺乏语义、镜面/玻璃失效 典型精度 | 1-3% 路程漂移 | 0.

3.2 视觉 SLAM 与激光 SLAM:主流流派对比

数学框架统一,但传感器不同,工程实现天差地别。视觉 SLAM 和激光 SLAM 是两条平行发展的技术树,各自有顶尖代表作品。

3.2.1 视觉 SLAM 与激光 SLAM 的根本差异

维度 视觉 SLAM 激光 SLAM
传感器 相机(单目/双目/RGB-D) 激光雷达(2D/3D LiDAR)
观测类型 2D 像素特征(点、线、面) 3D 距离点云
优势场景 纹理丰富、有语义信息 几何结构清晰、长距离精准
弱点 弱纹理(白墙)失败、对光照敏感 缺乏语义、镜面/玻璃失效
典型精度 1-3% 路程漂移 0.5-1% 路程漂移
典型成本 相机便宜(百元级) LiDAR 贵(万元级起)
代表方法 ORB-SLAM、VINS-Fusion、DROID-SLAM LOAM、LIO-SAM、Cartographer

💡 选型直觉:室内机器人(家庭服务、仓储)倾向激光 SLAM + 视觉辅助;室外大场景(自动驾驶、巡检)倾向 LiDAR 主导 + 视觉补语义;消费级 AR/VR 受成本约束倾向纯视觉。当前融合 SLAM(视觉 + LiDAR + IMU)是高端方案。

3.2.2 视觉 SLAM 的两大流派

视觉 SLAM 内部又分两大流派,按是否直接用像素灰度划分:

流派 思路 优势 劣势 代表
特征法(间接法) 提取特征点(ORB、SIFT),匹配特征做优化 鲁棒、对光照变化容忍度高 丢失纹理外的信息 ORB-SLAM 系列
直接法 直接用像素灰度做光度误差优化 信息完整、能建稠密地图 对光照敏感、需要光度标定 DSO、LSD-SLAM
混合法 特征 + 直接结合 折中 复杂 SVO、VINS

3.2.3 ORB-SLAM:特征法视觉 SLAM 的标杆

ORB-SLAM(2015-2017)是特征法视觉 SLAM 的集大成之作,支持单目、双目、RGB-D 三种相机。它的系统架构完美对应上一节的三段式:

ORB 特征为什么被选中

ORB(Oriented FAST and Rotated BRIEF)是 ORB-SLAM 选用的特征点。它具备:

  • 极快提取:比 SIFT/SURF 快一个数量级,满足实时性。
  • 旋转不变性:加了主方向估计,对相机旋转鲁棒。
  • 尺度不变性:通过图像金字塔实现多尺度。
  • 二进制描述子:匹配用汉明距离,CPU 位运算即可。

关键创新:词袋模型用于回环

ORB-SLAM 的回环检测用 DBoW2(Bag of Words,词袋模型):把所有 ORB 描述子聚类成「视觉词典」,每帧图像编码为「视觉单词直方图」。新帧的直方图与历史关键帧比对,相似度高就触发回环候选。这一思路后来被无数 SLAM 系统继承。

ORB-SLAM 系列演进

版本 增加能力 年代
ORB-SLAM 单目 2015
ORB-SLAM2 单目 + 双目 + RGB-D 2017
ORB-SLAM3 + IMU 紧耦合 + 多地图 2020

⚠️ ORB-SLAM 的局限:稀疏点云地图只能用于定位,不能直接用于导航避障或操作。后期的稠密建图模块(如 ORB-SLAM with Dense Mapping)补救了这点,但稠密地图依然不如 LiDAR 精确。

3.2.4 VINS-Fusion:视觉-惯性紧耦合 SLAM

VINS-Fusion(港科大,2018)是视觉-惯性(VI)紧耦合 SLAM 的代表。它把单目/双目相机 + IMU 的数据在因子图层面融合,而不是松耦合(视觉和 IMU 各算各的最后拼)。

紧耦合的关键:IMU 预积分

IMU 采样率 200-1000Hz,相机 30Hz。如果每来一个 IMU 读数都加一个因子,因子图会爆炸。IMU 预积分(Pre-integration)的思路是:把两帧相机之间的所有 IMU 读数积分成一个「虚拟测量」,作为一个因子加入因子图:

Δp, Δv, Δq = ∫_{t_k}^{t_{k+1}} (a, ω) dt # 预积分位置、速度、姿态变化

预积分的巧妙在于:它与位姿无关(不依赖绝对坐标系),所以即使位姿在优化中更新,预积分量也无需重算(除了 bias 修正)。

VINS 的优势

  • 快速运动鲁棒:IMU 提供高频运动估计,弥补相机模糊时的丢失。
  • 尺度可观测:单目视觉没有绝对尺度(双目有),但 IMU 通过加速度积分提供尺度。
  • 实时性好:滑窗优化(只优化最近 N 帧)而非全批量,实时运行。

VINS-Fusion 已成为无人机、AR/VR 头显、移动机器人视觉惯性 SLAM 的事实标准之一。

3.2.5 直接法与端到端:DSO 与 DROID-SLAM

DSO(Direct Sparse Odometry) 是直接法的代表:不提特征,直接用像素灰度做光度误差优化。它的优势是信息利用完整,劣势是对光度标定(曝光、增益、几何畸变)极敏感。

最近两年的趋势是端到端深度学习 SLAM

  • DROID-SLAM(普林斯顿,2021):用循环神经网络 + 光流相关性,端到端从图像序列直接预测位姿。
  • NICE-SLAM / Co-SLAM:用 NeRF 表征地图,端到端可微 SLAM。
  • Gaussian-SLAM / SplaTAM:用 3D Gaussian Splatting 作为地图表征。

💡 趋势判断:传统 SLAM(ORB-SLAM、VINS)在精度、效率、可解释性上仍占优势,但端到端深度 SLAM 在泛化性、退化场景鲁棒性上有独特价值。长期看两者会融合——传统 SLAM 提供先验结构,深度学习补足退化场景。

3.2.6 激光 SLAM:LOAM 与 LIO-SAM

激光 SLAM 以 LiDAR 为主要传感器。LOAM(2014)是开山之作,奠定了「边缘点 + 平面点」特征分离 + 高低频分离优化的范式。

LOAM 的核心思想

LiDAR 一帧点云包含几万个点,全用太慢。LOAM 把点云分成两类:

  • 边缘点(Edge Points):在物体边缘,对应线特征。
  • 平面点(Planar Points):在墙、地面,对应面特征。

然后做两类匹配:边缘点对齐到线,平面点对齐到面。这种「点-线、点-面」匹配比纯点-点匹配更鲁棒,因为利用了几何结构。

LOAM 还分离了两个频率:

  • 高频里程计(10Hz):用上一帧的少量特征快速估计位姿。
  • 低频建图(1Hz):用更多特征做精细优化与回环。

LIO-SAM:LiDAR-IMU 紧耦合

LIO-SAM(MIT,2020)是 LOAM 思想 + IMU 紧耦合 + 因子图优化的集大成:

  • 用因子图统一四种因子:IMU 预积分因子、激光里程计因子、GPS 因子、回环因子。
  • 紧耦合让快速运动和长时间运行都稳定。
  • 已成为室外大场景 SLAM 的事实标准(自动驾驶、无人机、机器人通用)。

Cartographer:谷歌的 2D/3D 激光 SLAM

Cartographer(Google,2016)是另一个广泛使用的激光 SLAM,特点是:

  • 支持 2D 和 3D LiDAR。
  • 用「子图(Submap)」概念——把局部区域建成子图,再全局优化子图间位姿。
  • 集成在 ROS 中,工业部署便利。

3.2.7 多传感器融合 SLAM

高端机器人普遍用多传感器融合 SLAM:

传感器组合 用途 代表
相机 + IMU 视觉惯性(VIO) VINS-Fusion、OKVIS
LiDAR + IMU 激光惯性(LIO) LIO-SAM、FAST-LIO
相机 + LiDAR 视觉激光融合 R3LIVE、LVI-SAM
相机 + IMU + GPS 户外大场景 VINS-Fusion + GPS
相机 + IMU + LiDAR + GPS 全套 LIO-SAM + 视觉

融合原则(呼应第 2.4 节):每个传感器作为一个因子源,全部塞进因子图统一优化。这是因子图框架的最大威力——一个框架处理任意传感器组合。

3.2.8 SLAM 选型决策树

⚠️ 常见误区:「SLAM 越准越好」是错的。SLAM 的精度只要满足下游任务即可——一个送货机器人 5cm 精度足够,没必要追求毫米级。精度越高通常意味着计算成本、传感器成本、调参成本指数级上升。

3.2.9 当前 SLAM 工程化的核心难题

尽管 SLAM 算法日趋成熟,工程落地仍面临几大挑战:

难题 描述 当前应对
动态环境 人、车、移动物体干扰建图 动态点剔除、语义 SLAM
退化场景 长走廊、空旷大厅、白墙 多传感器冗余、结构约束
长时间漂移 几小时连续运行的累积误差 回环 + 全局优化 + 子图管理
重定位 关机重启后怎么找回自己在哪 位置识别、多地图融合
大场景扩展 园区、城市级地图 分层地图、子图划分、云端 SLAM
算力约束 边缘设备算力有限 算法优化、神经网络加速

第 3.4 节会专门讨论长程自主的工程难题。

本节小结

  • 视觉 SLAM 与激光 SLAM 是两条平行技术树,分别适合纹理丰富和几何结构清晰的场景。
  • ORB-SLAM 是特征法视觉 SLAM 标杆,三段式架构 + DBoW2 回环检测是其核心。
  • VINS-Fusion 用 IMU 预积分实现视觉-惯性紧耦合,是无人机/AR/VR 主流。
  • LOAM 与 LIO-SAM 是激光 SLAM 的里程碑,点-线、点-面匹配 + 因子图优化是核心。
  • 多传感器融合 SLAM 用因子图统一处理任意传感器组合。
  • 选型遵循场景与精度需求,过精度是浪费;动态环境、退化场景、长时漂移是工程核心难题。

下一节《3.3 语义 SLAM 与开放词汇场景理解》将讨论如何让地图不仅有几何,还有「含义」——这是机器人理解世界的关键跃迁。


发布者: 作者: 灏天文库 转发
评论区 (0)
U