2.1 多模态感知与传感器融合


2.1 多模态感知与传感器融合

本节摘要:机器人靠传感器感知世界,但没有任何单一传感器是万能的——相机在暗处看不清、激光雷达测不了透明物体、触觉只有接触时才有信息。本节讲各种传感器的特性和局限,为什么必须多模态融合,以及融合的三个层次(数据级、特征级、决策级)和典型方法。核心认知:单传感器都有盲区,融合不是为了锦上添花,而是为了补各自的短板。

先说结论

阅读完本节,你应当能够:

  1. 说清相机、激光雷达、深度相机、力觉、本体感觉各自的特性和局限
  2. 解释为什么单一传感器不够用、必须融合
  3. 区分数据级、特征级、决策级三种融合层次
  4. 理解卡尔曼滤波等融合方法的基本思路
  5. 为一个机器人任务选择合适的传感器组合

一、问题与直觉

做个抓取任务,机器人要感知什么?得知道物体在哪(位置)、多大(尺寸)、什么材质(硬度)、好不好抓(表面光滑程度)。光用一个传感器能搞定吗?

用相机,能看到物体位置和尺寸,但看不出材质硬度(看着像金属的可能是塑料),暗处还看不清。用激光雷达,能精确测距,但测不了透明物体(激光穿透),也看不出颜色和纹理。用力觉传感器,能感受硬度和光滑度,但得先接触才有信息,不能用来做抓取前的规划。

看出来了吧,每个传感器都有自己的强项和盲区。相机强在视觉信息丰富但弱在深度和材质,激光雷达强在精确测距但弱在透明和纹理,力觉强在接触信息但弱在非接触感知。单靠任何一个,感知都是残缺的。

多模态感知的思路就是把多种传感器组合起来,让它们优势互补——相机提供视觉、激光雷达提供精确距离、力觉提供接触反馈。融合在一起,感知才完整。这不是锦上添花,而是必须——就像人要靠视觉加触觉加本体感觉才能完整感知世界,缺哪个都费劲。

二、核心原理

2.1 各种传感器的特性

具身智能常用的传感器有这么几类,各有特性。

视觉传感器(相机):提供丰富的视觉信息(颜色、纹理、形状)。RGB 相机信息量大但无深度;深度相机(如结构光、ToF)能直接测每个像素的距离。相机强在信息丰富、分辨率高,弱在受光照影响大(暗处、强光、反光都会干扰)、计算量大。

激光雷达(LiDAR):发射激光测距,能精确构建周围环境的三维点云。强在测距精确、不受光照影响,弱在测不了透明或高反光物体、机械式激光雷达有运动畸变、成本高。

力/触觉传感器:测量接触力和压力分布。六维力传感器测末端受力和力矩,触觉阵列测抓取面的压力分布。强在能感知硬度、光滑度、重量这些接触属性,弱在只有接触时才有信息、非接触无感知。

本体感觉(Proprioception):机器人感知自身状态的能力,通过编码器(测关节角度)、IMU(测姿态和加速度)实现。强在实时反映自身状态,是运动控制的基础,弱在只感知自身不感知环境。

传感器 感知内容 强项 弱项
RGB 相机 颜色纹理形状 信息丰富分辨率高 无深度 受光照影响
深度相机 距离+视觉 直接测距 受光照干扰 距离有限
激光雷达 精确三维距离 测距准 不受光照 测不了透明 成本高
力觉 接触力压力 感知材质接触 仅接触时有信息
本体感觉 自身姿态关节角 实时自身状态 不感知外部环境

2.2 传感器融合的三个层次

把多种传感器的数据合起来用,有三种融合层次,从低到高。

数据级融合(Data-level):直接把各传感器的原始数据合并。比如把 RGB 图像和深度图像对齐成 RGBD。这种融合信息保留最完整,但要求传感器严格标定(知道彼此的空间关系)和时间同步。

特征级融合(Feature-level):各传感器先提取特征,再在特征层面融合。比如从视觉提取物体位置特征、从激光提取距离特征,在特征空间合并。这种融合对传感器异构性容忍度高(不同传感器提取不同特征),是实际中常用的层次。

决策级融合(Decision-level):各传感器各自做判断,再对判断结果融合。比如视觉判断“有障碍”、激光判断“无障碍”,用投票或概率方法决定信谁。这种融合最灵活、对传感器独立性要求低,但信息损失最大。

2.3 融合方法:卡尔曼滤波为例

融合具体怎么做?以最经典的卡尔曼滤波(Kalman Filter)为例讲思路。

卡尔曼滤波解决的问题是:用多个带噪声的测量,估计一个真实状态。比如机器人位置,既可以用本体感觉(轮子转了多少推算)估计,也可以用视觉(看到标志物)估计。两种都有误差,卡尔曼滤波把两种估计按各自的可信度加权融合,得到比单独任何一个都准的估计。

它的核心思想是“预测加更新”:先用运动模型预测下一时刻状态(比如根据速度预测位置),再用传感器测量更新这个预测。预测和测量按各自的不确定性加权——哪个更可信就偏向哪个。这个“预测-更新”循环持续进行,估计越来越准。

卡尔曼滤波假设系统是线性的、噪声是高斯的,实际系统常不满足,于是有扩展卡尔曼滤波(EKF)处理非线性、无迹卡尔曼滤波(UKF)等变种。这类滤波方法在机器人定位、传感器融合里用得非常广。

三、工程实践要点

3.1 标定是融合的前提

多传感器融合有个前提:得知道各传感器之间的空间关系和时间关系。空间上,相机和激光雷达装在不同位置,要把它们的数据对齐,得知道它们的相对位姿(外参标定)。时间上,不同传感器的采样时刻不完全同步,要对齐到同一时刻(时间同步)。标定不准,融合就是错的——把没对齐的数据合一起,比单用还糟。

标定是个繁琐但关键的工程活。相机内参(焦距、畸变)、外参(传感器间位姿)、手眼标定(相机和机械臂的关系)都要仔细做,定期复检(设备会有微小位移)。

3.2 按任务选传感器组合

不是传感器越多越好,要按任务需求选组合。导航任务需要激光雷达(建图避障)加 IMU(姿态);抓取任务需要视觉(找物体)加力觉(控握力);精细操作还需要触觉阵列。堆一堆用不上的传感器,只会增加成本、标定复杂度和数据处理的负担。

⚠️ 常见坑:以为传感器越多感知越好,堆了一堆结果标定做不好、数据对不齐,融合效果还不如单用。传感器贵精不贵多,按任务选最小够用组合,把标定和融合做扎实,比堆传感器有效。

3.3 处理传感器故障

传感器会故障或失效——相机被强光致盲、激光雷达被遮挡、力觉过载损坏。融合系统要能检测异常并降级处理:发现某个传感器数据异常(和其它传感器严重不一致),就降低它的权重或停用,用其余传感器继续工作。这种容错能力对实际部署很重要,否则一个传感器故障就让系统瘫痪。

💡 关键直觉:多模态融合的本质是“用多样性对抗不确定性”。每个传感器都有噪声和盲区,但不同传感器的噪声和盲区不一样,融合后它们互相补偿,整体感知比任何单一传感器都鲁棒。理解这一点,你才知道为什么融合是具身智能的刚需而不是奢侈。

重点提炼

  • 传感器各有盲区:相机受光照影响、激光测不了透明、力觉仅接触时有信息,单用都不全。
  • 本体感觉:感知自身姿态,是运动控制基础,但不感知外部。
  • 三级融合:数据级(信息全要求高)、特征级(常用折中)、决策级(灵活损失大)。
  • 卡尔曼滤波:预测加更新,按不确定性加权融合多传感器估计,是定位融合经典方法。
  • 标定前提:外参(空间关系)和时间同步必须做好,否则融合出错。
  • 按任务选组合:贵精不贵多,最小够用组合加扎实标定,比堆传感器有效。
  • 容错降级:检测异常传感器并降权停用,单传感器故障不致系统瘫痪。

下一节讲机器人怎么在陌生环境里定位自己和建图——这就是 SLAM。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U