本节摘要:机器人靠传感器感知世界,但没有任何单一传感器是万能的——相机在暗处看不清、激光雷达测不了透明物体、触觉只有接触时才有信息。本节讲各种传感器的特性和局限,为什么必须多模态融合,以及融合的三个层次(数据级、特征级、决策级)和典型方法。核心认知:单传感器都有盲区,融合不是为了锦上添花,而是为了补各自的短板。
阅读完本节,你应当能够:
做个抓取任务,机器人要感知什么?得知道物体在哪(位置)、多大(尺寸)、什么材质(硬度)、好不好抓(表面光滑程度)。光用一个传感器能搞定吗?
用相机,能看到物体位置和尺寸,但看不出材质硬度(看着像金属的可能是塑料),暗处还看不清。用激光雷达,能精确测距,但测不了透明物体(激光穿透),也看不出颜色和纹理。用力觉传感器,能感受硬度和光滑度,但得先接触才有信息,不能用来做抓取前的规划。
看出来了吧,每个传感器都有自己的强项和盲区。相机强在视觉信息丰富但弱在深度和材质,激光雷达强在精确测距但弱在透明和纹理,力觉强在接触信息但弱在非接触感知。单靠任何一个,感知都是残缺的。
多模态感知的思路就是把多种传感器组合起来,让它们优势互补——相机提供视觉、激光雷达提供精确距离、力觉提供接触反馈。融合在一起,感知才完整。这不是锦上添花,而是必须——就像人要靠视觉加触觉加本体感觉才能完整感知世界,缺哪个都费劲。
具身智能常用的传感器有这么几类,各有特性。
视觉传感器(相机):提供丰富的视觉信息(颜色、纹理、形状)。RGB 相机信息量大但无深度;深度相机(如结构光、ToF)能直接测每个像素的距离。相机强在信息丰富、分辨率高,弱在受光照影响大(暗处、强光、反光都会干扰)、计算量大。
激光雷达(LiDAR):发射激光测距,能精确构建周围环境的三维点云。强在测距精确、不受光照影响,弱在测不了透明或高反光物体、机械式激光雷达有运动畸变、成本高。
力/触觉传感器:测量接触力和压力分布。六维力传感器测末端受力和力矩,触觉阵列测抓取面的压力分布。强在能感知硬度、光滑度、重量这些接触属性,弱在只有接触时才有信息、非接触无感知。
本体感觉(Proprioception):机器人感知自身状态的能力,通过编码器(测关节角度)、IMU(测姿态和加速度)实现。强在实时反映自身状态,是运动控制的基础,弱在只感知自身不感知环境。
| 传感器 | 感知内容 | 强项 | 弱项 |
|---|---|---|---|
| RGB 相机 | 颜色纹理形状 | 信息丰富分辨率高 | 无深度 受光照影响 |
| 深度相机 | 距离+视觉 | 直接测距 | 受光照干扰 距离有限 |
| 激光雷达 | 精确三维距离 | 测距准 不受光照 | 测不了透明 成本高 |
| 力觉 | 接触力压力 | 感知材质接触 | 仅接触时有信息 |
| 本体感觉 | 自身姿态关节角 | 实时自身状态 | 不感知外部环境 |
把多种传感器的数据合起来用,有三种融合层次,从低到高。
数据级融合(Data-level):直接把各传感器的原始数据合并。比如把 RGB 图像和深度图像对齐成 RGBD。这种融合信息保留最完整,但要求传感器严格标定(知道彼此的空间关系)和时间同步。
特征级融合(Feature-level):各传感器先提取特征,再在特征层面融合。比如从视觉提取物体位置特征、从激光提取距离特征,在特征空间合并。这种融合对传感器异构性容忍度高(不同传感器提取不同特征),是实际中常用的层次。
决策级融合(Decision-level):各传感器各自做判断,再对判断结果融合。比如视觉判断“有障碍”、激光判断“无障碍”,用投票或概率方法决定信谁。这种融合最灵活、对传感器独立性要求低,但信息损失最大。
融合具体怎么做?以最经典的卡尔曼滤波(Kalman Filter)为例讲思路。
卡尔曼滤波解决的问题是:用多个带噪声的测量,估计一个真实状态。比如机器人位置,既可以用本体感觉(轮子转了多少推算)估计,也可以用视觉(看到标志物)估计。两种都有误差,卡尔曼滤波把两种估计按各自的可信度加权融合,得到比单独任何一个都准的估计。
它的核心思想是“预测加更新”:先用运动模型预测下一时刻状态(比如根据速度预测位置),再用传感器测量更新这个预测。预测和测量按各自的不确定性加权——哪个更可信就偏向哪个。这个“预测-更新”循环持续进行,估计越来越准。
卡尔曼滤波假设系统是线性的、噪声是高斯的,实际系统常不满足,于是有扩展卡尔曼滤波(EKF)处理非线性、无迹卡尔曼滤波(UKF)等变种。这类滤波方法在机器人定位、传感器融合里用得非常广。
多传感器融合有个前提:得知道各传感器之间的空间关系和时间关系。空间上,相机和激光雷达装在不同位置,要把它们的数据对齐,得知道它们的相对位姿(外参标定)。时间上,不同传感器的采样时刻不完全同步,要对齐到同一时刻(时间同步)。标定不准,融合就是错的——把没对齐的数据合一起,比单用还糟。
标定是个繁琐但关键的工程活。相机内参(焦距、畸变)、外参(传感器间位姿)、手眼标定(相机和机械臂的关系)都要仔细做,定期复检(设备会有微小位移)。
不是传感器越多越好,要按任务需求选组合。导航任务需要激光雷达(建图避障)加 IMU(姿态);抓取任务需要视觉(找物体)加力觉(控握力);精细操作还需要触觉阵列。堆一堆用不上的传感器,只会增加成本、标定复杂度和数据处理的负担。
⚠️ 常见坑:以为传感器越多感知越好,堆了一堆结果标定做不好、数据对不齐,融合效果还不如单用。传感器贵精不贵多,按任务选最小够用组合,把标定和融合做扎实,比堆传感器有效。
传感器会故障或失效——相机被强光致盲、激光雷达被遮挡、力觉过载损坏。融合系统要能检测异常并降级处理:发现某个传感器数据异常(和其它传感器严重不一致),就降低它的权重或停用,用其余传感器继续工作。这种容错能力对实际部署很重要,否则一个传感器故障就让系统瘫痪。
💡 关键直觉:多模态融合的本质是“用多样性对抗不确定性”。每个传感器都有噪声和盲区,但不同传感器的噪声和盲区不一样,融合后它们互相补偿,整体感知比任何单一传感器都鲁棒。理解这一点,你才知道为什么融合是具身智能的刚需而不是奢侈。
下一节讲机器人怎么在陌生环境里定位自己和建图——这就是 SLAM。