第 11 章 自主系统


文档摘要

第 11 章 自主系统 自主系统(autonomous system)把感知、控制与学习结合起来,让机器人与车辆能在物理世界中独立行动。本章带你走完从传感器读数到机器人自主决策的全链路:先看车和机器人如何"看见"世界,再看它们如何"动起来",最后领略视觉-语言-动作大模型、自动驾驶栈,以及火星与深海里的极端机器人。 本章简介 自主系统是 AI 的"集大成者"。它把前面所有章节的能力——线性代数与优化(第 2、3 章)、概率与贝叶斯推断(第 5 章)、机器学习与强化学习(第 6 章)、计算机视觉(第 8 章)、多模态与生成模型(第 10 章)——全部融进一个能在真实物理世界里行动的实体。 与前面那些"输入一张图、输出一个标签"的任务不同,自主系统的输出是物理动作:转方向盘、闭合夹爪、迈出一步。

第 11 章 自主系统

自主系统(autonomous system)把感知、控制与学习结合起来,让机器人与车辆能在物理世界中独立行动。本章带你走完从传感器读数到机器人自主决策的全链路:先看车和机器人如何"看见"世界,再看它们如何"动起来",最后领略视觉-语言-动作大模型、自动驾驶栈,以及火星与深海里的极端机器人。

本章简介

  • 自主系统是 AI 的"集大成者"。它把前面所有章节的能力——线性代数与优化(第 2、3 章)、概率与贝叶斯推断(第 5 章)、机器学习与强化学习(第 6 章)、计算机视觉(第 8 章)、多模态与生成模型(第 10 章)——全部融进一个能在真实物理世界里行动的实体。

  • 与前面那些"输入一张图、输出一个标签"的任务不同,自主系统的输出是物理动作:转方向盘、闭合夹爪、迈出一步。错误不再是屏幕上的一个错字,而可能是撞坏的硬件或受伤的人。这一物理代价让感知的精度、控制的鲁棒性和学习的安全性都变得至关重要。

  • 本章按"从感知到行动"的逻辑展开:先用传感器和算法把物理世界变成结构化的数字表示,再让机器人在这个表示上做规划与控制,最后看看当代最前沿的端到端模型如何把这一切压缩进一个神经网络,以及这些技术如何在自动驾驶车、火星探测车、水下机器人和群体机器人上落地。

本章小节

  • 第 1 节 感知:传感器模态(摄像头、LiDAR、雷达、IMU、GNSS)、传感器标定、传感器融合与 BEVFusion、3D 物体检测、深度估计、占用网络、车道检测与语义建图——这是所有自主系统的感觉基础。
  • 第 2 节 机器人学习:运动学与动力学、PID/MPC/阻抗控制、模仿学习与行为克隆、sim-to-real 迁移、世界模型、操作与移动、安全——让机器人学会如何"动起来"。
  • 第 3 节 视觉-语言-动作模型(VLA):VLA 架构、动作分词、RT-2、Octo、OpenVLA、Pi-0、预训练与泛化、与本体无关的模型——用一个统一的大模型同时看、理解和行动。
  • 第 4 节 自动驾驶:自动驾驶软件栈、HD 地图、运动预测、规划、端到端驾驶、世界模型、仿真、安全标准与 SAE 自动驾驶等级——把上述能力整合进一辆能在开放世界行驶的车。
  • 第 5 节 空间与极端环境机器人:行星探测车、通信约束、抗辐射计算、非结构化地形导航、水下机器人、搜索与救援、群体机器人与人机交互——在人类去不了的极端环境里把自主性推向极限。

学习路径

  • 前置知识:本章假定你已经熟悉第 6 章的机器学习与强化学习(监督学习、RL、PPO、模仿学习会在第 2、3 节反复出现),第 8 章的计算机视觉(卷积网络、ViT、PointNet、深度估计、SLAM 是感知部分的基础),以及第 10 章的多模态与生成模型(VLM、扩散模型、JEPA、世界模型是理解 VLA 与端到端驾驶的关键)。第 2、3 章的线性代数与优化(矩阵、雅可比、约束优化)和第 5 章的贝叶斯推断也会频繁用到。
  • 后续章节:如果你对自主系统的"大脑"——规划和决策——更感兴趣,可继续深入强化学习与决策理论;对"身体"——控制与硬件——感兴趣,可延伸到经典控制论与机器人学专门教材。本章给出的框架足以支撑你阅读 RT-2、OpenVLA、UniAD、Waymo、Perseverance 等前沿论文与系统报告。

关键概念速览

  • 感知(perception):把传感器原始读数(像素、点云、回波)转化为结构化理解(前方 12 米有行人、以 1.5 m/s 向左移动)的过程,是一切自主行为的瓶颈。
  • BEV(bird's-eye-view,鸟瞰图):把多摄像头和 LiDAR 特征统一投影到的俯视网格,提供带真实尺度的公共坐标系,是现代传感器融合与 3D 检测的核心表示。
  • VLA(vision-language-action model,视觉-语言-动作模型):把看图、理解指令和输出机器人动作合并进单个神经网络的端到端模型,如 RT-2、Octo、OpenVLA、Pi-0。
  • sim-to-real 迁移:通过域随机化和系统辨识,把在仿真中训练好的策略迁移到真实机器人上,破解真实世界数据稀缺与试错昂贵的难题。
  • 世界模型(world model):学习环境动力学 p(s_{t+1} \mid s_t, a_t) 的模型,让智能体能在脑中"想象"未来轨迹来规划和评估,是样本效率和端到端驾驶的关键。
  • SAE 自动驾驶等级(SAE levels):从 L0(无自动化)到 L5(完全自动化)的六级标准,核心区别在于"谁对安全负责"——L0-2 是人,L3-5 是系统。

作者与出处
原作者: HenryNdubuaku
来源:HenryNdubuaku
许可证:Apache-2.0
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U