- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
具身智能技术原理:从感知-决策-执行闭环到具身大模型
> 面向 AI 研究者与算法工程师的体系化教程。围绕「感知-决策-执行」核心闭环,从多模态感知、SLAM、大模型任务规划、VLA 端到端策略、运动控制到 Sim-to-Real 数据飞轮,建立完整的具身智能知识体系。本教程为原理深度优先的中文长文体系,不写可运行工程代码,聚焦架构设计与算法原理。
一、核心摘要
具身智能(Embodied AI) 是让智能体通过物理身体与真实世界交互、在交互中感知与学习的范式。它的核心是「感知-决策-执行」闭环回路:传感器采集多模态信号,大脑(大语言模型、VLA 模型、强化学习策略)做出决策,运动控制器把决策落到关节与力矩,行动后的世界变化再次进入感知,如此往复。
本教程按「先身体、再大脑、后进化」的递进逻辑组织:
- 身体层(第 2-3 章):多模态传感器与融合、SLAM 与空间环境理解——回答「机器人怎么看见、摸到、知道自己在哪里」。
- 大脑层(第 4-5 章):大模型任务规划器、视觉-语言-动作(VLA)端到端策略——回答「机器人怎么思考、规划、从像素到动作」。
- 行动层(第 6 章):运动规划、轨迹优化、阻抗控制——回答「机器人怎么把决策落到关节与电机」。
- 进化层(第 7 章):遥操作数据采集、仿真平台、Sim-to-Real 迁移——回答「机器人怎么持续学习与规模化」。
- 落地层(第 8 章):综合案例、系统性挑战、世界模型与未来展望——回答「离具身 AGI 还有多远」。
二、核心逻辑:感知-决策-执行闭环
闭环的三个关键判读:
| 维度 | 传统机器人 | 具身智能 |
|---|---|---|
| 感知 | 结构化传感(标定板、码垛位姿) | 多模态开放感知(RGB-D、触觉、自然语言指令) |
| 决策 | 预编程状态机、规则脚本 | 大模型规划 + 学习型策略(VLA、RL) |
| 执行 | 轨迹回放、点位控制 | 接触丰富的力控、自适应阻抗、whole-body 控制 |
三、导航索引
embodied-ai/ ├── README.md │ ├── 01-导论-具身智能概览与核心闭环/ │ ├── 01-什么是具身智能.md ← 定义/莫拉维克悖论/具身认知 │ ├── 02-感知决策执行闭环.md ← 核心架构与对比 │ ├── 03-机器人形态谱系.md ← 轮式/足式/人形/软体 │ └── 04-发展脉络与里程碑.md ← Brooks → VLA 时代 │ ├── 02-具身感知一-多模态传感器与融合/ │ ├── 01-感知模态全景.md ← 视/触/听/本体感觉 │ ├── 02-视觉感知.md ← 2D→3D、NeRF/3DGS │ ├── 03-触觉与力感知.md ← 视触觉、六维力 │ └── 04-多模态融合策略.md ← 早期/晚期/注意力融合 │ ├── 03-具身感知二-SLAM与空间环境理解/ │ ├── 01-SLAM问题表述.md ← 因子图/状态估计 │ ├── 02-视觉SLAM与激光SLAM.md ← ORB-SLAM/VINS/LOAM │ ├── 03-语义SLAM与场景理解.md ← 物体级/ConceptGraphs │ └── 04-长程自主与环境表征.md ← 持久地图/重定位 │ ├── 04-具身决策与大脑一-大模型任务规划/ │ ├── 01-LLM任务规划器.md ← SayCan/Code-as-Policies │ ├── 02-VLM与场景指令对齐.md ← CLIP/BLIP/grounding │ ├── 03-记忆反思与重规划.md ← ReAct/Reflexion │ └── 04-技能库与工具调用.md ← Primitive Skill/HTN │ ├── 05-具身决策与大脑二-VLA模型与端到端策略/ │ ├── 01-VLA模型架构总览.md ← ViT+LLM+动作头 │ ├── 02-生成式策略扩散与Flow.md ← Diffusion Policy/π0 │ ├── 03-代表性VLA模型谱系.md ← RT-2/Octo/OpenVLA │ └── 04-策略学习范式BC与离线RL.md ← BC/DAgger/IQL │ ├── 06-运动控制-从规划到执行的映射/ │ ├── 01-运动规划.md ← C-space/RRT*/CHOMP │ ├── 02-轨迹优化与平滑.md ← 最小Jerk/MPPI │ ├── 03-底层控制与逆动力学.md ← PID/计算力矩/MPC │ └── 04-精细操作与力控.md ← 阻抗/导纳/力位混合 │ ├── 07-数据与仿真-Sim-to-Real与遥操作/ │ ├── 01-遥操作数据采集.md ← VR/动捕/leader-follower │ ├── 02-虚拟仿真环境.md ← Isaac Sim/MuJoCo/Genesis │ ├── 03-Sim-to-Real迁移.md ← Domain Randomization │ └── 04-数据引擎与具身基础模型.md ← Open X-Embodiment │ └── 08-综合案例挑战与未来展望/ ├── 01-综合案例剖析.md ← Figure/Optimus/π0 ├── 02-系统性挑战.md ← 泛化/安全/算力 ├── 03-评价体系与基准.md ← CALVIN/RoboCasa └── 04-未来展望.md ← 世界模型/具身AGI
四、章节定位速查
| 你想了解 | 直接看 |
|---|---|
| 具身智能是什么、与传统机器人有何不同 | 第 1 章 01、02 |
| 机器人怎么看见、触摸世界 | 第 2 章 02、03 |
| 多模态数据怎么融合 | 第 2 章 04 |
| SLAM 的原理与流派 | 第 3 章 01、02 |
| 大模型怎么指挥机器人做长程任务 | 第 4 章 01、03 |
| VLA 模型是什么、怎么训练 | 第 5 章 01、03、04 |
| 扩散策略与 π0 怎么工作 | 第 5 章 02 |
| 机器人怎么规划运动轨迹 | 第 6 章 01、02 |
| 精细操作与力控怎么做 | 第 6 章 04 |
| 遥操作数据怎么采集 | 第 7 章 01 |
| Sim-to-Real 难在哪里 | 第 7 章 03 |
| 人形机器人完整系统长什么样 | 第 8 章 01 |
| 具身智能的未来趋势 | 第 8 章 04 |
五、阅读路径建议
- 路径 A · 完整体系构建(研究者/研究生):1 → 2 → 3 → 4 → 5 → 6 → 7 → 8,全章节顺序阅读,约 40 篇。
- 路径 B · 大模型与决策侧(LLM/VLM 工程师):1 → 4 → 5 → 8,重点理解 VLA 与端到端策略。
- 路径 C · 控制与硬件侧(机器人控制工程师):1 → 2 → 6 → 8,重点理解感知与运动控制。
- 路径 D · 数据与仿真侧(数据/平台工程师):1 → 5 → 7 → 8,重点理解数据飞轮与 Sim-to-Real。
- 路径 E · 快速入门(产品/决策者):1 → 5(01、03)→ 8,约 6 篇建立全景认知。
目录大纲
最新文档
知识宇宙
正在加载知识图谱...