副题:具身智能导论——莫拉维克悖论、感知-决策-执行闭环与形态谱系
一个对话大模型可以滔滔不绝地讲「如何泡一杯咖啡」,但把它装进机器人身体,它很可能连杯子都抓不起来。1988 年莫拉维克就点破了这件怪事:对计算机而言,难的事(下棋、证明)反而容易,人类毫不费力的事(走路、抓取、认脸)反而极难。
填平「会说不会做」的鸿沟,就是具身智能的全部使命:物理身体 + 学习型智能 + 与环境的闭环交互,三条缺一不可。
为什么最先进的 AI 能写代码、解奥数,却搞不定「把鸡蛋从A点拿到B点」?答案是进化写下的时间差——
人类的高级推理(抽象思维、逻辑)是进化晚期才出现的「新模块」,需要意识努力,运行起来慢而费劲——所以它看似高级,其实优化时间只有几十万年。而感知与运动控制是数亿年进化反复打磨的「老模块」,运行在潜意识层面,看似毫不费力,背后是极其复杂的神经计算。
AI 继承的是人类知识里「能写成文字的部分」——恰好都是新模块的产物;而抓取、平衡、接触这些老模块的能力,几乎没有文字可学,只能靠身体自己试。这就是为什么具身智能的数据与训练(遥操作、仿真、视频学习)如此关键,也是它和纯软件 AI 的根本分野。
「具身智能」站在三个相邻概念的交叉点上,边界一划就清楚:
哲学底座来自认知科学的具身认知理论:智能不是「缸中之脑」,身体形态参与塑造认知——人之所以理解「重」「推」「拉」,是因为身体体验过这些动作;认知的目的不是给世界建模,而是指导行动。这个立场直接决定了工程路线:让机器人从自己的身体经验中学习,比把人类知识灌进机器人更接近通用智能。
智能体从物理世界接收信号(感知),基于内部模型产生意图与动作(决策),通过执行器改变世界(执行),改变后的世界又产生新信号进入下一轮感知。闭环不是「感知→决策→执行→结束」,而是永不停止的滚动循环——机器人在执行的同时也在感知(否则就是盲动),感知与控制常以 100Hz–1000Hz 的频率耦合在一起。
闭环有两大永恒敌人:不确定性(传感器噪声与遮挡、世界模型不完美、电机摩擦打滑——发出的指令未必精确实现)和延迟(感知→决策→执行链路若有 100ms 延迟,接球、快插拔这类任务就是致命的)。对策之一是策略模型输出 action chunk(动作序列块)而非单步动作——用前瞻补偿延迟。设计任何闭环系统的第一问永远是:「我的感知-控制链路延迟是多少?这个延迟下任务还能稳定吗?」
真实的机器人不是单一频率的闭环,而是多频率嵌套:高层想「做什么」,中层想「怎么做的下一步」,低层想「这一毫秒出多少力」。点击三层看各自的角色:
分层的好处:各层只关注自己时间尺度的信息——高层处理语义与长程目标,低层处理动力学与稳定性,互不干扰。
具身智能有个反直觉的命题——形态-智能耦合(Morphological Computation):身体结构本身就在完成一部分计算工作。
形态还反向约束算法:人形 30+ 自由度导致动作空间维度爆炸,策略难学,要用层次化控制 + 全身控制(WBC);双足天生不稳定,必须持续主动平衡(MPC + RL);软体难以建模,反而逼出端到端学习型策略。同一个 VLA 模型,装在轮式底盘和装在双足人形上,能解决的任务空间截然不同。
那为什么 Tesla Optimus 偏选双足?因为它的目标场景(家庭、工厂)是为双足人类设计的——轮式上不了楼梯、进不了厨房。截至 2026 年的行业格局是「双轨并行」:工业/仓储轨(轮式 + 臂,技术最成熟、已规模化部署)与通用服务轨(双足人形,资本与媒体的焦点)。长期看人形是终极形态,短期(3–5 年)轮式 + 臂的商业化确定性更高。
学以致用。五个真实任务,从五种形态里选出最合理的那个——判分标准就是上面的选型箴言与形态对比表:
用第 1 期的「四道关口」量一量这个领域:
第一关早已通过:RT-2、π0 等 VLA 模型证明了「看图→出动作」的端到端路线可行。卡在第二关的三大拦路虎,全部呼应本页内容:Sim-to-Real(仿真里满分、现实里摔跟头——第 7 章主题)、数据稀缺(真机遥操作数据昂贵,互联网视频又不带动作标签)、泛化(换个厨房就失灵的长尾问题)。行业正在用跨本体数据(cross-embodiment)、大规模仿真、视频预训练三条路同时攻坚——这正是「多数技术死在第二关」规律的最新现场。
一种寿命 2.2 微克的粒子,按经典物理只能飞 660 米,却大量出现在地面——宇宙射线每分钟都在演示时间膨胀。收官期盘点相对论的实验账单:μ 子、上过飞机的原子钟、以及 GPS 卫星每天 38 微秒的修正。附 μ 子航程模拟器和 GPS 漂移计算器。