灏天文库 · 知识工坊 | 前沿科技观察 · 第 4 期

大模型再聪明,也伸不出手

副题:具身智能导论——莫拉维克悖论、感知-决策-执行闭环与形态谱系

一句话结论

一个对话大模型可以滔滔不绝地讲「如何泡一杯咖啡」,但把它装进机器人身体,它很可能连杯子都抓不起来。1988 年莫拉维克就点破了这件怪事:对计算机而言,难的事(下棋、证明)反而容易,人类毫不费力的事(走路、抓取、认脸)反而极难。

填平「会说不会做」的鸿沟,就是具身智能的全部使命:物理身体 + 学习型智能 + 与环境的闭环交互,三条缺一不可。

01莫拉维克悖论:难的事容易,容易的事难

为什么最先进的 AI 能写代码、解奥数,却搞不定「把鸡蛋从A点拿到B点」?答案是进化写下的时间差——

人类的高级推理(抽象思维、逻辑)是进化晚期才出现的「新模块」,需要意识努力,运行起来慢而费劲——所以它看似高级,其实优化时间只有几十万年。而感知与运动控制是数亿年进化反复打磨的「老模块」,运行在潜意识层面,看似毫不费力,背后是极其复杂的神经计算。

AI 继承的是人类知识里「能写成文字的部分」——恰好都是新模块的产物;而抓取、平衡、接触这些老模块的能力,几乎没有文字可学,只能靠身体自己试。这就是为什么具身智能的数据与训练(遥操作、仿真、视频学习)如此关键,也是它和纯软件 AI 的根本分野。

金句卡 1 / 4
高级推理是进化晚期的新模块;走路和抓取,是数亿年打磨的老模块。
灏天文库 · 前沿科技观察 · 第 4 期

02定义与边界:它不是「会动的聊天机器人」

「具身智能」站在三个相邻概念的交叉点上,边界一划就清楚:

纯软件 AI无身体,活在文本与图像空间。长于长尾泛化,短于物理交互。代表:GPT-4、Claude。
强化学习 Agent无身体(仿真/抽象环境),环境封闭、规则固定。代表:AlphaGo、DQN。
传统工业机器人有身体,但智能来自预编程——轨迹、规则、状态机都是工程师烧录的。代表:焊接机械臂。
具身智能物理身体 × 学习型智能 × 开放环境,终极目标是长尾泛化:没见过的物体、场景、任务。代表:RT-2、π0、Figure。

哲学底座来自认知科学的具身认知理论:智能不是「缸中之脑」,身体形态参与塑造认知——人之所以理解「重」「推」「拉」,是因为身体体验过这些动作;认知的目的不是给世界建模,而是指导行动。这个立场直接决定了工程路线:让机器人从自己的身体经验中学习,比把人类知识灌进机器人更接近通用智能。

03核心架构:感知-决策-执行,永不停止的循环

👁 感知视觉/触觉/听觉/本体感觉
→
🧠 决策LLM 规划 / VLA 策略 / RL
→
🦾 执行运动规划 / 力控 / 电机力矩
↻

智能体从物理世界接收信号(感知),基于内部模型产生意图与动作(决策),通过执行器改变世界(执行),改变后的世界又产生新信号进入下一轮感知。闭环不是「感知→决策→执行→结束」,而是永不停止的滚动循环——机器人在执行的同时也在感知(否则就是盲动),感知与控制常以 100Hz–1000Hz 的频率耦合在一起。

闭环有两大永恒敌人:不确定性(传感器噪声与遮挡、世界模型不完美、电机摩擦打滑——发出的指令未必精确实现)和延迟(感知→决策→执行链路若有 100ms 延迟,接球、快插拔这类任务就是致命的)。对策之一是策略模型输出 action chunk(动作序列块)而非单步动作——用前瞻补偿延迟。设计任何闭环系统的第一问永远是:「我的感知-控制链路延迟是多少?这个延迟下任务还能稳定吗?」

04三层频率:一个身体里的三个时钟

真实的机器人不是单一频率的闭环,而是多频率嵌套:高层想「做什么」,中层想「怎么做的下一步」,低层想「这一毫秒出多少力」。点击三层看各自的角色:

交互图解 · 闭环的频率分层点击层卡片

分层的好处:各层只关注自己时间尺度的信息——高层处理语义与长程目标,低层处理动力学与稳定性,互不干扰。

05形态即智能:身体不是外壳,身体在做计算

具身智能有个反直觉的命题——形态-智能耦合(Morphological Computation):身体结构本身就在完成一部分计算工作。

形态还反向约束算法:人形 30+ 自由度导致动作空间维度爆炸,策略难学,要用层次化控制 + 全身控制(WBC);双足天生不稳定,必须持续主动平衡(MPC + RL);软体难以建模,反而逼出端到端学习型策略。同一个 VLA 模型,装在轮式底盘和装在双足人形上,能解决的任务空间截然不同。

金句卡 2 / 4
能用轮式解决就不要用足式,能用单臂解决就不要用双臂——形态越复杂,控制与数据复杂度指数级上升。
灏天文库 · 前沿科技观察 · 第 4 期

那为什么 Tesla Optimus 偏选双足?因为它的目标场景(家庭、工厂)是为双足人类设计的——轮式上不了楼梯、进不了厨房。截至 2026 年的行业格局是「双轨并行」:工业/仓储轨(轮式 + 臂,技术最成熟、已规模化部署)与通用服务轨(双足人形,资本与媒体的焦点)。长期看人形是终极形态,短期(3–5 年)轮式 + 臂的商业化确定性更高。

06选型挑战:给五个任务挑对身体

学以致用。五个真实任务,从五种形态里选出最合理的那个——判分标准就是上面的选型箴言与形态对比表:

交互挑战 · 任务 × 形态匹配0 / 5

07回到本系列框架:具身智能卡在第几关

用第 1 期的「四道关口」量一量这个领域:

🔬① 实验室可行✓ 已过
→
🏭② 工程可放大⏸ 当前卡点
→
💰③ 经济可负担— 未到
→
⚖️④ 制度可接纳— 未到

第一关早已通过:RT-2、π0 等 VLA 模型证明了「看图→出动作」的端到端路线可行。卡在第二关的三大拦路虎,全部呼应本页内容:Sim-to-Real(仿真里满分、现实里摔跟头——第 7 章主题)、数据稀缺(真机遥操作数据昂贵,互联网视频又不带动作标签)、泛化(换个厨房就失灵的长尾问题)。行业正在用跨本体数据(cross-embodiment)、大规模仿真、视频预训练三条路同时攻坚——这正是「多数技术死在第二关」规律的最新现场。

金句卡 3 / 4
机器人学会端茶倒水的难度,高于学会下围棋的难度——进化早就投过票了。
灏天文库 · 前沿科技观察 · 第 4 期

✓看完带走什么

  • 判断「具身智能」真伪的三要件:物理身体、学习型智能、闭环交互——缺一即滑向相邻概念。
  • 看到机器人 demo 先问三个问题:仿真还是真机(Sim-to-Real)?数据从哪来?换个场景还行吗(泛化)?
  • 记住频率分层:1Hz 想目标、30Hz 出动作、1000Hz 控力矩——出问题的层不一样,药方完全不同。
  • 形态是算法的一部分:选型口诀「能轮式不足式、能单臂不双臂」;双足的合理性来自人类环境,不来自技术炫耀。
  • 投资/职业判断:短期(3–5 年)确定性在轮式+臂的工业轨;人形是长期终局,注意区分「叙事」与「交付」。
金句卡 4 / 4 · 转发卡
AI 学会了思考,现在要学的,是那些你从来不用思考的事。
灏天文库 · 前沿科技观察 · 第 4 期