8.2 系统性挑战:泛化、数据、安全与算力 Demo 里机器人折叠衣物令人惊叹,但放在家里它可能连袜子都抓不起来。具身智能落地的真正壁垒不是单点技术,而是泛化、数据、安全、算力、可靠性这些系统性挑战。 8.2.1 挑战一:泛化(Generalization) 泛化是具身智能的根本目标——模型在训练分布外(新物体、新场景、新任务)也要工作。当前 VLA 的泛化能力远不如 LLM: 泛化维度 | LLM | 当前 VLA 新文本任务 | 强(零样本) | 中(语言泛化好) 新物体 | N/A | 弱(特定形状会失败) 新场景 | N/A | 弱(新厨房/新光照失败) 新本体 | N/A | 中(跨本体训练改善) 新任务组合 | 强 | 弱(多步任务易失败) 泛化失败的根源
Demo 里机器人折叠衣物令人惊叹,但放在家里它可能连袜子都抓不起来。具身智能落地的真正壁垒不是单点技术,而是泛化、数据、安全、算力、可靠性这些系统性挑战。
泛化是具身智能的根本目标——模型在训练分布外(新物体、新场景、新任务)也要工作。当前 VLA 的泛化能力远不如 LLM:
| 泛化维度 | LLM | 当前 VLA |
|---|---|---|
| 新文本任务 | 强(零样本) | 中(语言泛化好) |
| 新物体 | N/A | 弱(特定形状会失败) |
| 新场景 | N/A | 弱(新厨房/新光照失败) |
| 新本体 | N/A | 中(跨本体训练改善) |
| 新任务组合 | 强 | 弱(多步任务易失败) |
⚠️ 现实判断:当前 VLA 的泛化能力远不足以支撑通用家庭服务。在结构化场景(工厂、仓库)已可用,但开放场景(任意家庭)仍需数年。
第 7 章已讨论数据瓶颈,这里总结系统性挑战:
| 挑战 | 描述 |
|---|---|
| 规模 | 具身数据 << LLM 文本数据(数量级差距) |
| 成本 | 真实操作数据每条 5-30 美元 |
| 多样性 | 容易过拟合采集环境 |
| 质量一致 | 跨操作者风格不一致 |
| 隐私 | 家庭场景含隐私 |
| 触觉数据 | 大多数据无触觉记录 |
LLM 数据可以靠爬虫自动获取(整个互联网),但具身数据:
要达到 LLM 的数据规模(万亿 token 等价),需要:
这是为什么具身智能公司估值高——数据是稀缺壁垒。
机器人在物理世界行动,安全问题极其重要:
| 风险 | 描述 |
|---|---|
| 碰撞 | 撞人、撞物 |
| 力过大 | 抓碎物体、压伤人 |
| 错误动作 | 把热茶倒人手上 |
| 失控 | 控制系统故障 |
| 网络安全 | 黑客劫持 |
| 隐私泄露 | 摄像头数据外泄 |
| 层次 | 措施 |
|---|---|
| 硬件层 | 碰撞检测、力限制、紧急停止按钮 |
| 控制层 | 安全约束(速度限制、力矩限制、禁区) |
| 策略层 | 安全过滤器(VLA 输出先过安全检查) |
| 监督层 | 远程监督、人在回路 |
| 法规层 | ISO 标准、产品认证 |
LLM 出错最多胡说八道,机器人出错可能伤人。理想情况应该有形式化安全保证——数学证明机器人不会做某些事。但当前 VLA 是黑盒神经网络,难以形式化验证。这是具身智能安全的核心难题。
💡 生产箴言:当前所有部署的具身智能系统都有人在回路兜底——机器人自主行动,但出问题人类能立即接管。完全自主的具身智能离实用还很远。
VLA 模型巨大(3B-7B+ 参数),实时推理需要强算力:
| 任务 | 算力需求 |
|---|---|
| 7B VLA 推理(FP16) | 14GB 显存 + 100ms 延迟 |
| 实时控制(10-30Hz) | 每秒 30-100 次推理 |
| 多模态输入(图像) | 高吞吐预处理 |
| 双臂/人形 30+ DoF | 高维输出 |
机器人是移动设备,功耗受限:
这是为什么人形机器人不能像数据中心那样跑超大模型。
工业生产要求99.9%+ 成功率,当前 VLA 远未达到:
| 任务 | 当前成功率 | 工业要求 |
|---|---|---|
| 简单抓取 | 90-95% | 99.9% |
| 精细操作 | 60-80% | 99%+ |
| 长程任务 | 30-60% | 95%+ |
第 7.3 节讨论过 Sim-to-Real gap,这里强调系统性影响:
真机验证成本极高,但不可或缺。当前大多数 VLA 论文只报告仿真或单次真机 demo,缺乏长期、多场景的可靠性数据。
最后是商业化必须面对的成本问题:
| 成本项 | 当前 | 目标(规模化) |
|---|---|---|
| 人形机器人本体 | 5-30 万美元 | 2-5 万美元 |
| 计算单元 | 1-2 万美元 | 5 千美元 |
| 维护 | 高 | 低 |
| 数据采集 | 极高 | 中(飞轮) |
Tesla Optimus 目标售价 2-3 万美元,这要求:
成本不降到这个水平,人形机器人无法进入家庭。
这些挑战不是独立的,而是相互制约:
举例:
这种相互制约让具身智能落地极其复杂——任何单点突破都不够,需要系统工程。
| 公司 | 主要策略 |
|---|---|
| Tesla | 垂直整合 + 工厂场景先行 |
| Figure | 与 OpenAI 合作大脑 + 工厂试点 |
| Boston Dynamics | 工业场景 + 高可靠性 |
| Physical Intelligence | 通用 VLA 模型 + 跨本体 |
| 中国厂商(宇树、智元等) | 硬件成本领先 + 本土场景 |
共同点:先工业后家庭。工业场景结构化、安全要求可控、ROI 明确,是当前落地首选。家庭场景开放、安全要求高、ROI 难证明,还需要数年。
💡 判断:2026-2028 年是工业具身智能规模化的窗口期。家庭通用具身智能可能要等到 2030 年后。这期间,分层架构(LLM + VLA + 传统控制 + 安全兜底)是务实选择。
下一节《8.3 评价体系与基准》将讨论怎么衡量这些挑战的进步。