3.1.1 视觉-语言-动作模型 (VLA Models,如 RT-2)


文档摘要

3.1.1 视觉-语言-动作模型 (VLA Models,如 RT-2) 当 RT-2 的动作 logits 在真实机械臂上集体“失重”:一个关于 VLA 模型动作空间对齐的硬核排障手记 凌晨两点十七分,实验室的机械臂还悬在半空——不是执行失败,而是根本没动。 不是电机堵转,不是通信超时,不是安全急停触发。 是它的控制器收到了一串逻辑上“完美”、数值上“合理”、但物理上完全不可执行的动作指令:$[0.0012, -0.0008, 0. 会员。《3.1.1 视觉-语言-动作模型 (VLA Models,如 RT-2)》收录于灏天文库文集《具身智能 (Embodied AI)》,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。文档编号30321。

该文档为会员专享,请先登录或注册后再查看


发布者: 作者: 转发
评论区 (0)
U