8.4 多模态 Agent 与具身智能 前几节讲的应用(VQA、文生图、文生视频)都是「一问一答」模式——给一个输入,输出一个结果。多模态 Agent 更进一步:让模型自主规划、调用工具、执行多步行动,完成复杂任务。这是当代 AI 研究的最前沿方向。 一、什么是 AI Agent AI Agent(智能体)的经典定义:能感知环境、做出决策、执行行动、观察结果,循环往复直到完成目标的智能系统。
前几节讲的应用(VQA、文生图、文生视频)都是「一问一答」模式——给一个输入,输出一个结果。多模态 Agent 更进一步:让模型自主规划、调用工具、执行多步行动,完成复杂任务。这是当代 AI 研究的最前沿方向。
AI Agent(智能体)的经典定义:能感知环境、做出决策、执行行动、观察结果,循环往复直到完成目标的智能系统。
Agent 与传统模型的核心区别:
| 维度 | 传统模型 | Agent |
|---|---|---|
| 交互 | 一问一答 | 多步循环 |
| 决策 | 单次推理 | 规划 + 反思 |
| 工具 | 不调用 | 调用外部工具 |
| 环境 | 不感知 | 持续感知 |
| 自主性 | 低 | 高 |
多模态 Agent 同时处理多种模态的输入输出:
感知: - 看屏幕截图(视觉) - 听用户指令(音频) - 读文件内容(文本) 行动: - 点击按钮(视觉-动作) - 生成图像(文本-图像) - 调用 API(文本-文本) - 控制机器人(视觉-动作)
多模态让 Agent 能在真实物理世界或数字界面中操作,而不仅处理文本。
一个完整的多模态 Agent 通常包含:
接收环境信息:
把任务分解为可执行的步骤:
任务: "帮我订一张明天去上海的机票" 分解: 1. 打开订票网站 2. 输入出发地、目的地、日期 3. 比较航班 4. 选择最便宜的 5. 填写乘客信息 6. 完成支付
规划能力依赖 LLM 的推理能力。
短期记忆(工作记忆):
长期记忆:
记忆模块让 Agent 能跨任务学习。
可调用的外部能力:
执行具体动作:
ReAct(Reasoning + Acting) 是 Agent 的经典范式——让模型在每一步先推理再行动:
任务: "找出图中所有红色物体" Step 1: Reasoning: 我需要看图,识别所有物体,再筛选红色的。 Action: 调用视觉模型分析图像 Step 2: Observation: 图中有苹果、书、椅子、杯子 Reasoning: 现在我需要判断每个物体的颜色。 Action: 对每个物体查询颜色 Step 3: Observation: 苹果是红色、书是蓝色、椅子是棕色、杯子是红色 Reasoning: 红色的物体是苹果和杯子。 Action: 输出最终答案
ReAct 让 Agent 的推理过程外显,可解释、可调试。
让 Agent 操作软件界面,代替人类完成重复任务:
任务: "帮我把这份 Excel 数据整理成图表" Agent 操作: 1. 截屏看 Excel 当前状态 2. 选中数据列 3. 点击"插入图表" 4. 选择图表类型 5. 调整格式 6. 保存
代表产品:Anthropic 的 Computer Use、OpenAI 的 Operator、微软的 Copilot Vision。
技术挑战:
自主浏览网页、提取信息:
任务: "比较这三款手机的评测,找出性价比最高的" Agent 操作: 1. 打开搜索引擎 2. 搜索每款手机的评测 3. 阅读评测文章 4. 提取关键指标(性能、价格、续航) 5. 综合比较 6. 输出推荐
代表:AutoGPT、BrowserAGI、WebVoyager。
让 Agent 完成完整的视觉创作流程:
任务: "为我的咖啡店设计一个 logo" Agent 操作: 1. 询问用户偏好(风格、颜色) 2. 调用文生图模型生成多个候选 3. 评估候选质量 4. 让用户选择 5. 微调细节 6. 输出最终设计
代表:Midjourney 的 Remix、Adobe Firefly、LLaVA-Plus。
让 MLLM 作为机器人的「大脑」:
任务: "把桌上的红色杯子拿到厨房" Agent 操作: 1. 视觉识别桌上的红色杯子 2. 规划机械臂路径 3. 控制机械臂抓取 4. 移动到厨房 5. 放下杯子
代表:Google PaLM-E、RT-2、斯坦福 Mobile ALOHA、特斯拉 Optimus。
具身智能(Embodied AI)是 Agent 的极致——直接与物理世界交互:
机器人动作是连续的(关节角度、力度),而 LLM 输出是离散 token。需要把动作token 化:
机器人动作: [关节1角度, 关节2角度, ..., 力度] ↓ 离散化 动作 token: [动作_123, 动作_456, ...]
RT-2、OpenVLA 等模型用这种方式让 LLM 直接输出动作。
物理世界要求实时响应,但 LLM 推理慢(秒级)。这对低延迟控制是巨大挑战。
解决:
机器人可能造成物理伤害,需要严格安全机制:
训练环境的多样性决定了机器人在新场景的泛化能力。RoboCasa 等基准提供多样化家庭场景训练。
直接用 GPT-4V 等强模型作为 Agent,无需训练:
优点:无需训练;缺点:成本高、不稳定。
用 Agent 轨迹数据微调模型:
[任务] + [环境状态] → [正确行动序列]
数据来源:
代表:Toolformer、Gorilla、AgentTuning。
让 Agent 在环境中试错学习:
Agent 在环境中执行行动 → 获得奖励 → 更新策略
这种方法需要可模拟的环境(如游戏、模拟器),现实中难以直接应用。
代表:Voyager(在 Minecraft 中学习)、Eureka(NVIDIA)。
复杂任务需要几十甚至上百步,Agent 容易在中途迷失。需要:
调用错误的工具或参数错误会导致任务失败。需要:
Agent 执行过程中可能出错(点错按钮、API 失败)。需要:
多步 LLM 调用成本高、延迟累积。需要:
Agent 行为需要让用户理解与监督。需要:
不再为每个任务单独训练 Agent,而是用一个通用 Agent 处理所有任务。GPT-4o、Claude 3.5 等都在朝这方向演化。
从「LLM + 工具描述」走向「LLM + 端到端动作输出」。PaLM-E、RT-2 等已经让 LLM 直接输出机器人动作 token。
多个 Agent 分工合作完成复杂任务:
代表:AutoGen、MetaGPT。
Agent 需要积累长期经验,跨任务学习。RAG(检索增强生成)、知识图谱等技术是关键。
不是完全自主,而是与人类协同:
这种人机协作模式更现实、更安全。
多模态 Agent 被认为是通往 AGI(通用人工智能)的关键路径之一:
虽然当代 Agent 离真正的 AGI 还远,但它们已经在特定场景(编程、研究助手、客服)展现出实用价值。未来 5-10 年,多模态 Agent 可能重塑大量行业的工作方式。
Agent 的大规模部署会带来深远影响:
自动化将影响大量白领工作(数据录入、客服、初稿撰写)。但也会创造新岗位(Agent 训练师、监督员)。
Agent 犯错谁负责?开发者?用户?模型本身?法律需要更新。
恶意使用 Agent 可能造成大规模伤害(自动攻击、虚假信息)。
过度依赖 Agent 可能让人类丧失某些技能。
这些问题需要技术、法律、社会的协同应对。
多模态 Agent 是多模态大模型的最高阶应用——让模型不仅理解与生成,还能自主规划与行动。Agent 由感知、规划、记忆、工具、行动五个核心组件构成,通过 ReAct 等范式循环执行。GUI Agent、浏览器 Agent、视觉创作 Agent、具身机器人是四大代表应用。Agent 面临长程规划、工具调用、错误恢复、成本等挑战,未来趋势是通用 Agent、端到端训练、多 Agent 协作与人类协同。多模态 Agent 被认为是通往 AGI 的关键路径,但也带来深远的伦理与社会影响。
下一节(8.5)我们速览 Sora、Stable Diffusion 3、FLUX、Runway、Pika、Gemini 等生成模型的 SOTA。