源文件:book/chapter9.md 多模态与实时交互 前面的章节探讨了 Agent 在文本世界中的设计——通过上下文、工具和代码与数字系统交互。然而,Agent 的交互对象不仅仅是文本和 API。当 Agent 需要听懂用户的语音指令、在屏幕上找到并点击正确的按钮、或控制机械臂精确抓取物体时,它进入了一个全新的领域:多模态实时交互——从纯文本输入输出扩展到多模态感知与实时响应,这是 Agent 跳出“对话框”的关键一步。所谓“多模态”,就是同时处理多种信息形式——文字、语音、图像、视频、动作——而不只是文本。 先划定本章的边界。