第 9 章 · 实验教程:多模态与实时交互 本章对应正文:第 9 章 · 多模态与实时交互 核心命题:从文本扩展到语音、GUI、物理世界——语音三范式、Computer Use、机器人,让 Agent 真正"听见、看见、行动"。 纯文本 Agent 只能活在对话框里。这一章把 Agent 推向实时与物理世界:语音让它能"听和说",GUI 让它能操作软件界面,机器人/电话让它能与真实世界交互。语音部分尤其关键——从级联流水线(ASR→LLM→TTS)到流式感知,再到端到端语音模型,三种范式在延迟与副语言保真之间各有取舍。 本章 5 个实验聚焦语音方向,覆盖了级联流水线、流式感知、端到端模型、可控 TTS 和电话 Agent。
本章对应正文:第 9 章 · 多模态与实时交互
核心命题:从文本扩展到语音、GUI、物理世界——语音三范式、Computer Use、机器人,让 Agent 真正"听见、看见、行动"。
纯文本 Agent 只能活在对话框里。这一章把 Agent 推向实时与物理世界:语音让它能"听和说",GUI 让它能操作软件界面,机器人/电话让它能与真实世界交互。语音部分尤其关键——从级联流水线(ASR→LLM→TTS)到流式感知,再到端到端语音模型,三种范式在延迟与副语言保真之间各有取舍。
本章 5 个实验聚焦语音方向,覆盖了级联流水线、流式感知、端到端模型、可控 TTS 和电话 Agent。建议先跑 live-audio 搭一个能听能说的级联语音 Agent,再用 streaming-speech 和 end-to-end-speech 直观对比"流式 vs 整句"和"级联 vs 端到端"两条核心权衡轴。
| 实验 | 类型 | 难度 | 说明 |
|---|---|---|---|
| live-audio | ✅ | ★★ | 实时语音聊天,集成 VAD + ASR(Whisper/SenseVoice)+ LLM + TTS(Fish Audio),WebSocket 低延迟级联流水线 |
| phone-agent | ✅ | ★★ | 标准 ReAct Agent 自行想清号码与目标,调用 PineClaw Voice API 完成真实电话通话并按需追问再拨 |
| streaming-speech | ✅ | ★★ | 用 Qwen2-Audio 模拟流式语音感知:音频按递增长度分块喂 ASR,对比低首包延迟与高准确率的取舍 |
| end-to-end-speech | ✅ | ★★★ | 用 OpenAI speech-to-speech 演示端到端「听→想→说」,与 ASR→LLM→TTS 级联对比延迟与副语言损失 |
| controllable-tts | ✅ | ★★ | LLM 输出带控制标记(情感/语速/停顿/笑声),执行层解析映射到参考语音库风格档案再合成 |
| 标记 | 含义 |
|---|---|
| ✅ | 可独立运行:自带完整代码,配好 API Key 即可跑 |
| 📖 | 复现指南:依赖需自行 git clone 的外部仓库 |
| 🚧 | 设计文档:仅含架构方案,可运行代码仍在完善 |
| ★ ~ ★★★ | 从易到难,★ 为入门级、★★★ 为进阶挑战 |
← 返回总目录 · 📖 读本章正文 · 📑 本章索引