第 9 章 · 实验教程:多模态与实时交互


文档摘要

第 9 章 · 实验教程:多模态与实时交互 本章对应正文:第 9 章 · 多模态与实时交互 核心命题:从文本扩展到语音、GUI、物理世界——语音三范式、Computer Use、机器人,让 Agent 真正"听见、看见、行动"。 纯文本 Agent 只能活在对话框里。这一章把 Agent 推向实时与物理世界:语音让它能"听和说",GUI 让它能操作软件界面,机器人/电话让它能与真实世界交互。语音部分尤其关键——从级联流水线(ASR→LLM→TTS)到流式感知,再到端到端语音模型,三种范式在延迟与副语言保真之间各有取舍。 本章 5 个实验聚焦语音方向,覆盖了级联流水线、流式感知、端到端模型、可控 TTS 和电话 Agent。

第 9 章 · 实验教程:多模态与实时交互

本章对应正文:第 9 章 · 多模态与实时交互

核心命题:从文本扩展到语音、GUI、物理世界——语音三范式、Computer Use、机器人,让 Agent 真正"听见、看见、行动"。

纯文本 Agent 只能活在对话框里。这一章把 Agent 推向实时与物理世界:语音让它能"听和说",GUI 让它能操作软件界面,机器人/电话让它能与真实世界交互。语音部分尤其关键——从级联流水线(ASR→LLM→TTS)到流式感知,再到端到端语音模型,三种范式在延迟与副语言保真之间各有取舍。

本章 5 个实验聚焦语音方向,覆盖了级联流水线、流式感知、端到端模型、可控 TTS 和电话 Agent。建议先跑 live-audio 搭一个能听能说的级联语音 Agent,再用 streaming-speech 和 end-to-end-speech 直观对比"流式 vs 整句"和"级联 vs 端到端"两条核心权衡轴。

实验列表

实验 类型 难度 说明
live-audio ★★ 实时语音聊天,集成 VAD + ASR(Whisper/SenseVoice)+ LLM + TTS(Fish Audio),WebSocket 低延迟级联流水线
phone-agent ★★ 标准 ReAct Agent 自行想清号码与目标,调用 PineClaw Voice API 完成真实电话通话并按需追问再拨
streaming-speech ★★ 用 Qwen2-Audio 模拟流式语音感知:音频按递增长度分块喂 ASR,对比低首包延迟与高准确率的取舍
end-to-end-speech ★★★ 用 OpenAI speech-to-speech 演示端到端「听→想→说」,与 ASR→LLM→TTS 级联对比延迟与副语言损失
controllable-tts ★★ LLM 输出带控制标记(情感/语速/停顿/笑声),执行层解析映射到参考语音库风格档案再合成

类型与难度说明

标记 含义
可独立运行:自带完整代码,配好 API Key 即可跑
📖 复现指南:依赖需自行 git clone 的外部仓库
🚧 设计文档:仅含架构方案,可运行代码仍在完善
★ ~ ★★★ 从易到难,★ 为入门级、★★★ 为进阶挑战

阅读建议

  • 入门读者:从 live-audio 开始,搭一个完整可用的级联语音 Agent,直观感受 VAD → ASR → LLM → TTS 的实时流水线。
  • 关注延迟与质量权衡:streaming-speech 揭示"早出文本 vs 等整句识别"的取舍,end-to-end-speech(★★★)则对比级联与端到端两条范式在延迟与副语言信息上的差异。
  • 关注语音应用落地:phone-agent 演示 Agent 代替用户打真实电话,controllable-tts 展示如何让合成语音带情感与节奏——两者都是语音 Agent 走向真实场景的关键能力。

← 返回总目录 · 📖 读本章正文 · 📑 本章索引


发布者: 作者: bojieli 转发
评论区 (0)
U