AI Engineering · 第 7 章 语音与音频
章节摘要:本章对应原课程「06-speech-and-audio」,属「第一篇·深度学习」。让机器听懂声音——ASR、TTS、音频生成。本章共 17 节,前置依赖为「第4章」。语音是另一条感知通道,从波形到梅尔特征再到 Whisper。 本章将带你逐节吃透这一领域的核心概念,并尽量从零手工实现,再用主流框架对比验证。
学习目标
阅读完本章,你应当能够:
- 理解语音与音频在整个 AI 工程体系中的定位(让机器听懂声音——ASR、TTS、音频生成)。
- 掌握本章 17 节覆盖的核心概念与算法。
- 能够从零实现本章的关键模型/机制,并用框架对比验证。
- 说清本章与前后章节的依赖关系(前置:第4章)。
- 识别本章主题在生产实践中的常见应用与陷阱。
注:具体学习目标将在各子节汉化时细化为可考核的能力点。
核心概念速览
语音是另一条感知通道,从波形到梅尔特征再到 Whisper。
注:本章的 Mermaid 概念图将在支柱页完善时替换为本章核心架构/流程图(基于原 Phase README 与首节内容绘制)。
子章节导航
02 Spectrograms, Mel Scale & Audio Features
03 Audio Classification — From k-NN on MFCCs to AST and BEATs
04 Speech Recognition (ASR) — CTC, RNN-T, Attention
05 Whisper — Architecture & Fine-Tuning
06 Speaker Recognition & Verification
07 Text-to-Speech (TTS) — From Tacotron to F5 and Kokoro
08 Voice Cloning & Voice Conversion
...(本章共 17 节,详见原项目 phases/06-speech-and-audio/)
子章节之间的逻辑关系
本章共 17 节,按原课程的编号顺序递进。详细的逻辑关系图将在支柱页完善时补充(基于各节的依赖与铺垫关系)。
本章第 01 节 ... ──► 第 17 节
│
▼
下一章(第 8 章)
前置知识与后续延伸
前置知识:
本章为后续章节奠定的基础:
- 见原课程 README 的 Phase 依赖图(原项目根 README.md)。
本章支柱页为骨架初稿,各板块将在对应章节汉化推进时细化。原英文内容位于 phases/06-speech-and-audio/,每节正文为 docs/en.md,汉化状态见「教程规划.md」的待汉化清单。