第 9 章 音频与语音
本章带你从声音的物理原理出发,一路走到让机器"听懂"人类语言并"开口说话"。我们先打好数字信号处理的地基(波形、采样、傅里叶变换、频谱图、MFCC),再依次进入语音识别(把语音变成文字)、语音合成(把文字变回自然语音)、说话人与音频分析(谁在说话、何时说话、还有什么声音),最后落到源分离与降噪(从嘈杂中分离出干净的声音)。这是一条从"听见"到"听懂"、再到"会说话"的完整技术栈,是语音助手、转录服务、助听器和实时通信等应用背后的核心能力。
本章简介
音频与语音处理是 AI 中历史最悠久、商业落地最成熟的领域之一——从 20 世纪 50 年代能识别单个数字的早期系统,到今天能在数十亿小时数据上预训练、跨数百种语言工作的 Whisper 和 wav2vec。这一领域之所以独特,在于它横跨三个层面:底层的连续信号处理(声波如何被采样、变换为频谱)、中层的统计与时频建模(如何从混合中分离信号、如何对齐变长的音频与文本),以及上层的深度学习架构(CNN、LSTM、Transformer、扩散模型如何在音频上发挥作用)。
本章的内容安排遵循"先工具、后应用"的思路。第 1 节给出贯穿全章的信号处理工具箱;第 2 至 5 节分别针对四类核心任务展开:识别说了什么(ASR)、合成怎么说(TTS)、判断是谁在说(说话人分析)、以及如何把混合的声音拆开和变干净(源分离与降噪)。你会发现,许多在第 6-8 章学到的深度学习思想(卷积、注意力、自监督预训练、U-Net、对比学习)在音频领域以新的形式再次出现——这正是触类旁通的好时机。
本章小节
- 数字信号处理(Digital Signal Processing):声音的物理本质、采样与量化、傅里叶变换(DFT/FFT)、频谱图、梅尔滤波器组与 MFCC——所有语音与音频 AI 的特征提取基础。
- 自动语音识别(Automatic Speech Recognition):从 GMM-HMM 到 CTC、RNN-T、Conformer、Whisper、wav2vec 2.0 的演进,以及流式与离线、语言模型融合等工程要点。
- 文本到语音与语音(Text to Speech and Voice):TTS 流水线(文本归一化、G2P、声学模型、声码器)、WaveNet、Tacotron、VITS、声音克隆、语音转换与语音活动检测(VAD)。
- 说话人与音频分析(Speaker and Audio Analysis):说话人确认与辨认、i-vector/x-vector/ECAPA-TDNN 嵌入、说话人分离、音频事件分类、音乐信息检索。
- 源分离与降噪(Source Separation and Noise):鸡尾酒会问题、ICA、NMF、时频掩码、波束成形、Conv-TasNet、SepFormer、语音增强、主动降噪(ANC)与回声消除(AEC)。
学习路径
前置知识:本章建立在前 1-8 章的基础之上。其中最关键的是:
- 第 1 章的线性代数(向量、矩阵、范数、特征值)——理解 DFT 矩阵、滤波器系数、协方差矩阵的基础。
- 第 2 章的矩阵分解(SVD、特征分解)——直接用于 ICA、NMF 和 i-vector 的总变差空间。
- 第 3 章的优化与概率(梯度下降、对数尺度、不确定性原理)——贯穿 LMS 自适应滤波、量化、时频权衡。
- 第 5 章的概率模型与动态规划(高斯混合、HMM、维特比、EM)——经典 ASR(GMM-HMM)和 CTC 的直接前身。
- 第 6 章的深度学习(CNN、RNN/LSTM、卷积、自编码器、知识蒸馏)——本章绝大多数现代架构的骨干。
- 第 7 章的序列模型与 Transformer(注意力、自监督预训练、BERT 范式)——理解 LAS、Conformer、wav2vec 2.0、SepFormer 的关键。
- 第 8 章的视觉模型(ViT、U-Net、SENet、ArcFace、扩散模型)——许多音频架构(AST、Demucs、ECAPA-TDNN、StyleTTS 2)直接借鉴视觉领域的设计。
如果时间有限,至少应先复习第 6 章和第 7 章,因为本章的现代内容大量依赖卷积网络、循环网络和注意力机制。
后续章节:第 10 章多模态学习会把语音与图像、文本结合起来(例如音视频联合理解、语音驱动的头像生成),本章学到的音频表示和模型将成为多模态系统的"听觉"组件。
关键概念速览
- 采样与奈奎斯特定理:把连续声波转换为离散样本时,采样率必须至少是信号最高频率的两倍,否则会发生不可逆的混叠——这是所有数字音频的起点。
- 频谱图(Spectrogram)与 STFT:把一维波形切成加窗短帧、逐帧做 FFT 后堆叠,得到二维的时频表示,是音频处理中最核心的可视化与输入形式。
- MFCC / 对数梅尔频谱图:模拟人耳非线性频率感知(梅尔刻度)的音频特征;MFCC 供经典模型使用,对数梅尔频谱图是深度学习模型的标准输入。
- CTC 与 RNN-T:解决端到端 ASR 中"输入帧多、输出字符少"对齐难题的两种核心损失/架构,分别通过空白 token 和预测网络实现。
- 声码器(Vocoder):把声学表示(如梅尔频谱图)转换为可听波形的模块,从 WaveNet 的自回归生成到 HiFi-GAN 的并行对抗生成,是决定 TTS 音质与速度的关键。
- 说话人嵌入(Speaker Embedding):把"是谁在说话"压缩成固定维向量(x-vector、ECAPA-TDNN),用余弦相似度比较,是说话人确认、辨认、分立和声音克隆的共同基础。
- 时频掩码与自适应滤波:通过估计每个时频 bin 属于哪个源(掩码)或用 LMS/NLMS 实时跟踪噪声(自适应滤波),实现源分离、语音增强和主动降噪。