第 9 章 音频与语音 本章带你从声音的物理原理出发,一路走到让机器"听懂"人类语言并"开口说话"。我们先打好数字信号处理的地基(波形、采样、傅里叶变换、频谱图、MFCC),再依次进入语音识别(把语音变成文字)、语音合成(把文字变回自然语音)、说话人与音频分析(谁在说话、何时说话、还有什么声音),最后落到源分离与降噪(从嘈杂中分离出干净的声音)。这是一条从"听见"到"听懂"、再到"会说话"的完整技术栈,是语音助手、转录服务、助听器和实时通信等应用背后的核心能力。 本章简介 音频与语音处理是 AI 中历史最悠久、商业落地最成熟的领域之一——从 20 世纪 50 年代能识别单个数字的早期系统,到今天能在数十亿小时数据上预训练、跨数百种语言工作的 Whisper 和 wav2vec。