说话人与音频分析 说话人与音频分析识别谁在说话、何时说话,以及存在哪些非语音声音。本文件涵盖说话人确认与辨认、i-vector、d-vector、x-vector、说话人分离、音频事件分类、音乐信息检索以及语音情感识别。 在第 1 个文件中我们构建了信号处理基础:频谱图、MFCC 和梅尔滤波器组。在第 2 个文件中我们识别了说了什么。现在我们问是谁说的、何时说的,以及音频中还在发生什么。说话人识别、说话人分离、音频分类和音乐分析共享一条共同主线:学习紧凑的嵌入,以捕捉手头任务所需的正确不变性,呼应第 6 章中的嵌入思想。 可以把识别说话人想象成在电话里认出朋友的声音。你不需要听懂词句;关于音色、节奏和声音品质的某些东西对那个人来说是独一无二的。