- 文集信息
- 目录大纲
- 最新文档
- 知识宇宙
文集详情
文集导读
语音识别技术基础:声学模型与语言模型
你有没有想过,手机凭什么听我们说话,挑出来的是这几个字,而不是发音几乎一样的另外几个?一句话出口,"把门关上"和"把门撞上"听起来真的差不多。能把两只耳朵之间的差别填平、把里面那层硬邦邦的语言规律塞进去的,正是声学模型与语言模型这两套系统的对抗与妥协。这本教程要带你走进的,就是它们打交道的那条流水间。
一册的路线:一台把声音炼成文字的流水车间
语音识别(Automatic Speech Recognition,ASR)的核心任务,是把一段连续的声音信号,翻译成一段让人类读得懂的文字序列。这件事听上去只有一步,做起来却是整整一条生产线。本书的主线,是跟着声音这条原料走完整套车间,看它在每一道工位上被加工成什么形状、留下什么信息、丢弃什么噪声。
从贝叶斯的角度看,整个车间最终要回答的问题只有一行:给定声学观测序列 O,哪条词序列 W 最可能产生它,即求后验概率 P(W|O) 的最大者。根据贝叶斯定理,这一行可以被拆成两个独立的部件相乘:声学模型负责 P(O|W),回答这段声音像不像在说这个句子;语言模型负责 P(W),回答这句话本身像不像人话。正因为 P(O) 对候选词序列都是同一个常数,最大化 P(W|O) 就等价于最大化两者的乘积。
本书顺着这条生产线安排了五章。第一章是车间的总图,讲清楚原料从哪来、成品到哪去,以及声学模型、语言模型、发音词典、解码器各自站在哪道工序上。第二、三章是车间里最核心的两条并行的工位带:声学侧把声音炼成可以计算的数字特征、再交给模型判断像哪个音素;语言侧则用海量文本给词序列一个评分。第四章是总装,把两条工位的产出拧在一起,用搜索算法在巨大的候选空间里找出最终答案,这一步就是解码。第五章负责出厂质检,讲 WER 这些指标如何衡量整条线的出成率,以及常见的坑该怎么排。
全册知识地图
下面这张图把五章串成一条流水线,方框各是一个工位,箭头是原料的走向;从上往下读,正是声音从麦克风一路变成屏幕上一行字的过程。

图片说明:全册五章构成一条从波形到文字的流水线,声学侧与语言侧两线并行,到解码处汇合。
该怎么用这本教程
每一章都有一个直通本章核心的地图页,紧接着是几节正文;节与节之间按加工顺序承接,绝大多数知识不需要跳跃式地回头看。若你只想解决模型为什么越调越差这类实际问题,可以先翻到第四章和第五章的排错清单,再往回补原理。
你不需要是数学高手,但得带两件行囊:一是概率直觉,只要接受"给定的声音下这句候选文字更像真的"这句话能算分就行,全书不让你手动算积分;二是耐心,因为声学与语言两个模型在解码处碰头时,最耗心态的是"系统说错、却说不出错在哪"的这段探案过程。若你本来就会写 Python、跑过一两个语音工具,起步会顺很多——但别指望靠装软件绕过原理,本书每一节都落回到"这条流水线上到底哪道工序动了什么样"。
五章的负担分配
再用一段话把分工钉死:声学模型管"这句声音像不像在念这些音",语言模型管"这句文字像不像人说的话",发音词典充当从音到字的翻译表,解码器则负责在最巨大的候选空间里,把两者乘积挑出最大的那一条。前两章各讲一台发动机,第四章的总装把它俩拧到一处,第五章评估不但教你量体温,也教你反过来用体温倒推是哪台发动机在使坏——这套"由指标回到部件"的读法,是读完 32 篇后最该带走的东西。
说句掏心的话:ASR 这条路没有"装个库就通"的捷径。本书多用同一句话在不同模型、不同权重下的命运来对照——同样的"把门关上",词表里有没有门把手相关词、语言权重调高还是调低,结果可能完全不同。读完整册,你最有把握的就是这门"预判变化"的功夫。
目录大纲
最新文档
知识宇宙
正在加载知识图谱...