自动语音识别


文档摘要

自动语音识别 自动语音识别(Automatic Speech Recognition,ASR)把 spoken audio 转换为书面文字,在人类语音与机器可读语言之间架起桥梁。本文件涵盖 GMM-HMM、CTC 损失、RNN-T 转录器、基于注意力的编码器-解码器模型(LAS)、Whisper 以及端到端 ASR——从经典流水线到现代神经架构。 自动语音识别(ASR)的任务是把口语音频转换为书面文字。它是 AI 中最古老的问题之一(20 世纪 50 年代的最早系统只能识别单个数字),也是商业部署最广泛的技术之一(语音助手、转录服务、字幕生成)。 困难之处在于语音的巨大可变性:不同的说话人、口音、语速、背景噪声、麦克风特性,以及把连续声学信号映射到离散词语这一根本性的歧义。


发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U