4.4 语音识别与合成:机器的耳朵与喉咙 本节摘要:语音识别(ASR)把声波转成文字,语音合成(TTS)把文字变成语音,两者拼成人机语音交互的完整闭环。识别一侧的流水线是前端处理、声学模型、语言模型与解码器,特征以模仿人耳的 MFCC 为代表,模型从 GMM-HMM 时代走到端到端(CTC、RNN-T、Transformer)与自监督预训练(Wav2Vec 2.0、HuBERT)。 会员。《4.4 语音识别与合成:机器的耳朵与喉咙》收录于灏天文库文集《零基础入门人工智能:概念、方向与应用全解析》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。