文本到语音与语音


文档摘要

文本到语音与语音 文本到语音(Text-to-Speech,TTS)合成把 ASR 流水线逆转过来,从书面文字生成自然的音频。本文件涵盖 TTS 流水线(文本归一化、G2P、声学模型、声码器)、Tacotron、WaveNet、HiFi-GAN、声音克隆、语音转换以及语音活动检测(VAD)。 在第 1 个文件中我们构建了信号处理工具箱:波形、频谱图、梅尔滤波器组和 MFCC。在第 2 个文件中我们把语音转换成了文字。现在我们把箭头反过来:给定文字,合成自然的语音。这就是文本到语音(TTS),这个问题同时也打开了通往语音转换、声音克隆和语音活动检测的大门。 可以把 TTS 想象成一场舞台表演。剧本就是文本输入。导演(声学模型)决定每一句台词该怎么听起来——音高、节奏、重音。


发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U