3.6 语言模型训练与领域适配 语言模型的能力上限,一半由文本数据决定。这一节把"数据决定论"落到操作层面:数据规模越大越好吗、怎么清洗与采样、怎么让模型在目标领域(医疗、法律、会议)变强,以及半监督与无监督这类省标注数据的大招。 读完该会什么 能说出"数据规模大"与"数据质量高"为什么两者都重要、如何权衡。 能描述领域适配的几种做法:领域语料、微调、插值、重加权。 能说明半监督/无监督如何借助大规模无标注文本辅助语音建模。 会员。《3.6 语言模型训练与领域适配》收录于灏天文库文集《语音识别技术基础:声学模型与语言模型》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。