第二章 语料与文本加工 本章要回答的三个问题:翻译器"吃"进去的词到底是什么?人类积累的双语对齐资料该怎么攒、怎么筛才干净?把一段话切成机器能下手的单元,要过什么样的工序?这章的答案,是所有翻译方法(尤其统计与神经)共同的地基——没有好料,模型再大也白搭。 为什么会有这一章 第一章我们把机器翻译定成了"在大量配对样本里学习目标句的生成"。可是"样本"从哪来?"配对"怎么判定? 会员。《02-语料与文本加工》收录于灏天文库文集《机器翻译技术原理与实现》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。