平行语料的攒与洗


文档摘要

02 平行语料的攒与洗 平行语料(Parallel Corpus)是"源语言句子 + 对齐的目标语言句子"组成的数据集,是统计与神经机器翻译的燃料。 攒料不是"抓进来就完事",抓取、去重、对齐、去噪是一条完整工程链。这一节讲它的来路、质量分级,以及"为什么宁缺毋滥"——一条脏句子对模型的伤害远大于对它帮助。 一份"脏"语料会把模型带进沟里,这话不是夸张 先讲一个真实翻车场景。有人从海外网站随手爬了一大批"双语字幕",没做清洗就丢进训练。 会员。《平行语料的攒与洗》收录于灏天文库文集《机器翻译技术原理与实现》,原作者/来源:灏天文库,整理自「灏天文库」,提供技术教程、实践指南与问题解决方案,支持在线阅读、全文检索与知识沉淀,助力开发者系统化学习。本站整理收录,版权归原作者/开源协议所有。

该文档为会员专享,请先登录或注册后再查看


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U