文本处理与经典 NLP


文档摘要

文本处理与经典 NLP 文本处理把原始字符转换成模型能够消化的结构化表示。本文件涵盖分词(词级、子词、BPE、WordPiece)、文本归一化、编辑距离、TF-IDF、n-gram 语言模型、POS 标注、NER 和情感分析——这条经典的 NLP 流水线至今仍是现代系统的基石。 原始文本是杂乱的。在任何 NLP 模型能够处理语言之前,文本都必须先被清洗、归一化,并转换成结构化的表示。本文件讲的是从原始字符到模型可用特征的整条流水线,以及在深度学习兴起之前统治 NLP 的那些经典算法。 文本归一化(text normalisation)把原始文本转换成一个规范形式。目标是削减无关紧要的变体,让 "Hello"、"hello"、"HELLO" 和 "héllo" 得到恰当的处理。


发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U