词性标注与句法分析 本节摘要:语法有一阵子不时髦。后来每个 LLM 流水线都要校验结构化抽取,它就回来了。第 01 节承诺过:词形还原需要词性标签。不知道 是动词,词形还原器就无法把它还原成 ;不知道 是形容词,就无法还原成 。这个承诺背后藏着一整个子领域。词性标注(POS Tagging)分配语法类别,句法分析(Syntactic Parsing)还原句子的树结构:哪个词修饰哪个词、哪个动词管哪些论元。古典 NLP 花了二十年打磨二者,然后深度学习把它们压成预训练 Transformer 顶上的一个 token 分类任务,研究界就转向了。应用界没有。每个结构化抽取流水线底下仍在用词性和依存树。本节介绍标签集、基线,以及那个「从零实现到此为止,接下来调 spaCy」的临界点。
本节摘要:语法有一阵子不时髦。后来每个 LLM 流水线都要校验结构化抽取,它就回来了。第 01 节承诺过:词形还原需要词性标签。不知道
running是动词,词形还原器就无法把它还原成run;不知道better是形容词,就无法还原成good。这个承诺背后藏着一整个子领域。词性标注(POS Tagging)分配语法类别,句法分析(Syntactic Parsing)还原句子的树结构:哪个词修饰哪个词、哪个动词管哪些论元。古典 NLP 花了二十年打磨二者,然后深度学习把它们压成预训练 Transformer 顶上的一个 token 分类任务,研究界就转向了。应用界没有。每个结构化抽取流水线底下仍在用词性和依存树。本节介绍标签集、基线,以及那个「从零实现到此为止,接下来调 spaCy」的临界点。
对应原课程:Phase 5 · Lesson 07 ·
pos-tagging-parsing(原英文phases/05-nlp-foundations-to-advanced/07-pos-tagging-parsing/docs/en.md)。前置依赖:第 01 节(文本处理)、Phase 2 · 14(朴素贝叶斯)。
阅读完本节,你应当能够:
第 01 节承诺过:词形还原需要词性标签。不知道 running 是动词,词形还原器无法把它还原成 run;不知道 better 是形容词,无法还原成 good。
这个承诺藏着一整个子领域。词性标注分配语法类别,句法分析还原句子的树结构:哪个词修饰哪个、哪个动词管哪些论元。古典 NLP 花了二十年打磨二者,然后深度学习把它们压成预训练 Transformer 顶上的一个 token 分类任务,研究界就转向了。
应用界没转。每个结构化抽取流水线底下仍在用词性和依存树:LLM 生成的 JSON 要拿语法约束校验,问答系统用依存树分解查询,机器翻译质量评估器检查依存树对齐。
词性标注给每个 token 标一个语法类别。Penn Treebank(PTB) 标签集是英语默认,36 个标签,区分之细让外行觉得啰嗦:NN 单数名词、NNS 复数名词、NNP 专有名词单数、VBD 动词过去式、VBZ 动词第三人称单数现在式,等等。Universal Dependencies(UD) 标签集更粗(17 个标签)且语言无关,成了跨语言工作的默认。
The/DET cats/NOUN were/AUX running/VERB at/ADP 3pm/NOUN ./PUNCT
句法分析产出一棵树,主要有两种风格:
依存分析在 2010 年代胜出,因为它能干净地跨语言泛化,尤其是自由语序语言。
running 是 ROOT cats 是 running 的 nsubj(主语) were 是 running 的 aux(助动词) at 是 running 的 prep(介词) 3pm 是 at 的 pobj(介词宾语)
最笨但管用的词性标注器。对每个词,预测它在训练里最常有的标签。
from collections import Counter, defaultdict def train_mft(train_examples): word_tag_counts = defaultdict(Counter) all_tags = Counter() for tokens, tags in train_examples: for token, tag in zip(tokens, tags): word_tag_counts[token.lower()][tag] += 1 all_tags[tag] += 1 word_best = {w: c.most_common(1)[0][0] for w, c in word_tag_counts.items()} default_tag = all_tags.most_common(1)[0][0] return word_best, default_tag def predict_mft(tokens, word_best, default_tag): return [word_best.get(t.lower(), default_tag) for t in tokens]
在 Brown 语料上,这个基线约 85% 准确率。不高,但是任何严肃模型都不该掉到它下面。
建模序列的联合概率:
P(tags, words) = prod P(tag_i | tag_{i-1}) * P(word_i | tag_i)
两张表:转移概率(给定前一标签的当前标签)、发射概率(给定标签的词)。两者都从计数估,加拉普拉斯平滑。用维特比解码(在标签格上的动态规划)。
import math def train_hmm(train_examples, alpha=0.01): transitions = defaultdict(Counter) emissions = defaultdict(Counter) tags = set() vocab = set() for tokens, ts in train_examples: prev = "<BOS>" for token, tag in zip(tokens, ts): transitions[prev][tag] += 1 emissions[tag][token.lower()] += 1 tags.add(tag) vocab.add(token.lower()) prev = tag transitions[prev]["<EOS>"] += 1 return transitions, emissions, tags, vocab def log_prob(table, given, key, smooth_denom, alpha): return math.log((table[given].get(key, 0) + alpha) / smooth_denom) def viterbi(tokens, transitions, emissions, tags, vocab, alpha=0.01): tags_list = list(tags) n = len(tokens) V = [[0.0] * len(tags_list) for _ in range(n)] back = [[0] * len(tags_list) for _ in range(n)] for j, tag in enumerate(tags_list): em_denom = sum(emissions[tag].values()) + alpha * (len(vocab) + 1) tr_denom = sum(transitions["<BOS>"].values()) + alpha * (len(tags_list) + 1) tr = log_prob(transitions, "<BOS>", tag, tr_denom, alpha) em = log_prob(emissions, tag, tokens[0].lower(), em_denom, alpha) V[0][j] = tr + em back[0][j] = 0 for i in range(1, n): for j, tag in enumerate(tags_list): em_denom = sum(emissions[tag].values()) + alpha * (len(vocab) + 1) em = log_prob(emissions, tag, tokens[i].lower(), em_denom, alpha) best_prev = 0 best_score = -1e30 for k, prev_tag in enumerate(tags_list): tr_denom = sum(transitions[prev_tag].values()) + alpha * (len(tags_list) + 1) tr = log_prob(transitions, prev_tag, tag, tr_denom, alpha) score = V[i - 1][k] + tr + em if score > best_score: best_score = score best_prev = k V[i][j] = best_score back[i][j] = best_prev last_best = max(range(len(tags_list)), key=lambda j: V[n - 1][j]) path = [last_best] for i in range(n - 1, 0, -1): path.append(back[i][path[-1]]) return [tags_list[j] for j in reversed(path)]
二元 HMM 在 Brown 上约 93% 准确率。从 85% 到 93% 的跳跃主要靠转移概率——模型学到 DET NOUN 常见、NOUN DET 罕见。
转移 + 发射概率是局部的,捕捉不到 saw 在 "I bought a saw" 里是名词、在 "I saw the movie" 里是动词。带任意特征(后缀、词形、前后词、词本身)的 CRF 约 97%,BiLSTM-CRF 或 Transformer 约 98%+。
这个任务的天花板由标注者分歧决定。Penn Treebank 上人类标注者约 97% 一致,超过 98% 的模型多半在过拟合测试集。
完整的依存分析从零实现超出范围,经典教材论述见 Jurafsky 与 Martin。两个要了解的古典家族:
大多数应用活儿,调 spaCy:
import spacy nlp = spacy.load("en_core_web_sm") doc = nlp("The cats were running at 3pm.") for token in doc: print(f"{token.text:10s} tag={token.tag_:5s} pos={token.pos_:6s} dep={token.dep_:10s} head={token.head.text}")
The tag=DT pos=DET dep=det head=cats cats tag=NNS pos=NOUN dep=nsubj head=running were tag=VBD pos=AUX dep=aux head=running running tag=VBG pos=VERB dep=ROOT head=running at tag=IN pos=ADP dep=prep head=running 3pm tag=NN pos=NOUN dep=pobj head=at . tag=. pos=PUNCT dep=punct head=running
从下往上读 dep 列,句子的语法结构就出来了。
每个生产 NLP 库都把词性与依存解析器作为标准流水线的一部分。
en_core_web_sm/md/lg/trf):快、准,与分词、NER、词形还原集成。token.tag_(Penn)、token.pos_(UD)、token.dep_(依存关系)。pos_tag,可用、慢、老,教学还行。保存为 outputs/skill-grammar-pipeline.md:
--- name: grammar-pipeline description: Design a classical POS + dependency pipeline for a downstream NLP task. version: 1.0.0 phase: 5 lesson: 07 tags: [nlp, pos, parsing] --- Given a downstream task (information extraction, rewrite validation, query decomposition, lemmatization), you output: 1. Tagset to use. Penn Treebank for English-only legacy pipelines, Universal Dependencies for multilingual or cross-lingual. 2. Library. spaCy for most production, stanza for academic-grade multilingual, trankit for highest UD accuracy. Name the specific model ID. 3. Integration pattern. Show the 3-5 lines that call the library and consume the needed attributes (`.pos_`, `.dep_`, `.head`). 4. Failure mode to test. Noun-verb ambiguity (`saw`, `book`, `can`) and PP-attachment ambiguity are the classical traps. Sample 20 outputs and eyeball. Refuse to recommend rolling your own parser. Building parsers from scratch is a research project, not an application task. Flag any pipeline that consumes POS tags without handling lowercase/uppercase variants as fragile.
DET NOUN 常见。saw 名动歧义。.tag_/.pos_/.dep_/.head 从下往上读出结构。下一节,我们让文本第一次走进神经网络——进入「文本的 CNN 与 RNN」,看卷积与循环如何捕捉局部与序列模式。