本节摘要:SOURCE 2.1 强调标注质量直接决定模型上限。本节给出标签体系设计、标注手册、多人仲裁与 IAA(Inter-Annotator Agreement)指标,避免「垃圾标注训练出垃圾模型」。
| 原则 | 说明 | 反例 |
|---|---|---|
| 互斥 | 单标签任务类间不重叠 | 「一般」与「中性」混用 |
| 完备 | 任意文本可映射 | 无法分类的占 30% |
| 可执行 | 标注员 30 秒内能判 | 需深度领域知识 |
情感三分类示例:积极 / 消极 / 中立——须在手册中定义「无明显情感」的判据。
SOURCE:推荐 Label Studio、Doccano——支持任务分配、进度追踪、导出 COCO/JSONL。
| 指标 | 适用 |
|---|---|
| Cohen's Kappa | 两名标注员 |
| Fleiss Kappa | 多名标注员 |
| % Agreement | 粗估(未校正偶然) |
一般 Kappa > 0.6 可接受,> 0.8 优秀;低于 0.4 应先修规范而非训模型。
# 概念:简单一致率 def agreement(labels_a, labels_b): assert len(labels_a) == len(labels_b) same = sum(1 for a, b in zip(labels_a, labels_b) if a == b) return same / len(labels_a)
⚠️ 常见坑:只追求标注速度不做抽检——线上 F1 崩溃时无法追溯。
💡 关键直觉:金标准集应固定为「永不参与训练」的评测锚点。
第 3 章进入表示学习演化:BoW → TF-IDF → 嵌入 → BERT。
标注质量的关键不在工具,而在手册与流程。一本合格的标注手册至少要写清:类别定义与判据、边界案例的裁决规则、处理无法判断样本的兜底标签、质量抽检的比例与通过线。例如情感三分类里「中立」的判据必须写明——「文本陈述客观事实、无明显褒贬」;「一般」这种容易与「中立」混用的类别要么删掉,要么给出区分例句。边界案例要预先收集一二十条放入手册当「真题」,让标注员先做一遍资格测试。
流程上,工业界常见双人标注加仲裁:两名标注员独立标注同一批样本,不一致的交给仲裁者(通常是产品与算法共同决策)定夺,仲裁结果回写金标准集。抽检不能只看一致率,要分层抽——按来源、长度、难易程度分层,避免只抽容易的样本。Kappa 低于 0.4 时先改手册而不是训模型,这个原则写在很多团队的规范里。
工具方面,Label Studio 与 Doccano 都支持任务分配、进度追踪与 JSONL 导出;关键是把「规范版本」与「标注任务」绑定,标注结果里记录使用的规范版本号,方便以后追溯某批标注是在哪版规范下产出的。
值得提醒的是「金标准集」的作用:它是固定在评测流程里的锚点,永不参与训练,每次模型迭代都要在它上面跑一遍,防止指标虚高而不自知。金标准集也要定期小规模修订,但修订记录必须留痕,并且修订后要重新评估所有已发布模型的分数,否则会出现「分数对不上版本」的混乱。标注质量是一个持续工程,不是一次性的启动活动。
最后,标注阶段就该为错误分析留好数据:记录每条标注的标注员、时间、是否仲裁。当第 5 章做错误分析时,你会发现「某标注员对某类标注偏差大」这类系统性根因,比「模型哪里不对」更容易定位和修复。这也是为什么说数据团队与算法团队必须共用一份标注元数据。
# 概念:双人标注 + 仲裁的工作流简化 def annotate_and_reconcile(a, b, arbiter): results = [] for x, y in zip(a, b): if x == y: results.append(x) else: results.append(arbiter(x, y)) # 仲裁者裁决 return results
| 要素 | 内容 | 验收标准 |
|---|---|---|
| 类别定义 | 每类判据 + 例句 | 30 秒内可判 |
| 边界案例 | 一二十条真题 | 手册内可查 |
| 双人标注 | 独立标同一批 | 一致率记录 |
| 仲裁 | 专家裁决 | 结果回写 |
| 抽检 | 分层抽样 | Kappa > 0.6 |
标注不是越多越好,先估算再动手。单条情感三分类的标注大约需要数秒到十几秒,含复看与仲裁则乘以系数;一人一天的稳定产出量是有上限的,据此反推样本量与周期。
| 环节 | 单条约耗时 | 备注 |
|---|---|---|
| 初标 | 数秒~十几秒 | 依边界案例密度 |
| 复标 | 同初标 | 双人标注 |
| 仲裁 | 数倍 | 仅不一致样本 |
| 抽检 | 少量 | 分层抽样 |
先跑 50 条试点,实测单条耗时与一致率,再决定全量规模。宁可先小批量高质量,也不要一次性大规模粗糙标注——返工成本远高于初标成本。