第 3 章 · 质检流水线:数据采集与处理 本章要回答的三个问题:模型任务的数据需求怎么翻译成可执行的字段与量纲?网上的数据源良莠不齐,评审一座源头的标准是什么?从原始页面到可训练资产,清洗、存储、标注增强各道工序怎么衔接才不返工? 为什么会有这一章 引擎车间的产出是"干净但原始"的数据流——干净指没有 HTML 噪声,原始指还没对齐任何模型的胃口。1.4 节立过那条优先级:数据质量优先。但质量不是抓出来的,是流水线质检出来的。业界有个被反复验证的比例感:供料项目里花在采集上的力气往往只占三成,剩下七成都在处理——去重、清洗、格式对齐、标注、增强。跳过或压缩后七成,模型侧的表现会用最无情的方式把账补回来。 这一章的组织方式还是调度室的:3.1 在流水线入口做"来料分析"(需求反推字段),3.
本章要回答的三个问题:模型任务的数据需求怎么翻译成可执行的字段与量纲?网上的数据源良莠不齐,评审一座源头的标准是什么?从原始页面到可训练资产,清洗、存储、标注增强各道工序怎么衔接才不返工?
引擎车间的产出是"干净但原始"的数据流——干净指没有 HTML 噪声,原始指还没对齐任何模型的胃口。1.4 节立过那条优先级:数据质量优先。但质量不是抓出来的,是流水线质检出来的。业界有个被反复验证的比例感:供料项目里花在采集上的力气往往只占三成,剩下七成都在处理——去重、清洗、格式对齐、标注、增强。跳过或压缩后七成,模型侧的表现会用最无情的方式把账补回来。
这一章的组织方式还是调度室的:3.1 在流水线入口做"来料分析"(需求反推字段),3.2 是供货源评审(数据源选择与评估),3.3 是清洗车间,3.4 是仓储管理,3.5 是增值加工(标注与增强)。五道工序有严格的先后依赖——字段没定稿就评审数据源,会被"这个站数据好全"牵着走;清洗规则没跑通就入库,仓库很快被脏数据淹没。
流水线五道工序,任何一道偷工,账都会记在模型表现上。
拿到模型侧的一句话需求后,你能完成从翻译到资产的全程。具体拆开:能把"训练一个领域问答模型"翻译成字段清单、量级估算与分布要求(3.1);能用五维记分卡评审候选数据源,并用试抓数据验证判断(3.2);能搭建清洗流水线——文本规整、去重(精确与近似两级)、字段校验——并让每条规则可回溯(3.3);能按访问模式设计存储分区、维护版本与血缘(3.4);能选择正确的标注策略与增强手段,并看住它们的风险(3.5)。
| 节号 | 回答哪个问题 | 关键产出 |
|---|---|---|
| 3.1 按单备料 | 需求怎么变成字段 | 需求分析四步法与量纲清单 |
| 3.2 供货源评审 | 哪些源头值得进料 | 五维记分卡与试抓验证流程 |
| 3.3 清洗车间 | 脏数据怎么变合格 | 分层清洗规则与两级去重实现 |
| 3.4 仓储管理 | 合格数据放哪怎么管 | 分区策略与版本血缘实践 |
| 3.5 增值加工 | 数据怎么再上一个台阶 | 标注策略选择与增强风险清单 |
流水线尽头是可用的数据资产,第 4 章把它们派往具体专线:NLP 吃文本、CV 吃图像、推荐系统吃行为日志、通用机器学习吃表格。如果你主要做工程侧,可以在本章后直接跳第 5 章的调度中心;但 3.3 的清洗与 3.4 的仓储建议两章都读——它们是采集与训练两个世界的接口。