AI 与大模型 · 第 15 期 · 第二季第 7 期

SFT 指令数据,3 条好数据胜过 3000 条废数据

数据质量 · 多样性 · 难度筛选

一句话结论:SFT 的效果由数据质量决定,不是数量。LIMA 论文用 1000 条精心标注的数据就训出接近 GPT-4 的对话能力。3 条高质量、多样、有难度的指令,胜过 3000 条机械复制、同质化、易答的废数据。先筛质量再堆量。
⏱ 约 9 分钟 🎯 想做SFT但数据不够好的人 📦 源:nanochat §2

01反共识:多不一定好,同质化会毁模型

很多人 SFT 第一步是"多搞数据"——爬几万条 QA 灌进去训。结果模型越训越笨:回答千篇一律,泛化变差。

问题在同质化:几万条数据如果是同一个模板生成的("什么是X""X的特点是..."),模型学到的是这个模板而不是真正的指令遵循。它会对没见过的问法失效。质量三要素:

LIMA 的证据:1000 条人工精标的对话数据,base 模型 SFT 后对话能力接近 GPT-4。说明质量是杠杆,数量是边际递减。从 1000 到 10000 提升远小于从 0 到 1000。

质量是杠杆,
数量是边际递减。
灏天文库 · AI 与大模型 P.44

02数据质量自测:给你的指令数据打分

回答 4 个问题,看你的 SFT 数据是黄金、及格还是垃圾。

📊 SFT 数据质量自测
回答 4 个问题,给数据打分并给出改进建议。

03数据筛选的三个动作

一个常见坑:先堆量再筛,筛完发现 90% 是废的,白训了三轮。先筛再训——哪怕只有 2000 条,质量高也比 5 万条杂的好。nanochat 的实践:用几千条高质量数据 SFT,效果超过几万条未筛的。

先筛再训,
2000 条精标胜过 5 万杂的。
灏天文库 · AI 与大模型 P.45

04带走这套数据清单

✅ SFT 数据 6 条可执行规则

  1. 质量优先于数量:1 条错答案破坏力 > 100 条好答案。
  2. 三要素:正确性、多样性、难度,缺一不可。
  3. 去重防同质化:指令级和答案级都去重。
  4. 难度过滤:用模型打难度分,留费劲的,删太简单的。
  5. 质量打分:强模型当裁判,留高分,或 IFD 排序取 top。
  6. 先筛再训:2000 条精标胜过 5 万条未筛的。
3 条好数据,
胜过 3000 条废的。
灏天文库 · AI 与大模型 P.46