数据质量 · 多样性 · 难度筛选
很多人 SFT 第一步是"多搞数据"——爬几万条 QA 灌进去训。结果模型越训越笨:回答千篇一律,泛化变差。
问题在同质化:几万条数据如果是同一个模板生成的("什么是X""X的特点是..."),模型学到的是这个模板而不是真正的指令遵循。它会对没见过的问法失效。质量三要素:
LIMA 的证据:1000 条人工精标的对话数据,base 模型 SFT 后对话能力接近 GPT-4。说明质量是杠杆,数量是边际递减。从 1000 到 10000 提升远小于从 0 到 1000。
回答 4 个问题,看你的 SFT 数据是黄金、及格还是垃圾。
一个常见坑:先堆量再筛,筛完发现 90% 是废的,白训了三轮。先筛再训——哪怕只有 2000 条,质量高也比 5 万条杂的好。nanochat 的实践:用几千条高质量数据 SFT,效果超过几万条未筛的。