内容摘要
SFT指令数据·3条好数据胜过3000条废数据 灏 灏天文库 · AI 与大模型 第 15 期 · 第二季连载 AI 与大模型 · 第 15 期 · 第二季第 7 期 SFT 指令数据, 3 条好数据胜过 3000 条废数据 数据质量 · 多样性 · 难度筛选 一句话结论: SFT 的效果由数据质量决定,不是数量 。LIMA 论文用 1000 条精心标注的数据就训出接近 GPT-4 的对话能力。3 条高质量、多样、有难度的指令,胜过 3000 条机械复制、同质化、易答的废数据。先筛质量再堆量。 ⏱ 约 9 分钟 🎯 想做SFT但数据不够好的人 📦 源:nanochat §2 01 反共识:多不一定好,同质化会毁模型 很多人 SFT 第一步是"多搞数据"——爬几万条 QA 灌进去训。结果模型越训越笨:回答千篇一律,泛化变差。 问题在 同质化 :几万条数据如果是同一个模板生成的("什么是X""X的特点是..."),模型学到的是这个模板而不是真正的指令遵循。它会对没见过的问法失效。质量三要素: 正确性 :答案必须对。