资源描述
ShareGPT 是一个包含约 9 万条真实用户与 ChatGPT 交互记录的高质量开源数据集。该数据集保留了复杂的多轮对话逻辑与追问技巧,是进行大语言模型指令微调(SFT)、RLHF 训练以及对话生成的核心资源。适用于训练 Alpaca、Vicuna 等开源模型,帮助开发者提升模型的指令跟随能力与多轮对话表现,是 AI 研究与模型微调的必备数据资产。
详细内容
## 数据集背景与来源
ShareGPT 数据集源自真实用户通过 ShareGPT 浏览器插件自愿分享的人机交互记录。作为早期开源大语言模型(LLM)爆发的关键推手,该数据集是训练 Vicuna、Alpaca 等著名开源对话模型的核心“秘籍”。它真实还原了人类与顶尖闭源模型之间的交互过程,为开源社区提供了极具价值的指令跟随与多轮对话学习样本。
## 数据规模与标注信息
本数据集(Vicuna_unfiltered 版本)包含约 9 万条完整的真实对话记录。
- **数据结构**:采用 JSON 格式存储,每条数据包含一个多轮对话数组,明确区分了 human(用户)和 gpt(模型)的发言内容。
- **内容特征**:数据未经深度过滤(Unfiltered),保留了极其复杂的交互逻辑、长上下文追问技巧以及多样化的写作与推理场景。
- **数据规模**:涵盖数十万轮次的对话交互,总 Token 数量庞大,足以支撑中大型语言模型的深度微调。
## 典型应用场景
- **指令微调 (SFT)**:作为监督微调的核心语料,显著提升基础大模型的指令理解与遵循能力。
- **RLHF 训练**:为基于人类反馈的强化学习提供丰富的对话轨迹,辅助训练奖励模型(Reward Model)。
- **复杂写作与多轮对话**:由于包含大量复杂的追问和上下文依赖,非常适合用于提升模型在长文本写作、逻辑推理及多轮对话场景下的连贯性与准确性。
## 使用注意事项
- **数据清洗与过滤**:由于本版本为未过滤(unfiltered)版本,数据中可能夹杂敏感、有害、重复或低质量的对话内容。在投入训练前,强烈建议使用启发式规则或分类器进行严格的数据清洗。
- **隐私与合规**:尽管分享过程经过了匿名化处理,但在用于商业项目或公开发布衍生模型时,仍需进行额外的隐私审查,确保不包含个人身份信息。
- **格式适配**:原始数据格式可能需要根据所使用的微调框架(如 LLaMA-Factory 等)进行字段映射和格式转换。