资源描述
RedPajama-Data-1T 是一个包含超过 1.2 万亿 token 的超大规模开源数据集,旨在完全复现 LLaMA 模型的训练数据分布。该数据集涵盖网页、书籍、代码、维基百科等高质量语料,为训练开源大语言模型(LLM)提供了坚实的数据基座。适用于 NLP 研究、大模型预训练及领域模型定制,是推动开源 AI 发展的核心资源。
详细内容
### 数据集背景与来源
RedPajama-Data-1T 由 Together Computer 联合多家研究机构发起,核心目标是完全复现 Meta LLaMA 模型的训练数据分布,以打破闭源数据壁垒,推动开源大模型生态的繁荣。其数据广泛来源于 CommonCrawl、C4、GitHub、Wikipedia、Books、ArXiv 以及 StackExchange 等公开渠道,并经过了严格的清洗与去重处理。
### 数据规模与标注信息
- **数据规模**:总语料量超过 1.2 万亿(1.2T)Tokens,各子集的数据比例经过精心设计,以高度匹配 LLaMA 的原始训练分布。
- **标注信息**:作为预训练语料库,本数据集不包含传统的人工指令微调标注。其核心价值在于经过启发式过滤、质量评分和去重后的高质量无监督原始文本。
### 典型应用场景
1. **大模型预训练**:作为从头训练(Pre-training)开源大语言模型(LLM)的核心基座数据。
2. **继续预训练**:用于现有基础模型的增量预训练,以注入新知识或适应特定语言环境。
3. **NLP 学术研究**:为语言建模、语料库分析、数据质量评估等自然语言处理研究提供标准化的大规模基准数据集。
### 使用注意事项
1. **硬件与存储要求**:数据集原始体积高达数 TB,下载、解压和处理需要充足的磁盘空间及高带宽网络支持。
2. **数据清洗与过滤**:尽管官方已进行基础清洗,但网页等子集仍可能包含少量噪声、偏见或有害内容,建议在实际训练前结合业务需求进行二次安全过滤。
3. **版权与合规性**:使用时需严格遵守各原始数据源(如 GitHub、Wikipedia 等)的开源许可协议,特别是在商业化应用场景中,需仔细评估版权合规风险。