返回资源中心

RedPajama-V2 Dataset

数据集
数据分析
2 次浏览
0 个赞
数据集LLM训练开源

资源描述

RedPajama-V2 是由 Together AI 开源的大规模预训练数据集,包含超过 30 万亿 Token 的高质量网页语料。该数据集基于 Common Crawl 构建,经过严格的去重与质量过滤,并提供多维度的质量评分标签,支持开发者按需筛选。适用于大语言模型(LLM)从零预训练、增量训练及多语言模型优化,为 AI 研究与企业级模型开发提供透明、可复现的数据基础。

详细内容

## 数据集背景与来源 RedPajama-V2 由 Together AI 团队发起并开源,旨在解决大语言模型(LLM)预训练阶段高质量语料稀缺与数据黑盒问题。该数据集主要抓取自 Common Crawl 公开网页存档,通过自研的清洗流水线进行深度处理。相较于初代版本,V2 进一步优化了数据分布,增强了多语言覆盖,并全面公开了数据处理逻辑与质量评估指标,确保语料来源透明、可追溯。 ## 数据规模与标注信息 - **数据规模**:原始语料经分词后总量突破 **30 万亿 Token**,是目前开源社区规模最大的预训练数据集之一。 - **标注与元数据**:作为预训练语料,RedPajama-V2 不提供人工指令微调(SFT)标注,但为每条数据附带了丰富的**质量信号元数据**(Quality Signals)。包括语言识别、重复度检测、内容质量评分等。开发者可基于这些元数据灵活构建自定义过滤策略,精准提取目标领域或高质量语料。 ## 典型应用场景 - **LLM 从零预训练**:为开源社区及企业提供可直接用于训练 7B 至 70B+ 参数规模基座模型的完整语料库。 - **模型增量预训练(Continued Pretraining)**:支持针对特定语言或垂直领域进行数据抽样,实现模型知识更新与能力迁移。 - **数据工程与过滤算法研究**:丰富的质量标签使其成为研究数据配比、清洗策略及语料质量对模型性能影响的理想基准。 - **多语言大模型开发**:广泛的语言覆盖助力构建具备跨语言理解与生成能力的全球化 AI 模型。 ## 使用注意事项 - **存储与计算开销**:完整数据集体积庞大(通常达数十 TB),建议根据实际需求按语言、质量分位或域名进行子集采样,以优化存储与训练成本。 - **自定义过滤必要**:尽管官方已进行基础清洗,但网页语料仍可能包含噪声、偏见或敏感内容。强烈建议结合项目需求,利用提供的质量信号元数据实施二次过滤与安全对齐。 - **许可协议与合规**:本数据集遵循宽松的开源协议,支持商业使用,但在实际部署前请务必核对仓库最新 LICENSE 文件,并遵守目标地区的数据隐私与版权法规。 - **分词器适配**:实际训练 Token 数量会因所选 Tokenizer 的不同而产生差异,建议在训练前进行小规模抽样统计以校准计算预算。