资源描述
OpenWebText3 Enhanced Corpus 是面向大语言模型预训练的高质量开源网络文本语料库,覆盖2023–2024年技术博客、学术摘要与开源文档,经严格去重、质量过滤与毒性检测,并附结构化元数据(领域/难度/时效性)。适用于LLM预训练、领域适配、数据质量研究及安全对齐评估。
详细内容
# OpenWebText3 Enhanced Corpus
## 数据集背景与来源
OpenWebText3 是 OpenWebText 系列的第三代演进版本,旨在提供更及时、更可控、更具语义结构的开源网络文本资源。数据源自公开可抓取的高质量中文与英文技术社区(如Dev.to、arXiv摘要页、GitHub Wiki、知名开源项目文档站等),时间范围聚焦于2023–2024年,规避过时或低信噪比内容。所有文本均通过合规爬取协议获取,并遵循CC-BY、MIT、Apache-2.0等允许再分发的许可声明。
## 数据规模与标注信息
- 总文本量:约12.8 TB原始网页(去重前),经多阶段清洗后保留约1.7 TB高质量纯文本(UTF-8编码);
- 文档数量:约2.4亿篇独立文档,平均长度1,850 tokens(基于`gpt2` tokenizer);
- 元数据字段:每条样本包含`domain`(如`ai`, `bio`, `sysadmin`)、`difficulty_level`(1–5级,基于Flesch–Kincaid与代码密度联合评估)、`freshness_score`(基于发布日期与页面更新时间加权计算)、`toxicity_prob`(经多个轻量级分类器集成预测,阈值<0.02保留);
- 标注方式:全自动流水线处理(无人工标注),但含可复现的质量评估报告(见Hugging Face数据集card中的`eval_report.json`)。
## 典型应用场景
- 大语言模型(LLM)增量预训练与领域适应(Domain Adaptation);
- 预训练数据质量基准构建(如Perplexity、Toxicity、Factuality评测);
- 时效性敏感任务的数据增强(如技术问答、API文档生成);
- 安全对齐研究中“良性分布偏移”(benign distribution shift)的控制变量实验。
## 使用注意事项
- **许可证兼容性**:虽数据集本身以`CC-BY-4.0`发布,但原始网页内容版权归属原作者,请在下游商用场景中自行核查源内容许可;
- **语言混合性**:约87%为英文,13%为高质量中文技术文本(经`langdetect`+规则校验),不建议直接用于纯中文LLM预训练,需搭配中文专用语料;
- **时效性局限**:截止时间为2024年6月,不包含实时动态内容(如论坛即时回复、未归档博客草稿);
- **结构化元数据使用建议**:推荐结合`datasets.filter()`按`domain`或`freshness_score`进行子集采样,避免全局随机采样导致领域偏差。