返回资源中心

FineWeb-Edu Dataset

数据集
机器学习
4 次浏览
0 个赞
DatasetLLMEdu

资源描述

FineWeb-Edu 是 Hugging Face 发布的高质量教育领域开源数据集,基于 FineWeb 的严格筛选与教育相关性增强,涵盖 1.3 万亿 tokens 的网页文本,经去重、安全过滤与教育主题加权处理,专为训练具备强推理与知识整合能力的 LLM 设计,适用于模型预训练、课程辅助生成、教育问答系统等场景。

详细内容

## FineWeb-Edu 数据集详细介绍 ### 数据集背景与来源 FineWeb-Edu 是 Hugging Face 在 FineWeb(一个大规模、多语言、去重后的网络爬取语料库)基础上,通过教育领域关键词匹配、内容质量评分(如 readability、coherence、educational relevance)、权威域名白名单(如 .edu、MOOC 平台、开放教材网站)及人工验证流程构建的垂直子集。其目标是提供比通用语料更具知识密度、逻辑结构更清晰、事实准确性更高的教育向预训练数据,弥补现有开源数据集中教育内容覆盖不均、噪声偏高的问题。 ### 数据规模与标注信息 - **总规模**:约 1.3 万亿 tokens(基于 tokenized 后的 Llama tokenizer v2 计算); - **数据格式**:纯文本(`.parquet` 分片),每条样本含 `text` 字段及元数据字段(`url`, `timestamp`, `language`, `domain`, `edu_score`(0–1 教育相关性得分)); - **语言分布**:以英语为主(>92%),含少量高质量多语种教育内容(如西班牙语、法语、中文教育类网页经可信源筛选); - **清洗策略**:已执行重复行去重、低熵/模板化文本过滤、PII(个人身份信息)模糊化、NSFW 内容移除,并对数学公式、代码块、表格结构保留原始格式(利于后续结构化理解训练)。 ### 典型应用场景 - **LLM 预训练/继续预训练(Continued Pretraining)**:提升模型在科学解释、多步推理、跨学科知识整合等教育核心任务上的基础能力; - **教育专用模型微调**:如智能辅导系统(ITS)、自动习题生成、课程大纲推荐、学生作答评估; - **数据蒸馏与课程压缩研究**:利用高 edu_score 样本构建小规模高质量种子集,加速模型收敛; - **教育公平性分析**:结合 `domain` 和 `language` 元数据,开展教育资源覆盖度与语言偏见审计。 ### 使用注意事项 - 该数据集**不含用户生成内容(UGC)或社交平台数据**,不适用于训练对话风格模型,建议搭配对话数据集(如 UltraChat、OpenAssistant)进行 SFT; - `edu_score` 为启发式打分,非人工逐条标注,使用时建议结合下游任务做阈值截断(推荐 ≥0.7); - 链接中 Hugging Face 数据集页面提供 streaming 加载、分片下载及 Apache Arrow 优化读取支持,推荐使用 `datasets.load_dataset('HuggingFaceFW/fineweb-edu', split='train', streaming=True)` 实现内存友好训练; - 遵循 [FineWeb-Edu License](https://huggingface.co/datasets/HuggingFaceFW/fineweb-edu/blob/main/LICENSE) —— CC BY-NC-SA 4.0,**禁止商用**,学术与非营利用途需署名并采用相同方式共享。