返回资源中心

Hugging Face Open-Web-Math

数据集
机器学习
3 次浏览
0 个赞
DatasetMathLLM

资源描述

Open-Web-Math 是一个专注于数学推理与解题的大规模高质量文本数据集。该数据集从 Common Crawl 中深度挖掘并过滤,包含海量含 LaTeX 公式与严密推导过程的网页内容。专为大语言模型(LLM)的预训练与指令微调设计,能显著提升模型的数学计算、逻辑推理及思维链(CoT)能力。适用于数学教育 AI、科研辅助工具及通用大模型能力增强,提供开箱即用的高质量语料支持。

详细内容

### 数据集背景与来源 Open-Web-Math 由开源社区与 Hugging Face 联合维护,旨在解决通用大语言模型在数学推理领域高质量训练数据稀缺的问题。数据集主要基于 Common Crawl 网页快照进行深度挖掘,通过定制化的启发式过滤器与文本分类模型,精准提取包含数学公式、定理证明、解题步骤及学术讨论的网页文本。原始内容经过严格的去重、噪声清洗与格式规范化,最大程度保留了完整的数学语境与逻辑推导链条。 ### 数据规模与标注信息 - **数据规模**:包含数百万篇精选数学网页文档,总文本量达百亿级 Token,覆盖初等数学、高等数学、统计学、离散数学及计算机科学等多个学科领域。 - **标注与处理**:属于自监督预训练语料,未进行大规模人工逐条标注。数据经过自动化流水线处理,包括 HTML 标签剥离、LaTeX 公式标准化、语言检测、近似重复剔除(MinHash/SimHash)及低质量内容过滤。部分样本保留了原始的段落结构,便于模型学习上下文逻辑关系。 ### 典型应用场景 - **LLM 持续预训练(Continued Pre-training)**:作为领域增量语料注入通用基座模型,大幅提升模型对数学符号的理解与复杂计算能力。 - **指令微调与思维链(CoT)训练**:利用数据集中天然的解题步骤与推导过程,训练模型生成结构化、可解释的推理路径。 - **数学与理科教育 AI**:构建智能解题助手、自动批改系统或互动式数学辅导工具。 - **基准测试与能力评估**:作为高质量验证集或对抗测试语料,辅助评估模型在 GSM8K、MATH 等数学评测榜单上的泛化表现。 ### 使用注意事项 - **许可协议**:使用前请务必查阅 Hugging Face 数据集卡片页面的最新 License 说明,严格遵守开源协议与商业使用限制。 - **格式兼容**:数据集中包含大量 LaTeX 语法与特殊数学符号,加载与分词时建议使用支持数学符号的 Tokenizer,避免公式截断或解析异常。 - **二次清洗建议**:尽管已进行高质量过滤,但网页来源数据仍可能包含少量非标准表述。针对特定垂直场景,建议结合业务需求进行规则校验或关键词过滤。 - **加载优化**:全量数据体积较大,推荐使用 Hugging Face `datasets` 库的流式加载(Streaming)模式或分片处理策略,以优化内存与 IO 占用。