返回资源中心

Common Crawl

数据集
数据分析
1 次浏览
0 个赞
大数据训练集LLM

资源描述

Common Crawl 是全球最权威的开放网络爬虫数据集,每月采集数十亿网页的原始 HTML、WARC、WET 和 WAT 格式数据,覆盖多语言、多领域网页内容。广泛用于训练大规模语言模型(LLM)、构建搜索引擎索引、开展网络行为分析与信息检索研究,是学术界与工业界公认的核心基础语料库。

详细内容

## Common Crawl 数据集详细介绍 ### 数据集背景与来源 Common Crawl 是一个非营利性组织运营的开源项目,自 2008 年起持续对公开互联网进行大规模、去重、合规的网页抓取。其爬虫遵循 robots.txt 协议,尊重网站访问限制,并以完全开放许可(CC0 1.0 Universal)发布全部数据,确保科研与商业用途的合法合规性。 ### 数据规模与标注信息 - **规模**:截至 2024 年,累计存档超 300 TB 原始数据,包含逾 1500 亿个网页快照(按月发布,每期含约 3–5 亿页面); - **格式**:提供 WARC(原始抓取归档)、WET(提取的纯文本)、WAT(元数据摘要)、JSONL(结构化索引)等多种标准格式; - **标注信息**:无人工标注标签,但 WAT 文件包含 URL、MIME 类型、语言识别(via langdetect)、链接图谱、SSL/TLS 信息等丰富元数据;WET 文件已清洗 HTML 标签并保留段落结构,支持直接用于预训练。 ### 典型应用场景 - 大规模语言模型(LLM)预训练语料,如 BLOOM、LLaMA 系列、OpenAssistant 等均使用其子集; - 构建跨语言语料库、评估模型知识覆盖度与时效性; - 网络演化分析、域名权威性建模、虚假信息传播路径追踪; - 作为基准数据集用于网页去重(SimHash/MinHash)、文本质量过滤(如 CCNet 流程)、语言识别与分类任务。 ### 使用注意事项 - 数据未经人工审核,含噪声(如乱码、广告脚本、低质内容),需结合 `cld3` / `fasttext` 语言过滤、`trafilatura` 或 `news-please` 进行文本提取与清洗; - 部分页面可能因反爬机制或动态渲染缺失关键内容,建议优先使用 WET(已提取文本)而非原始 WARC; - 注意遵守 [Common Crawl Acceptable Use Policy](https://commoncrawl.org/acceptable-use-policy/),禁止高频并发请求,推荐通过 AWS Public Datasets(S3://commoncrawl/)或官方 Index Server(https://index.commoncrawl.org/)获取索引与数据; - 对于中文场景,建议配合 `langid.py` 或 `fasttext` 模型筛选高置信度中文样本,并注意繁简混杂、编码异常等问题。