返回资源中心

LAION-5B

数据集
AI绘画
1 次浏览
0 个赞
文生图多模态扩散模型

资源描述

LAION-5B 是目前全球最大的开源多模态图文对数据集,包含高达 58.5 亿个图像-文本对。作为 Stable Diffusion 等主流文生图大模型的核心训练基石,它经过 CLIP 模型严格过滤,确保了图文匹配的高质量。本数据集广泛适用于多模态学习、扩散模型训练、图像生成及跨模态检索等 AI 前沿研究场景,是计算机视觉与自然语言处理领域不可或缺的宝贵数据资源。

详细内容

# LAION-5B 数据集详细介绍 ## 数据集背景与来源 LAION-5B 由非营利组织 Large-scale Artificial Intelligence Open Network (LAION) 发布,是其前代数据集 LAION-400M 的超大规模扩展。数据主要抓取自 CommonCrawl 的公开网页,旨在为开源社区提供可媲美甚至超越商业闭源数据集的训练语料,打破大模型训练的数据壁垒。 ## 数据规模与标注信息 - **数据规模**:总计包含 58.5 亿(58.5 Billion)个图文对。划分为三个子集:23.2 亿通用英语(en)、22.6 亿通用多语言(multi)和 8.7 亿未知语言(nolang)。 - **标注与元数据**:数据集本身不直接存储图像文件,而是提供结构化的元数据(Parquet 格式)。包含图像 URL、对应的文本描述(Caption)、图像原始宽高、宽高比,以及通过 CLIP 模型(ViT-L/14 和 ViT-B/32)计算的图文相似度分数。 ## 典型应用场景 1. **文生图模型训练**:作为 Stable Diffusion 等扩散模型(Diffusion Models)的核心预训练数据,赋予模型“理解”语言并生成图像的能力。 2. **多模态对比学习**:用于训练和评估 CLIP、ALIGN 等视觉-语言对齐模型,提升跨模态特征表示能力。 3. **跨模态检索**:构建高性能的以文搜图、以图搜文系统。 4. **图像编辑与生成**:为 InstructPix2Pix 等图像编辑模型提供指令微调数据,或用于训练图像美学评分模型。 ## 使用注意事项 1. **数据获取与存储**:由于仅提供 URL 和文本,用户需自行编写分布式爬虫下载图像,需准备 PB 级别的存储空间和高效的下载与清洗管道(如 img2dataset)。 2. **数据质量与过滤**:网页抓取数据包含大量噪声、NSFW(不适宜工作场所)内容及重复项。建议根据任务需求,利用 CLIP 相似度分数、图像美学评分(Aesthetic Score)及 NSFW 过滤器进行二次清洗。 3. **版权与合规**:数据源自公开网络,版权归原创作者所有。用于商业项目时需严格遵守相关法律法规。LAION 提供了 Opt-out 机制供版权方移除数据,使用时需关注合规风险。 4. **算力要求**:在此规模数据上训练大模型需要庞大的 GPU 集群支持。中小团队建议优先使用官方提供的预训练权重,或选用较小规模的子集(如 LAION-Aesthetics)进行微调。