资源描述
ImageNet-21K 是计算机视觉领域权威的大规模图像数据集,涵盖约21,841个WordNet同义词集(synsets),含超1400万张带层次化标签的高质量图像。广泛用于视觉模型预训练、迁移学习、零样本识别与表征学习等任务,是ViT、MAE、BEiT等前沿视觉架构的重要基准数据源。
详细内容
## ImageNet-21K 数据集详细介绍
### 数据集背景与来源
ImageNet-21K(又称 ImageNet-22k 或 ILSVRC-21K)由 Princeton 和 Stanford 等机构联合构建,基于 WordNet 层次结构组织,覆盖更广语义范畴的自然图像。它并非 ILSVRC-2012(即常称的 ImageNet-1K)的简单扩展,而是完整保留了原始 ImageNet 项目中全部可用的、经人工校验的 synset(同义词集),构成迄今最全面的开放视觉预训练数据源之一。
### 数据规模与标注信息
- **类别数量**:21,841 个 WordNet synsets(对应约21K类别),远超 ImageNet-1K 的1,000类;
- **图像总量**:约14,197,122张图像(截至公开发布版本),每类平均约650张,分布不均但整体具备良好语义覆盖;
- **标注形式**:每张图像关联唯一 synset ID(如 `n01440764`),支持 WordNet 上下位关系(hypernym/hyponym)推导,部分子集提供边界框(非全量);
- **图像质量**:经多轮人工审核与自动去重(如基于感知哈希),排除明显低质、重复或无关图像。
### 典型应用场景
- **视觉模型预训练**:作为 ViT、Swin Transformer、MAE、DINOv2 等自监督/监督预训练的标准语料;
- **迁移学习与微调**:在下游细粒度分类、跨域识别等任务中提供强表征先验;
- **零样本/少样本学习评估**:利用 WordNet 层级结构支持语义泛化能力分析;
- **模型鲁棒性与偏差研究**:因类别广、长尾显著,适用于公平性、偏见与分布外泛化分析。
### 使用注意事项
- **许可与合规**:数据集本身为学术研究免费使用,但部分图像受原始版权约束,**禁止商用或再分发原始图像**;仅可分发处理后特征或模型权重;
- **获取方式**:官方入口为 [https://www.image-net.org](https://www.image-net.org),需注册账号并签署研究用途协议后下载(通常提供 `.tar` 压缩包及 `words.txt`/`imagenet.synset.obtain.txt` 映射文件);
- **技术适配建议**:建议配合 `torchvision.datasets.ImageFolder` 或 `tf.data.Dataset` 加载;注意类别ID映射需严格依据提供的 `synset_to_words.txt` 文件,避免与 ImageNet-1K 混淆;
- **存储与计算**:全量解压后占用约1.2TB磁盘空间,推荐使用分布式训练框架(如 PyTorch DDP)并启用内存映射(memory-mapped)加载以优化IO效率。