资源描述
Kinetics-700 是由 DeepMind 发布的大规模人类动作识别数据集,包含超过 65 万个 YouTube 视频片段,涵盖 700 类日常动作。作为视频理解领域的基准数据集,它广泛应用于时空特征提取、动作分类及行为分析等计算机视觉任务。适用于深度学习模型训练与评测,是构建高性能视频理解系统的核心资源。
详细内容
# Kinetics-700 数据集详细介绍
## 数据集背景与来源
Kinetics-700 是由 Google DeepMind 推出的大规模人类动作识别数据集,是 Kinetics 系列(包括 Kinetics-400、Kinetics-600)的进一步扩展版本。该数据集旨在推动视频理解领域的发展,为训练和评估深度学习模型在复杂、真实世界场景下的动作识别能力提供标准化的基准。
## 数据规模与标注信息
- **数据规模**:包含超过 65 万个从 YouTube 提取的视频片段(clips)。
- **类别分布**:涵盖 700 类广泛的人类动作,包括乐器演奏、体育运动、日常互动、工作活动等。每个动作类别包含 400 到 1000 个不等的视频片段。
- **视频规格**:每个视频片段长度约为 10 秒,且确保在片段内目标动作正在发生。
- **标注信息**:提供详细的 CSV 文件,包含 YouTube 视频 ID、起始时间、结束时间、动作标签以及数据划分(训练集、验证集、测试集)。
## 典型应用场景
- **动作识别与分类**:训练 3D CNN(如 I3D、SlowFast)或 Video Transformer(如 VideoMAE)等模型进行视频片段级别的类别预测。
- **时空特征提取**:作为大规模预训练数据集,提取通用的视频时空特征,用于下游的小样本视频分类、动作定位或检测任务。
- **行为分析与理解**:研究复杂场景下的人体姿态、物体交互及行为意图识别。
## 使用注意事项
- **数据获取**:官方仅提供 YouTube 视频 ID 和时间戳,用户需自行编写脚本(如使用 `yt-dlp`)下载并裁剪视频。部分老旧视频可能因版权或作者删除而失效,需做好缺失数据的处理。
- **数据清洗**:由于数据源自众包标注和 YouTube,可能存在少量标注噪声,建议在训练前进行必要的数据清洗和质量控制。
- **评估规范**:在报告模型性能时,应明确区分验证集和测试集的结果。测试集标签通常不公开,需通过官方服务器提交预测结果进行评测。
- **合规使用**:数据集主要供学术研究使用,使用时需遵守 YouTube 的服务条款及 DeepMind 的相关开源协议。