资源描述
OpenSora-v2 Video Generation Benchmark 是首个面向开源视频生成模型的综合性评测基准,包含10,000组高质量prompt-video对,覆盖物理合理性、时序连贯性与主体一致性三大核心维度,并提供人工标注+自动化指标(如FVD、CLIP-Score、Motion Score)双轨评估方案,适用于视频生成模型研发、对比实验与学术评测。
详细内容
## OpenSora-v2 Video Generation Benchmark 数据集详细介绍
### 背景与来源
OpenSora-v2 Video Generation Benchmark 由 HPCTech 团队联合开源社区构建,作为 Open-Sora 项目的重要评估组件,旨在解决当前视频生成领域缺乏统一、可复现、多维可解释评测标准的问题。该基准基于真实世界语义分布采样,prompt 来源于多样化场景(含日常动作、复杂事件、抽象概念等),对应视频经专业筛选与后处理,确保分辨率(480p/720p)、帧率(24fps)及格式(MP4/H.264)一致性,数据全部开源并持续迭代。
### 数据规模与标注信息
- **总量**:10,000 组 prompt-video 对(prompt 为中文为主,含少量英文关键词;video 时长统一为2秒/48帧)
- **标注维度**:
- **物理合理性**(Physics Plausibility):人工三元组标注(合理/可疑/违反)+ 物理规则校验脚本辅助评分
- **时序连贯性**(Temporal Coherence):逐帧光流一致性分析 + 专家级时序逻辑打分(1–5分)
- **主体一致性**(Subject Consistency):跨帧主体ID追踪(YOLOv8 + ByteTrack)+ 外观稳定性人工复核
- **配套指标**:提供开箱即用的评估 pipeline,支持 FVD、CLIP-Score(ViT-L/14@336px)、Motion Score(基于RAFT光流熵)、Text-Video Alignment Score(T2V-Sim)等自动化指标计算。
### 典型应用场景
- 视频生成模型(如 Sora-style diffusion、autoregressive video LLMs)的零样本/微调后性能横向对比
- 评测模块有效性验证(例如运动建模模块、时空注意力机制改进效果)
- 学术论文中 benchmark 实验的标准数据支撑(已用于多项 CVPR/ICML/NeurIPS 投稿)
- 教学与课程设计中的生成式AI评估实践案例
### 使用注意事项
- 视频文件需通过 Git LFS 下载,建议使用 `git clone --depth=1` 避免完整历史拉取
- Prompt 文本含部分英文关键词(如 `dolly zoom`, `slow motion`, `isometric view`),建议保留原始 casing 以保障评估一致性
- 自动化指标计算依赖 PyTorch 2.0+、TorchVision、decord 及 CLIP 模型权重,详见 [GitHub benchmark README](https://github.com/hpcaitech/Open-Sora/tree/main/benchmark)
- 人工标注子集(2,000 samples)提供 JSONL 格式标注文件,含 annotator ID、置信度与细粒度错误类型标签(e.g., `object-disappearing`, `motion-jerk`)