返回资源中心

OpenSora-v2 Video Generation Benchmark

数据集
AI视频
1 次浏览
0 个赞
videobenchmarkevaluationllm

资源描述

OpenSora-v2 Video Generation Benchmark 是首个面向开源视频生成模型的综合性评测基准,包含10,000组高质量prompt-video对,覆盖物理合理性、时序连贯性与主体一致性三大核心维度,并提供人工标注+自动化指标(如FVD、CLIP-Score、Motion Score)双轨评估方案,适用于视频生成模型研发、对比实验与学术评测。

详细内容

## OpenSora-v2 Video Generation Benchmark 数据集详细介绍 ### 背景与来源 OpenSora-v2 Video Generation Benchmark 由 HPCTech 团队联合开源社区构建,作为 Open-Sora 项目的重要评估组件,旨在解决当前视频生成领域缺乏统一、可复现、多维可解释评测标准的问题。该基准基于真实世界语义分布采样,prompt 来源于多样化场景(含日常动作、复杂事件、抽象概念等),对应视频经专业筛选与后处理,确保分辨率(480p/720p)、帧率(24fps)及格式(MP4/H.264)一致性,数据全部开源并持续迭代。 ### 数据规模与标注信息 - **总量**:10,000 组 prompt-video 对(prompt 为中文为主,含少量英文关键词;video 时长统一为2秒/48帧) - **标注维度**: - **物理合理性**(Physics Plausibility):人工三元组标注(合理/可疑/违反)+ 物理规则校验脚本辅助评分 - **时序连贯性**(Temporal Coherence):逐帧光流一致性分析 + 专家级时序逻辑打分(1–5分) - **主体一致性**(Subject Consistency):跨帧主体ID追踪(YOLOv8 + ByteTrack)+ 外观稳定性人工复核 - **配套指标**:提供开箱即用的评估 pipeline,支持 FVD、CLIP-Score(ViT-L/14@336px)、Motion Score(基于RAFT光流熵)、Text-Video Alignment Score(T2V-Sim)等自动化指标计算。 ### 典型应用场景 - 视频生成模型(如 Sora-style diffusion、autoregressive video LLMs)的零样本/微调后性能横向对比 - 评测模块有效性验证(例如运动建模模块、时空注意力机制改进效果) - 学术论文中 benchmark 实验的标准数据支撑(已用于多项 CVPR/ICML/NeurIPS 投稿) - 教学与课程设计中的生成式AI评估实践案例 ### 使用注意事项 - 视频文件需通过 Git LFS 下载,建议使用 `git clone --depth=1` 避免完整历史拉取 - Prompt 文本含部分英文关键词(如 `dolly zoom`, `slow motion`, `isometric view`),建议保留原始 casing 以保障评估一致性 - 自动化指标计算依赖 PyTorch 2.0+、TorchVision、decord 及 CLIP 模型权重,详见 [GitHub benchmark README](https://github.com/hpcaitech/Open-Sora/tree/main/benchmark) - 人工标注子集(2,000 samples)提供 JSONL 格式标注文件,含 annotator ID、置信度与细粒度错误类型标签(e.g., `object-disappearing`, `motion-jerk`)