返回资源中心

CodeContests Benchmark v2

数据集
编程辅助
1 次浏览
0 个赞
codingcontestevaluationbenchmark

资源描述

CodeContests Benchmark v2 是由 Google Research 发布的权威编程竞赛评测数据集,涵盖 5,000+ 道来自 Codeforces 和 AtCoder 的真实竞赛题目,每题均附带官方/社区验证的参考解、多组输入输出测试用例及难度分级(如 Div2A–Div1F)。专为大语言模型代码生成能力评估设计,支持功能正确性、鲁棒性与泛化性量化分析,广泛用于 code LLM benchmarking、程序合成研究与竞赛型代码推理评测。

详细内容

# CodeContests Benchmark v2 数据集详解 ## 数据集背景与来源 CodeContests Benchmark v2 是 Google Research 团队构建的开源编程竞赛评测基准,旨在为代码生成模型提供高信度、高挑战性的评估环境。数据源自主流在线编程竞赛平台——Codeforces(占比约 70%)和 AtCoder(占比约 30%),所有题目均经人工筛选与去重,确保代表性与多样性;题目覆盖算法、数据结构、数学、图论、动态规划等核心竞赛主题,并严格保留原始题面、约束条件与评分规则。 ## 数据规模与标注信息 - **题目总量**:5,028 道独立题目(v2 版本较初版显著扩充并修正错误) - **标注内容**: - 每题包含完整英文题面(problem statement)、输入/输出格式说明; - 至少 1 个高质量参考解(C++/Python 主流语言,经平台 AC 验证); - 平均每题含 5–12 组手工构造 + 系统生成的测试用例(含边界、corner case 及性能压力样例); - 标准化难度标签(基于 Codeforces/AtCoder 原始评级映射至统一难度等级:`Easy`/`Medium`/`Hard`,并保留原始 `rating` 数值,如 `1600`, `2400`); - 部分题目额外提供“solution sketch”(解题思路简述)与“tags”(如 `greedy`, `dp`, `graphs`)便于细粒度分析。 ## 典型应用场景 - **代码生成模型评测**:作为零样本/微调后模型在复杂逻辑、多步推理、边界处理等维度的黄金标准 benchmark; - **程序合成研究**:支撑 test-driven generation、execution-guided decoding 等方法的训练与验证; - **教育与竞赛辅助**:支持自动题目推荐、难度自适应练习系统开发; - **可解释性分析**:结合测试用例失败模式,定位模型在特定算法范式上的能力短板。 ## 使用注意事项 - 所有代码解与测试用例仅用于**非商用学术研究**,引用时须遵循 [LICENSE](https://github.com/google-research/codecontests/blob/main/LICENSE)(Apache 2.0); - 部分题目存在多解或平台判定差异,建议以 `official_solution.py` 或 `accepted_submissions` 目录中的 AC 提交为参考基准; - 运行测试需依赖 Python ≥3.8 及 `pytest`,部分题目含非标准 I/O(如交互式问题),请查阅 `README.md` 中的 `execution_protocol` 说明; - v2 版本已移除重复题与失效链接,但建议定期同步 GitHub 最新 commit 以获取勘误与增强数据。