资源描述
AI2 Reasoning Challenge v2(ARC-2)是由艾伦人工智能研究所(AI2)发布的权威科学推理评测数据集,涵盖物理、生物、化学等学科的3,500+多跳问答题,每题均配备专家撰写的思维链(Chain-of-Thought)标注及经验证的反事实干扰项。适用于大语言模型推理能力评估、思维链微调、鲁棒性分析与教育AI研究,是提升模型科学素养与因果推理能力的关键基准资源。
详细内容
# AI2 Reasoning Challenge v2 (ARC-2)
## 数据集背景与来源
ARC-2 是艾伦人工智能研究所(Allen Institute for AI, AI2)在 ARC(AI2 Reasoning Challenge)初版基础上推出的升级版本,旨在更严格地评测模型在真实世界科学语境下的多步逻辑推理能力。其题目源自美国K–12科学标准化考试(如NAEP、NY Regents)、教科书习题及专家原创命题,经教育学家与领域科学家协同审核,确保学科准确性与认知难度梯度。
## 数据规模与标注信息
- **样本总量**:3,546道高质量科学问答题(含训练集、验证集与测试集划分)
- **学科分布**:约42%物理、33%生物、25%化学,覆盖初中至高中核心概念
- **标注特色**:
- 每题提供**专家级思维链(CoT)标注**:明确展示从问题→前提→推理步骤→答案的完整逻辑路径;
- 每题含**3个反事实干扰项(Counterfactual Distractors)**:语义合理但因果错误的选项,用于检验模型对科学原理的本质理解而非模式匹配;
- 所有答案均经双重人工校验,并附知识点标签(如"Newton's Laws", "Cellular Respiration")。
## 典型应用场景
- 大语言模型(LLM)的**推理能力基准评测**(尤其对比标准QA准确率与CoT生成质量);
- **思维链微调(CoT Fine-tuning)** 与**自洽性(Self-Consistency)** 方法开发;
- 科学领域**反事实鲁棒性分析**与**错误归因诊断**;
- 教育AI中**个性化辅导路径建模**与**错因分类系统**构建。
## 使用注意事项
- 数据集未包含原始考试试卷图像或版权文本,所有题目已脱敏并重写,符合AI2公开许可(CC BY-NC-SA 4.0);
- 推荐配合`arc_challenge`子集(高难度题)与`arc_easy`子集进行分层评估;
- 思维链标注为自然语言形式,不依赖特定格式,但建议统一解析为结构化步骤(如`Step 1: ... → Step N: ... → Answer:`)以支持自动化评估;
- 反事实干扰项设计强调‘表面合理但机制错误’,使用时需避免将其误标为正确知识源。