数据评测安全

ARC-AGI-2:检验新任务抽象推理能力的开放基准

ARC-AGI-2 以少量示例和网格变换任务评估系统对陌生规则的归纳与迁移能力,适合作为推理评测组成部分,而非通用智能单一结论。

ARC-AGI-2 model-evaluation llm-benchmark reasoning ARC-AGI-2 以少量示例和网格变换任务评估系统对陌生规则的归纳与迁移能力,适合作为推理评测组成部分,而非通用智能单一结论。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
数据评测安全
产品状态
已上线
开放状态
开源
信息截至
2026-08-07

1. 基准定位

ARC-AGI-2 是 ARC Prize 推出的开放抽象推理基准,以彩色网格的输入输出示例要求系统发现规则并完成新实例。[S1][S2] 它重点检验面对陌生任务时的归纳和迁移,不等同于知识问答、编程能力或完整通用智能。

2. 任务结构

每个任务提供少量训练示例和待求解测试网格,答案必须精确匹配目标输出。系统需要识别对象、关系、空间变化和组合规则,而不是从固定标签中选择;微小尺寸或颜色错误也会导致整题失败。[S1]

3. 适用场景

适合比较模型、搜索算法、程序合成和混合系统在低样本推理上的进展,也可用于研究测试时计算如何转化为正确率。它不适合单独决定企业模型采购,因为真实业务还涉及语言、工具、成本、安全和稳定性。

4. 数据使用

团队应严格区分公开训练、公开评估和未公开测试任务,记录使用过的任务集合及调参次数。若把评估题用于提示设计、人工规则库或训练,再把同一集合成绩当作泛化能力,就会产生严重污染。

5. 评测流程

先固定模型、提示、采样、工具、搜索预算和每题尝试次数,再运行可复现容器。输出不仅保存最终网格,还要记录中间假设、程序、耗时和失败类型;多次采样结果必须报告总体计算成本,不能只选最好一次。

6. 指标解读

精确匹配能避免模糊打分,但会把接近正确和完全错误放在同一档。研究报告应同时给出任务级正确率、重复运行方差、每题成本和人类干预,并按变换类型分析弱点,避免一个总分掩盖策略差异。

还应区分首次作答、固定次数采样和搜索后最好结果。若不同系统使用的尝试次数或外部工具不同,必须分别报告,不能把更多计算带来的提升误写成模型本身进步。

7. 主要风险

风险包括测试集泄漏、针对公开题型过拟合、无限增加推理预算,以及人工筛选答案却不披露。视觉网格的简洁也可能诱导过度外推:在 ARC 上进步,并不自动证明系统能处理开放世界目标、长期记忆或社会判断。

8. 治理要求

评测负责人应维护数据哈希、代码版本、模型快照、预算上限和提交记录。对外比较必须使用相同规则,并披露额外训练数据、人工参与和失败重试。若参与正式竞赛,还要遵守其私有评估与提交政策。[S2]

9. 验收清单

复现时随机抽查输入解析、颜色编码、输出尺寸和精确评分,确认失败不会被静默丢弃。用未调参的保留任务验证方法是否迁移;成功标准应同时包含正确率、方差、预算、可复现性和污染声明。

10. 来源与更新时间

本文研究日期与信息截点均为 2026-08-07。数据结构和使用材料依据 ARC Prize 官方仓库,任务定位和正式评估说明依据 ARC-AGI-2 官方页面;题集、竞赛规则和排行榜会变化,比较前应重新核验。

  • [S1] ARC Prize 官方 ARC-AGI-2 仓库提供任务数据、格式与评测材料|链接
  • [S2] ARC Prize 官方 ARC-AGI-2 页面介绍基准目标、任务与评估入口|链接