ARC-AGI-2:检验新任务抽象推理能力的开放基准
ARC-AGI-2 以少量示例和网格变换任务评估系统对陌生规则的归纳与迁移能力,适合作为推理评测组成部分,而非通用智能单一结论。
ARC-AGI-2 model-evaluation llm-benchmark reasoning ARC-AGI-2 以少量示例和网格变换任务评估系统对陌生规则的归纳与迁移能力,适合作为推理评测组成部分,而非通用智能单一结论。
1. 基准定位
ARC-AGI-2 是 ARC Prize 推出的开放抽象推理基准,以彩色网格的输入输出示例要求系统发现规则并完成新实例。[S1][S2] 它重点检验面对陌生任务时的归纳和迁移,不等同于知识问答、编程能力或完整通用智能。
2. 任务结构
每个任务提供少量训练示例和待求解测试网格,答案必须精确匹配目标输出。系统需要识别对象、关系、空间变化和组合规则,而不是从固定标签中选择;微小尺寸或颜色错误也会导致整题失败。[S1]
3. 适用场景
适合比较模型、搜索算法、程序合成和混合系统在低样本推理上的进展,也可用于研究测试时计算如何转化为正确率。它不适合单独决定企业模型采购,因为真实业务还涉及语言、工具、成本、安全和稳定性。
4. 数据使用
团队应严格区分公开训练、公开评估和未公开测试任务,记录使用过的任务集合及调参次数。若把评估题用于提示设计、人工规则库或训练,再把同一集合成绩当作泛化能力,就会产生严重污染。
5. 评测流程
先固定模型、提示、采样、工具、搜索预算和每题尝试次数,再运行可复现容器。输出不仅保存最终网格,还要记录中间假设、程序、耗时和失败类型;多次采样结果必须报告总体计算成本,不能只选最好一次。
6. 指标解读
精确匹配能避免模糊打分,但会把接近正确和完全错误放在同一档。研究报告应同时给出任务级正确率、重复运行方差、每题成本和人类干预,并按变换类型分析弱点,避免一个总分掩盖策略差异。
还应区分首次作答、固定次数采样和搜索后最好结果。若不同系统使用的尝试次数或外部工具不同,必须分别报告,不能把更多计算带来的提升误写成模型本身进步。
7. 主要风险
风险包括测试集泄漏、针对公开题型过拟合、无限增加推理预算,以及人工筛选答案却不披露。视觉网格的简洁也可能诱导过度外推:在 ARC 上进步,并不自动证明系统能处理开放世界目标、长期记忆或社会判断。
8. 治理要求
评测负责人应维护数据哈希、代码版本、模型快照、预算上限和提交记录。对外比较必须使用相同规则,并披露额外训练数据、人工参与和失败重试。若参与正式竞赛,还要遵守其私有评估与提交政策。[S2]
9. 验收清单
复现时随机抽查输入解析、颜色编码、输出尺寸和精确评分,确认失败不会被静默丢弃。用未调参的保留任务验证方法是否迁移;成功标准应同时包含正确率、方差、预算、可复现性和污染声明。
10. 来源与更新时间
本文研究日期与信息截点均为 2026-08-07。数据结构和使用材料依据 ARC Prize 官方仓库,任务定位和正式评估说明依据 ARC-AGI-2 官方页面;题集、竞赛规则和排行榜会变化,比较前应重新核验。