数据评测安全

PaperBench:AI 研究复现能力的分层评测基准

OpenAI 发布的研究复现评测,要求 AI Agent 从论文理解、代码实现到实验执行完成端到端任务。

PaperBench llm-evaluation benchmark agentic-workflows OpenAI 发布的研究复现评测,要求 AI Agent 从论文理解、代码实现到实验执行完成端到端任务。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
数据评测安全
产品状态
已上线
开放状态
开源
信息截至
2026-08-07

1. 项目定位

PaperBench 是 OpenAI 于 2025 年 4 月 2 日发布的 AI Agent 评测,目标是测量模型从零复现前沿 AI 研究的能力。[S1] 任务不只问论文内容,而是要求理解贡献、建立代码库并执行实验。因此它更接近长程工程评测,不宜被简化成代码题或知识问答榜单。

2. 数据与任务结构

官方选取 20 篇 ICML 2024 Spotlight 与 Oral 论文,并把复现要求分解为层级化 rubric;公开介绍称共有 8,316 个可独立评分的任务,rubric 与论文作者共同制定。[S1] 这种结构便于定位失败发生在理解、实现还是实验环节,也让部分完成度可以被量化。

3. 评测工作流

参评 Agent 接收论文与环境,在限定条件内产出可运行的复现结果,再按细粒度 rubric 评分。项目还提供基于 LLM 的 judge 用于规模化判分,并另建 judge 基准检查自动评分表现。[S1] 因此使用结果时既要看 Agent 得分,也要审查评分器与人工标准的一致性。

4. 开放资源

OpenAI 已公开代码与数据;当前官方仓库将 PaperBench 放在 frontier-evals 项目目录,包含数据、实验、评测代码、测试与说明。[S2] 开源便于复跑和扩展,但复现实验仍可能消耗大量算力、时间和外部依赖。仓库可用不代表任意环境都能一键得到论文中的成绩。

5. 适用场景

它适合评估研究型 Agent、长程编码能力、实验规划和错误恢复,也可用于分析模型在哪类科研步骤上失效。企业若要选择通用办公助手,PaperBench 的任务分布并不匹配;只有研发工作本身包含论文实现、训练和实验验证时,才应把它纳入决策证据。

6. 指标解读风险

单一总分会掩盖不同论文、任务和运行预算的差异。官方首发结果属于特定模型、脚手架与时间限制下的实验,不能直接外推到今天的模型或内部基础设施。[S1] 自动 judge 也不是绝对真值。对重要比较,应保存运行配置,并抽样由具备相关领域经验的人复核评分。

7. 与常见代码评测的差异

传统代码基准通常给出明确问题和测试,而 PaperBench 要先理解论文目标,再搭建实验并解释结果,失败链条更长。它能暴露规划、依赖管理和长时间执行问题,却不必然预测短函数修复或日常 IDE 补全表现。不同基准回答不同问题,不应把排名合并成“总体智能”结论。

8. 落地路径

首次接入应从少量论文和固定预算开始,锁定仓库版本、容器、模型快照、随机种子与外部访问条件。先复现官方样例,再运行内部 Agent,并记录每个 rubric 节点的证据。若要加入自有论文,应由领域专家编写并交叉审校 rubric,避免评分标准偏向某种实现。

9. 验收建议

成功标准包括环境可重复建立、至少一次官方样例通过、评分产物可追溯到具体文件与实验、人工抽检与 judge 的分歧率在预设范围内。模型比较必须使用相同预算和脚手架。若复跑结果波动很大,应先排查环境与评分,不急于宣布模型能力变化。

10. 来源与更新时间

调研截至 2026 年 8 月 7 日。榜单和仓库会更新,引用成绩时应同时注明提交日期、配置与版本。

  • [S1] PaperBench authors|PaperBench paper|链接
  • [S2] OpenAI GitHub|PaperBench code and dataset|链接