数据评测安全

GDPval:用真实职业交付物评估 AI 的经济任务能力

OpenAI 发布的真实工作任务评测,覆盖 44 种职业,以专业人员创建的任务、参考材料、交付物和评分标准衡量模型能力。

GDPval model-evaluation benchmark economic-impact open-source OpenAI 发布的真实工作任务评测,覆盖 44 种职业,以专业人员创建的任务、参考材料、交付物和评分标准衡量模型能力。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
数据评测安全
产品状态
已上线
开放状态
开源
信息截至
2026-08-12

1. 项目定位

GDPval 是 OpenAI 于 2025 年 9 月发布的评测,用于衡量模型完成具有经济价值的真实工作任务的能力,首版覆盖 44 种职业。[S1] 它关注的是报告、演示文稿、表格等可交付成果,而非只有一个标准答案的短题,因此更接近知识工作中的完整任务形态。

2. 任务如何产生

官方说明称,任务由具有相关职业经验的专业人员根据真实工作设计,并配套参考文件、理想交付物和评分标准。[S1] 这种设计提高了职业语境和产物要求的真实性,但样本仍是对现实工作的抽样,不能直接代表某个组织的流程、数据、法规和质量门槛。

3. 覆盖范围

GDPval 从对美国经济有重要贡献的行业中选择职业,覆盖不同类型的知识工作。[S1] 数据集页面提供任务数据及相关参考和交付文件,便于研究者检查样本结构并开展复现。[S2] 使用者应先确认目标岗位、文件格式和任务难度与自身场景是否相似,再解释分数的业务意义。

4. 评分逻辑

这类任务往往不存在唯一文本答案,评测因此依据专业人员制定的 rubric 比较交付物是否满足要求。[S1][S2] 在内部复现时,应锁定模型版本、工具权限、时间预算与评分流程,并保留产物和评分理由。若不同模型获得的上下文、软件或人工帮助不同,分数就不再具备直接可比性。

5. 能说明什么

GDPval 可用于观察模型在复杂、多步骤职业任务上的相对能力,并帮助团队发现格式、完整性、事实使用或审美呈现等短板。[S1] 它不能单独证明某个岗位可以被自动化,也不能推导企业级投资回报;真实部署还受流程集成、数据权限、责任归属、错误成本和员工采用情况影响。

6. 数据使用边界

公开数据包含任务说明、参考材料和示例交付物。[S2] 团队导入评测平台前,应检查文件格式、许可证、存储位置和访问范围,并避免把公开参考答案混入模型检索库或提示模板。若模型训练或上下文中已出现测试材料,结果可能受到污染,不能当作独立泛化能力证据。

7. 适用场景

适合模型选型、工具增强方案比较、职业任务研究和内部评测设计参考。对企业而言,更有价值的方式不是照搬总分,而是从本组织挑选少量类似任务,重新定义可接受产物、严重错误和人工复核点,再与 GDPval 的公开结果形成外部基线和内部基线两层视图。

8. 落地路径

先选三到五个与业务高度相关的任务类型,统一模型、工具、运行时限和重试规则。由至少两名领域人员独立评分,再讨论分歧并固化 rubric。之后比较纯人工、AI 辅助和高自动化三种路径的质量、时间与返工,而不是只比较模型之间的名次。

9. 验收建议

验收应记录任务完成率、rubric 得分、重大事实错误、格式缺陷、人工修订时长和评分者一致性。重复运行可检查稳定性,盲评可减少品牌偏见。若结果用于采购或岗位设计,应披露样本范围、工具配置和失败案例,并由业务、合规与一线人员共同决定是否扩大试点。

10. 来源与更新时间

本简调截至 2026-08-12,依据 OpenAI 的 GDPval 发布说明与 OpenAI 官方账号发布的数据集。数据版本和评分材料可能更新,复现实验前应固定版本并重新核对数据卡。

  • [S1] OpenAI GDPval 论文:评测目标、44 种职业、任务构建与结果解释|链接
  • [S2] OpenAI 官方 Hugging Face 数据卡:任务数据、参考文件与交付物|链接