GDPval:用真实职业交付物评估 AI 的经济任务能力
OpenAI 发布的真实工作任务评测,覆盖 44 种职业,以专业人员创建的任务、参考材料、交付物和评分标准衡量模型能力。
GDPval model-evaluation benchmark economic-impact open-source OpenAI 发布的真实工作任务评测,覆盖 44 种职业,以专业人员创建的任务、参考材料、交付物和评分标准衡量模型能力。
1. 项目定位
GDPval 是 OpenAI 于 2025 年 9 月发布的评测,用于衡量模型完成具有经济价值的真实工作任务的能力,首版覆盖 44 种职业。[S1] 它关注的是报告、演示文稿、表格等可交付成果,而非只有一个标准答案的短题,因此更接近知识工作中的完整任务形态。
2. 任务如何产生
官方说明称,任务由具有相关职业经验的专业人员根据真实工作设计,并配套参考文件、理想交付物和评分标准。[S1] 这种设计提高了职业语境和产物要求的真实性,但样本仍是对现实工作的抽样,不能直接代表某个组织的流程、数据、法规和质量门槛。
3. 覆盖范围
GDPval 从对美国经济有重要贡献的行业中选择职业,覆盖不同类型的知识工作。[S1] 数据集页面提供任务数据及相关参考和交付文件,便于研究者检查样本结构并开展复现。[S2] 使用者应先确认目标岗位、文件格式和任务难度与自身场景是否相似,再解释分数的业务意义。
4. 评分逻辑
这类任务往往不存在唯一文本答案,评测因此依据专业人员制定的 rubric 比较交付物是否满足要求。[S1][S2] 在内部复现时,应锁定模型版本、工具权限、时间预算与评分流程,并保留产物和评分理由。若不同模型获得的上下文、软件或人工帮助不同,分数就不再具备直接可比性。
5. 能说明什么
GDPval 可用于观察模型在复杂、多步骤职业任务上的相对能力,并帮助团队发现格式、完整性、事实使用或审美呈现等短板。[S1] 它不能单独证明某个岗位可以被自动化,也不能推导企业级投资回报;真实部署还受流程集成、数据权限、责任归属、错误成本和员工采用情况影响。
6. 数据使用边界
公开数据包含任务说明、参考材料和示例交付物。[S2] 团队导入评测平台前,应检查文件格式、许可证、存储位置和访问范围,并避免把公开参考答案混入模型检索库或提示模板。若模型训练或上下文中已出现测试材料,结果可能受到污染,不能当作独立泛化能力证据。
7. 适用场景
适合模型选型、工具增强方案比较、职业任务研究和内部评测设计参考。对企业而言,更有价值的方式不是照搬总分,而是从本组织挑选少量类似任务,重新定义可接受产物、严重错误和人工复核点,再与 GDPval 的公开结果形成外部基线和内部基线两层视图。
8. 落地路径
先选三到五个与业务高度相关的任务类型,统一模型、工具、运行时限和重试规则。由至少两名领域人员独立评分,再讨论分歧并固化 rubric。之后比较纯人工、AI 辅助和高自动化三种路径的质量、时间与返工,而不是只比较模型之间的名次。
9. 验收建议
验收应记录任务完成率、rubric 得分、重大事实错误、格式缺陷、人工修订时长和评分者一致性。重复运行可检查稳定性,盲评可减少品牌偏见。若结果用于采购或岗位设计,应披露样本范围、工具配置和失败案例,并由业务、合规与一线人员共同决定是否扩大试点。
10. 来源与更新时间
本简调截至 2026-08-12,依据 OpenAI 的 GDPval 发布说明与 OpenAI 官方账号发布的数据集。数据版本和评分材料可能更新,复现实验前应固定版本并重新核对数据卡。