数据评测安全

Humanity's Last Exam:面向前沿模型的高难度跨学科评测

Humanity's Last Exam 用专家级跨学科问题测试前沿模型的知识与推理边界,适合研究比较,但不能单独代表产品可靠性。

Humanity's Last Exam model-evaluation llm-benchmark ai-safety open-source Humanity's Last Exam 用专家级跨学科问题测试前沿模型的知识与推理边界,适合研究比较,但不能单独代表产品可靠性。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
数据评测安全
产品状态
已上线
开放状态
开源
信息截至
2026-08-03

1. 项目定位

Humanity’s Last Exam,简称 HLE,是面向前沿大模型的高难度、多学科评测项目。官方仓库提供数据与评测相关说明,项目网站展示基准定位和结果入口。[S1][S2] 它试图在常见学术基准逐渐饱和后继续区分模型能力,但“题更难”不等于“覆盖所有智能”,更不能直接推出某模型适合具体业务。

2. 数据特点

题目来自多个专业领域,强调专家级知识和不易通过常规检索或浅层模式匹配解决的问题。[S2] 这种设计有助于观察模型在知识边界上的表现,也提高了答案核验难度。使用者需要关注题目版本、公开范围、答案格式和评分脚本,否则不同时间获得的分数可能不可直接比较。

3. 适用目的

HLE 适合研究机构、模型团队和独立评测者做前沿能力对比、错误类型分析与训练后回归。它不适合单独用于客服、代码代理、医疗问答或企业检索的采购决策,因为这些场景还有工具使用、权限、安全、时效和成本要求。正确用法是把它放进多指标评测组合,而不是设成唯一排行榜。

4. 运行方式

官方仓库是获取数据、说明和实现信息的主要入口。[S1] 运行前应锁定提交版本,记录模型名称、访问日期、提示模板、采样参数和评分程序。对于含图像或特殊格式的题目,还要确认输入链路没有丢失信息。所有失败都应保留原始输出,以区分知识不足、格式错误和评分解析错误。

5. 分数解释

总体分数只能说明模型在该题集和该设置下的表现。跨领域平均值可能掩盖某些学科的明显短板,少量提升也可能来自提示或评分变化。报告时应同时给出样本数、置信区间或不确定性说明、分学科结果及无法评分比例。不要把基准排名直接翻译成“更可靠”或“更安全”。

6. 污染与复现

公开基准长期面临训练数据污染和针对性优化风险。评测者应记录数据公开状态,避免把答案或完整测试样本传入可被后续训练吸收的系统。复现时使用相同版本和参数,并对少量题目做人工复核。如果模型能够联网或调用工具,必须单独标注,不能与闭卷设置混在同一排名。

7. 成本控制

高难度题目可能诱发更长推理和更多输出,成本应按完整评测计算,包括失败重试、图像输入、评分模型和人工审阅。先用小样本验证适配器与答案解析,再运行全量,能避免格式配置错误造成整批浪费。若评测多个模型,应固定最大输出与超时策略,确保比较公平。

8. 风险与伦理

专业题目可能涉及受限内容、版权材料或容易被过度解读的领域结论。项目使用者应遵守仓库许可与数据条款,并避免公开可能削弱基准效度的内容。[S1] 对外传播结果时要说明模型版本、评测条件和局限,尤其不能用单一分数替代真实场景中的安全测试与专家责任。

9. 验收清单

一次可信评测应满足:版本锁定;输入格式完整;模型与参数可追踪;评分脚本通过人工抽检;失败样本分类;工具权限清楚;分领域结果与总体结果同时报告;成本有记录;结论不超出基准覆盖范围。若无法复现或公开关键设置,结果只能作为线索,不能成为采购硬依据。

10. 来源与更新时间

本文研究日期与信息截点均为 2026-08-03。数据、运行资料和许可信息以 Center for AI Safety 官方仓库为准,项目定位与结果展示以 HLE 官方网站为准;数据版本和排行榜会变化,引用分数时必须附带日期。

  • [S1] Center for AI Safety 官方 HLE 仓库提供数据、评测说明、代码与许可信息|链接
  • [S2] Humanity’s Last Exam 官方网站说明基准定位、跨学科范围与结果入口|链接