OpenAI 发布的计算生物学研究级基准,用合成但现实的脏数据任务测试 AI Agent 的分析路径选择、修正与决策判断。
Tag
llm-benchmark
包含该标签的简调共 9 篇。
Sierra Research 提出的双控制对话智能体评测基准,用真实领域任务检验用户和智能体都能采取行动时的协作表现。
ARC-AGI-2 以少量示例和网格变换任务评估系统对陌生规则的归纳与迁移能力,适合作为推理评测组成部分,而非通用智能单一结论。
BrowseComp 用难检索、短答案任务测试浏览代理的持续搜索与推理能力;使用时应防止数据泄漏,并把它与真实业务评测分开解读。
Terminal-Bench 用隔离终端环境和可验证任务评估智能体完成真实工作的能力,适合比较代理系统,但结果高度依赖任务版本与运行环境。
Humanity's Last Exam 用专家级跨学科问题测试前沿模型的知识与推理边界,适合研究比较,但不能单独代表产品可靠性。
SWE-bench Verified 是经人工核验的软件工程评测子集,用于更可靠地衡量模型或 agent 解决真实 GitHub issue 的能力。
SWE-Lancer 用真实自由职业软件工程任务和经济价值衡量模型表现,适合研究编码能力,但不能替代企业代码库中的安全与维护验收。
Stanford CRFM 推出的语言模型整体评测项目,强调用多场景、多指标和透明报告评估模型能力、局限与风险;GitHub 仓库显示其已于 2026-06-01 进入维护模式。