数据评测安全

Terminal-Bench:评估 AI 智能体真实终端任务能力的持续基准

Terminal-Bench 用隔离终端环境和可验证任务评估智能体完成真实工作的能力,适合比较代理系统,但结果高度依赖任务版本与运行环境。

Terminal-Bench model-evaluation llm-benchmark open-source agent-evaluation Terminal-Bench 用隔离终端环境和可验证任务评估智能体完成真实工作的能力,适合比较代理系统,但结果高度依赖任务版本与运行环境。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
数据评测安全
产品状态
已上线
开放状态
开源
信息截至
2026-08-07

1. 项目概览

Terminal-Bench 是评估 AI 智能体终端操作的持续基准,以多样、困难且可验证的任务衡量代理能否完成实际工作。[S1][S2] 任务以 Harbor 原生数据集发布并在隔离环境运行。它评估模型、代理、提示、工具和环境组成的完整系统。

2. 版本与官方身份

项目由 Terminal-Bench 团队维护,当前仓库属于 harbor-framework,官网提供版本、排行榜和任务示例。[S1][S2] 基准持续演进,不同版本的任务与验证方式会变化。仓库曾迁移,当前仓库创建时间不能视为项目首次公开时间。

3. 任务与评分方式

任务要求智能体在终端环境执行真实操作,并带有环境、参考解法与自动检查。官方说明可通过 Harbor 运行数据集,并建议多次执行参考代理确认环境稳定。[S1] 分数也会受容器、依赖、超时和工具实现影响。

4. 基准价值

Terminal-Bench 可暴露长链路执行中的规划、命令、恢复和验证问题。官网展示版本与任务示例,便于理解覆盖范围。[S2] 它适合比较提示或工具链变更,但只能作为技术证据之一,不能直接代表企业流程成功率。

5. 适用场景

适合评估能运行命令、编辑文件、安装依赖和调用开发工具的代理,也适合回归测试框架升级。若产品主要做客服问答、内容生成或封闭流程,应把它仅作通用终端能力信号,并另建业务任务集。

6. 运行路径

官方仓库要求安装 Harbor,再指定数据集、代理、模型和环境运行。[S1] 应固定数据集标签、代理与模型版本、并发、超时和容器提供方;先用少量任务确认环境。保存配置、日志和逐任务结果,才能可靠比较实验。

7. 结果解释

总分会掩盖类别差异和基础设施失败。报告应区分任务失败、代理异常、环境构建失败和评测器问题,并给出重复波动。官网排行榜可作参照,但本地复现须使用同一数据集版本和相近条件。[S2]

8. 主要风险

持续基准会修复任务或更新版本,跨版本分数不可直接纵向比较。外部依赖变化可能让原本可解的任务失效;代理在容器里执行命令也会消耗算力并接触下载内容。运行环境必须隔离,禁止挂载生产凭据和个人目录,并限制网络、资源与超时,防止错误命令影响宿主机。

9. 验收方法

先让参考解法或官方建议的 oracle 多次通过,以验证环境;再对候选代理进行至少两轮重复实验。验收表应包含总体解决率、按任务类别结果、基础设施失败率、运行时间和成本。升级代理前后使用完全相同的任务版本,并人工检查新增成功与新增失败样本,确认提升不是评分漏洞或偶然波动。

10. 来源与更新时间

本文研究日期与事实边界截至 2026-08-07。Terminal-Bench 是持续更新的评测集合,本文不把当前仓库元数据当作首次发布日期。复现实验时应记录官网所示数据集版本,并以官方仓库的最新运行说明为准。

  • [S1] Harbor Framework:Terminal-Bench 的官方仓库、任务定位与 Harbor 运行方式|链接
  • [S2] Terminal-Bench:官方版本、排行榜、任务示例与项目定位|链接