τ²-bench:评测用户与工具型智能体共同决策的基准
Sierra Research 提出的双控制对话智能体评测基准,用真实领域任务检验用户和智能体都能采取行动时的协作表现。
τ²-bench agent-evaluation llm-benchmark open-source Sierra Research 提出的双控制对话智能体评测基准,用真实领域任务检验用户和智能体都能采取行动时的协作表现。
1. 项目是什么
τ²-bench 是 Sierra Research 在 2025 年 6 月公开的对话智能体评测基准。它把 τ-bench 扩展到“双控制”环境:智能体可以调用工具,模拟用户也能在自己的环境中采取行动,双方需要通过对话协调才能完成任务。[S1][S2] 项目提供论文、代码和任务数据,不是生产智能体平台。
2. 它解决什么问题
很多工具调用评测默认用户只负责说话,所有实际操作都由智能体完成。但真实客服或业务流程里,用户可能需要确认身份、重启设备、检查邮件或完成线下步骤。若评测忽略用户行动,就难以检验智能体是否会正确提问、等待、解释和协调。τ²-bench 用双边可行动的环境补上这一缺口。[S2]
3. 核心构成
仓库包含领域环境、任务、策略、工具、用户模拟器、智能体实现和评测运行入口。[S1] 论文介绍了电信等真实领域风格的任务,并评估不同智能体与用户模拟组合。[S2] 最终得分反映任务是否按约束完成,但它不是通用事实正确率,也不能直接代表模型在所有客服场景中的质量。
4. 评测工作方式
一次运行中,智能体读取对话并调用自己可用的工具,用户模拟器则根据任务信息回应或执行用户侧动作。环境按照目标状态与领域规则检查结果。[S1][S2] 这让失败可以来自多种环节:智能体选错动作、用户模拟偏离指令、双方没有交换必要信息,或在流程顺序上协调失败。
5. 适用场景
它适合研究工具型客服代理、对话协作和用户模拟的团队,也适合企业建立内部评测时参考“双边行动”设计。典型任务包括排障、账户操作和需要用户配合的服务流程。若产品只是单轮问答、离线摘要或没有外部动作的聊天助手,直接套用该基准的收益有限。
6. 使用路径
团队可先按官方仓库安装环境,复现一个默认配置,再固定模型、提示、温度和任务子集。确认日志中能还原每次工具调用与用户动作后,才加入自有智能体。若要迁移到内部业务,应重新定义政策、工具权限、用户可执行动作和成功状态,不能只改领域名称。
7. 开放状态
代码仓库公开,许可证信息与具体数据使用条件应以仓库当前文件为准。[S1] 开放实现便于复现和扩展,但运行仍依赖所选模型或 API,其费用、速率和数据政策不由基准本身统一解决。论文结果是特定设置下的研究证据,不是对任意新模型的永久排名。[S2]
8. 主要风险
第一,用户模拟器本身会影响结果,可能把模拟能力误算成被测智能体能力;第二,任务覆盖有限,不能代替企业自己的政策与边界案例;第三,随机性和模型版本变化会降低复现性;第四,总分会隐藏不同失败类型。评测报告应保留轨迹,并把流程违规与最终未完成分开统计。
9. 验收建议
采用时先验证官方样例能稳定运行,再对同一配置重复多轮,记录均值、波动和失败分类。内部扩展至少加入权限拒绝、用户提供错误信息、中途改变目标与工具异常四类情况。成功标准不只看完成率,还应检查不该执行的动作是否被阻止,以及人工能否从日志定位失败原因。
10. 来源与更新时间
本文核对至 2026-08-09,仅使用 Sierra Research 的项目仓库与作者论文;后续任务、实现和结果以官方版本为准。