数据评测安全 基准篇

BrowseComp:评估浏览代理的持久检索能力

BrowseComp 用难检索、短答案任务测试浏览代理的持续搜索与推理能力;使用时应防止数据泄漏,并把它与真实业务评测分开解读。

BrowseComp model-evaluation llm-benchmark web-research open-source BrowseComp 用难检索、短答案任务测试浏览代理的持续搜索与推理能力;使用时应防止数据泄漏,并把它与真实业务评测分开解读。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
数据评测安全
产品状态
维护中
开放状态
开源
产品形态
benchmarkdataset
能力标签
agent-evaluationweb-browsingshort-answer-grading
目标用户
研究者model-evaluators
交付方式
open-source
区域
global
信息截至
2026-08-07
最后复查
2026-08-07

1. 基准定位

BrowseComp 是 OpenAI 发布的浏览代理基准,包含 1,266 个需要在互联网中持续寻找难发现、相互关联信息的问题,答案被设计得简短且便于核验。[S1] 它主要观察代理是否会持续搜索、改写查询、判断线索并找到目标事实,而不是衡量长篇写作、开放式咨询或一般网页问答体验。

2. 任务设计

官方说明,题目围绕单一、稳定、短答案构建,并经过人工验证以提高难度。[S1] 这种结构降低了自动评分歧义,却也缩小了与真实用户任务的重合面。现实调研常包含需求澄清、冲突来源、时效判断和多种可接受结论,因此 BrowseComp 分数不应被当作浏览代理的整体能力排名。

3. 开放实现

官方论文把基准指向 OpenAI 的 simple-evals 仓库,仓库继续托管 BrowseComp 的参考实现,并注明该库自 2025 年 7 月后不再为新模型或新基准结果持续更新。[S1][S2] 复现实验时应固定代码提交、模型版本、系统提示、搜索工具、时间预算和并发设置,以免把工具变化误认为模型进步。

4. 评测环境

浏览结果会随搜索索引、网页删除、地域、登录状态和时间改变。应为每次运行保存查询日志、访问 URL、抓取时间、工具错误和最终证据,但不要公开基准答案。网络超时、验证码或页面不可达要单独计数,不能全部归为推理失败,否则模型能力与基础设施质量会混在一起。

5. 指标解读

官方报告展示不同模型及不同计算策略在该基准上的结果,并讨论多次采样与聚合带来的提升。[S1] 对内部比较,除准确率外还应记录成功题的中位耗时、页面访问量、搜索调用量与失败类型。若一个方案通过大幅增加调用获得小幅增益,需要结合成本、延迟和网站负载判断是否值得。

6. 数据泄漏风险

公开基准最核心的风险是题目或答案进入训练集、检索缓存和共享日志。测试账号、提示词与结果存储要隔离,禁止把答案页面建立为专用索引,也不应让人工在运行中暗示目标。发现疑似直接命中答案库时,应标记污染并移出主结果,而不是保留高分。

7. 代理安全

浏览代理会接触未知网页、脚本式文字和诱导指令。页面内容只能作为数据,不能覆盖系统规则、请求密钥或扩大工具权限。评测环境应限制下载、文件执行、登录和写操作,并对外发请求设置域名、速率和大小边界。评测结束后检查是否保存了敏感 cookie 或网页个人信息。

8. 内部补充集

为了接近业务,应另外建立不公开的任务集,覆盖本组织关心的语言、来源类型、时效要求和答案形式。每题要写清可接受证据、停止条件和无法确认时的正确行为。BrowseComp 可测“难找的短事实”,内部集则验证“能否完成我们的任务”,两者共同使用才更有决策价值。

9. 验收流程

先以少量题目验证运行器、评分和日志,再执行固定样本的完整对照。复跑时保持预算一致,并由不了解模型身份的人员抽查证据。成功不仅是答案正确,还应能追溯搜索路径、区分工具故障、发现污染风险,并在没有可靠证据时停止猜测。

10. 来源与更新时间

本文依据 OpenAI 的 BrowseComp 论文与 simple-evals 官方仓库,核对任务数量、设计目标、参考实现和维护状态。[S1][S2] 基准页面、仓库状态和网络环境会变化,引用分数前应重新核对具体运行配置与时间。

  • [S1] OpenAI:BrowseComp 官方研究论文|链接|访问 2026-08-07
  • [S2] OpenAI simple-evals 官方仓库|链接|访问 2026-08-07