数据评测安全

Anthropic Bloom:自动生成模型行为评测的开源框架

Anthropic 发布的自动化行为评测框架,从行为定义生成情境、运行对话并评分,用于量化前沿模型的特定行为倾向。

Anthropic Bloom llm-evaluation ai-safety agent-evaluation open-source Anthropic 发布的自动化行为评测框架,从行为定义生成情境、运行对话并评分,用于量化前沿模型的特定行为倾向。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
数据评测安全
产品状态
已上线
开放状态
开源
信息截至
2026-08-12

1. 项目定位

Bloom 是 Anthropic 于 2025 年 12 月发布的开源自动化行为评测框架。研究者先描述要测量的行为,系统再生成测试情境、运行目标模型并汇总行为出现频率与严重程度。[S1] 它服务于评测设计,不是模型训练或线上安全拦截器。

2. 要解决的问题

高质量行为评测制作慢,而且固定题集可能进入训练数据,或随模型能力提升而失去区分度。Bloom 试图把情境生成和运行流程自动化,让研究者更快为欺骗、迎合、自我保存等特定倾向建立可重复的测试套件。[S1]

3. 四阶段流程

官方把流程分为理解、构思、运行和判断四个阶段:先解析行为定义与示例,再生成情境和模拟环境,随后让目标模型互动,最后由评判模型为记录打分并生成套件级分析。[S1][S2] 每一步都可配置,也都可能引入模型偏差。

4. 输入与输出

研究者用 seed 配置描述行为、示例记录和运行参数。Bloom 输出逐条对话、评分、总体指标及报告,并可导出 Inspect 兼容记录、接入 Weights & Biases 查看实验。[S1][S2] 指标必须和 seed、模型版本及评判配置一起保存,孤立分数不可复现。

5. 验证证据

首发研究用 Bloom 生成四类对齐行为评测,并比较多种前沿模型。官方还用人工标注记录校准评判模型,报告不同评判器与人的一致性差异。[S1] 这些结果说明框架具有研究价值,但不代表它对所有行为、语言或部署环境都同样可靠。

6. 与 Petri 的差异

Anthropic 将 Bloom 描述为 Petri 的互补工具:Petri 从用户给定场景出发,广泛观察多种行为;Bloom 从一个明确行为出发,自动生成许多场景并量化其出现程度。[S1] 选择取决于目标是开放式发现风险,还是对已知假设做定向测量。

原 Anthropic Fellows 仓库现已冻结,新功能与修复迁往 Meridian Labs 维护的 Petri/Bloom 项目;既有用户仍可按旧仓库文档运行,但新项目应先核对迁移后的版本与说明。[S2]

7. 适用场景

Bloom 适合模型发布前的行为回归、对齐研究、提示词或安全策略版本比较,以及为新风险假设快速构建初始评测。不适合把自动分数直接当成上线批准;高风险结论仍需要领域专家复核原始对话与失败样本。

8. 落地路径

先选择定义清楚、人工能够辨认的单一行为,编写正反例和最小 seed。小规模运行后人工盲审样本,确认情境真实、评判标准可解释,再扩大模型与重复次数。任何配置变化都应生成新版本,避免把不可比结果放进同一趋势图。

9. 验收建议

验收应检查重复运行的波动、人工与评判模型的一致性、不同语言和任务上的覆盖、情境是否泄露测试意图,以及基线模型与已知异常模型能否被区分。还应抽查高分和低分两端,防止平均值掩盖系统性误判。

10. 来源与更新时间

本文截至 2026-08-12,依据 Anthropic 研究发布页与官方开源仓库整理。

  • [S1] Anthropic 发布 Bloom 并说明自动行为评测流程与验证方法|链接
  • [S2] Bloom 官方仓库、配置与运行说明|链接