Anthropic Petri:用自动审计代理探索模型风险行为
面向模型安全研究的开源审计工具,以多轮模拟、自动评分和人工复核探索欺骗、迎合与权力寻求等风险。
Anthropic Petri llm-evaluation red-teaming ai-safety open-source 面向模型安全研究的开源审计工具,以多轮模拟、自动评分和人工复核探索欺骗、迎合与权力寻求等风险。
1. 项目定位
Petri 是 Anthropic Fellows 项目推出的开源模型审计工具。研究者用自然语言描述待探索行为,由审计代理与目标模型多轮互动,再由评判模型打分汇总,以找到值得人工深查的风险样本。[S1]
2. 要解决的问题
传统对齐评测需要人工搭环境、运行模型、阅读大量对话并汇总结果。随着模型能使用工具和长期行动,潜在情境增长得比人工审计更快。Petri 用自动化降低广覆盖探索成本,让研究者先发现异常模式。[S1]
3. 工作机制
使用者提供一组 seed instructions,描述想测试的场景和行为。审计代理为每个种子规划测试,在模拟用户与工具的环境里和目标模型互动;结束后,评判模型按多个维度评分,系统保留对话记录供搜索与人工检查。任务可并行执行,因此适合比较模型或重复跑回归测试。[S1]
4. 可评估行为
官方示例覆盖欺骗、迎合、鼓励用户妄想、配合有害请求、自我保存、权力寻求和奖励黑客等行为。Petri 既能做一次性假设探索,也能搭建系统评测;使用者可修改或新增评分维度。[S1]
5. 版本演进
2026 年公布的 Petri 3.0 将审计模型与目标模型拆成可独立调整的组件,并加入 Dish,以更真实的系统提示和脚手架降低“模型察觉正在被测试”的影响;它还与侧重深入评估特定行为的 Bloom 集成。Anthropic 同时把项目交给独立评测机构 Meridian Labs 继续维护。[S2]
6. 使用路径
团队先确定可观察的行为假设,再准备少量高质量种子、模型访问方式和评分标准。首次运行检查环境与记录,随后才扩大规模。输出应保留模型版本、系统提示、工具权限和采样参数。
7. 适用场景
模型实验室可用它做发布前审计,第三方评测者可构建独立情境,应用团队可把真实事故改写成回归用例。它适合发现低频风险和比较安全措施,但单个总分不能替代专家判断。
8. 风险与边界
自动审计和评判都依赖模型,会受偏差、提示敏感性和评测意识影响。模拟情境的阳性结果需要确认,阴性也不能证明风险不存在。测试有害行为时必须隔离工具权限,避免产生真实外部影响。
9. 验收建议
先用应触发与不应触发的对照种子验证评分方向,再抽查高分、低分和边界样本。重复运行时检查稳定性,并要求人工能从原始对话重建理由。评测包还应记录覆盖范围、未测风险和模型配置。
10. 来源与更新时间
本文核对至 2026-08-12。Petri 已从 Anthropic 移交给 Meridian Labs,安装方式、默认评分项和项目治理应以当前维护方资料为准。