面向模型安全研究的开源审计工具,以多轮模拟、自动评分和人工复核探索欺骗、迎合与权力寻求等风险。
Tag
red-teaming
包含该标签的简调共 5 篇。
SHADE-Arena 用带有正常主任务和隐藏有害副目标的长程环境,联合评估 Agent 的破坏能力与监控模型的识别能力。
garak 是用于探测大语言模型与对话系统脆弱性的开源命令行扫描工具。
Promptfoo 是用于评测、红队测试和比较 LLM 应用输出的开源工具与商业平台。
面向 AI agent 和 LLM 应用的评测、测试与 red teaming 平台,包含企业 Hub 和开源 Python library。