garak 简调
garak 是用于探测大语言模型与对话系统脆弱性的开源命令行扫描工具。
garak LLM-security red-teaming prompt-injection open-source garak 是用于探测大语言模型与对话系统脆弱性的开源命令行扫描工具。
garak
1. 调研缘由
LLM 红队测试需要把攻击提示、目标模型与结果判定拆开配置,才能形成可重复的检查。NVIDIA 维护的 garak 将自己描述为 LLM vulnerability scanner(大语言模型脆弱性扫描器)。[S1]
2. 简介与产品工作流
garak 通过 probes、generators、detectors 和 evaluators 等组件组织测试。[S1] 官方仓库列举幻觉、数据泄露、提示注入、虚假信息、毒性生成和越狱等作为其检查的失败类型。[S1] 命令行可先指定目标模型,再选择全部或部分 probe;每个 probe 的输出由对应 detector 评估并报告结果。[S1]
3. 团队与资本背景
项目公开由 NVIDIA GitHub 组织维护,并使用 Apache-2.0 许可证。[S1] 本篇将其作为开源安全工具讨论,不写无直接一手依据的商业规模或市场份额。
4. 技术基础与生态位
garak 位于数据、评测与安全层,目标是发现模型或对话系统可能出现的不希望行为,而不是在运行时拦截输出。[S1] 官方仓库列出 Hugging Face、OpenAI API、AWS Bedrock、Replicate、REST 等多种目标接入方式;不同目标的认证和支持范围按 generator 变化。[S1]
5. 市场与外部信号
garak 作为 Python 命令行工具发布,可从 PyPI 或源码安装。[S1] 本篇不将某一版本的参数或插件数量外推为长期能力。
6. 公开评价与主要分歧
正面评价(来源类型):
- 官方:garak 用结构化 probes 探索 LLM 或对话系统的潜在失败模式。[S1]
- 官方:目标、probe 和 detector 可通过 CLI 组合选择。[S1]
主要批评/质疑(来源类型):
- 扫描结果取决于攻击集、检测器、模型版本和采样设置;一次通过或失败不能替代完整的安全论证。
存在分歧之处:
自动化红队可以扩大测试覆盖,但高风险部署仍需要人工设计场景、复现失败与制定缓解措施。
7. 同类对比(与头部/高知名度同类项目)
**主要对标项目:**Promptfoo、Giskard、NVIDIA NeMo Guardrails。
| 维度 | garak | Promptfoo | NeMo Guardrails |
|---|---|---|---|
| 公开定位 | LLM 脆弱性扫描与红队评测。[S1] | 已发布站内简调。 | 已发布站内简调。 |
| 工作方式 | 组合 target、probe 与 detector 执行检查。[S1] | 以当前官方资料为准。 | 以当前官方资料为准。 |
公开评价中的对比(标源,非个人裁决):
本次只记录 garak 的公开定位和插件式测试结构,不把不同工具的测试结果直接比较。[S1]
8. 信息缺口与后续观察
- 需针对目标模型、语言和业务场景选择 probe,并保存可复现配置。
- 应关注 detector 的误报、漏报和人工复核流程。
9. 归纳洞察 ★
garak 的价值不在于给模型贴上“安全”或“不安全”的单一标签,而在于把失败模式拆成可配置的探测和判定流程。安全团队若要把结果用于决策,还需要把扫描输出接回具体风险、复现证据和修复验证。
10. 来源与更新时间
- 信息截至(as_of): 2026-07-31
- 最后复查(last_checked): 2026-07-31
- 最后更新(last_updated): null
可追溯来源
- [S1]Tier1NVIDIA/garak GitHub Repository访问日期 2026-07-31