数据评测安全

garak 简调

garak 是用于探测大语言模型与对话系统脆弱性的开源命令行扫描工具。

garak LLM-security red-teaming prompt-injection open-source garak 是用于探测大语言模型与对话系统脆弱性的开源命令行扫描工具。

Frontmatter

结构化元信息

实体类型
开源项目
主分类
数据评测安全
产品状态
已上线
开放状态
开源
产品形态
CLIPython package
能力标签
red-teamingsecurity-testingLLM-evaluation
目标用户
开发者security-teams
交付方式
local自托管
模型策略
支持多种模型与 API 接口
部署方式
本地 Python 命令行
技术披露
公开较多
是否实测
不适用
融资阶段
not-applicable
信息截至
2026-07-31
最后复查
2026-07-31

garak

1. 调研缘由

LLM 红队测试需要把攻击提示、目标模型与结果判定拆开配置,才能形成可重复的检查。NVIDIA 维护的 garak 将自己描述为 LLM vulnerability scanner(大语言模型脆弱性扫描器)。[S1]

2. 简介与产品工作流

garak 通过 probes、generators、detectors 和 evaluators 等组件组织测试。[S1] 官方仓库列举幻觉、数据泄露、提示注入、虚假信息、毒性生成和越狱等作为其检查的失败类型。[S1] 命令行可先指定目标模型,再选择全部或部分 probe;每个 probe 的输出由对应 detector 评估并报告结果。[S1]

3. 团队与资本背景

项目公开由 NVIDIA GitHub 组织维护,并使用 Apache-2.0 许可证。[S1] 本篇将其作为开源安全工具讨论,不写无直接一手依据的商业规模或市场份额。

4. 技术基础与生态位

garak 位于数据、评测与安全层,目标是发现模型或对话系统可能出现的不希望行为,而不是在运行时拦截输出。[S1] 官方仓库列出 Hugging Face、OpenAI API、AWS Bedrock、Replicate、REST 等多种目标接入方式;不同目标的认证和支持范围按 generator 变化。[S1]

5. 市场与外部信号

garak 作为 Python 命令行工具发布,可从 PyPI 或源码安装。[S1] 本篇不将某一版本的参数或插件数量外推为长期能力。

6. 公开评价与主要分歧

正面评价(来源类型):

  • 官方:garak 用结构化 probes 探索 LLM 或对话系统的潜在失败模式。[S1]
  • 官方:目标、probe 和 detector 可通过 CLI 组合选择。[S1]

主要批评/质疑(来源类型):

  • 扫描结果取决于攻击集、检测器、模型版本和采样设置;一次通过或失败不能替代完整的安全论证。

存在分歧之处:

自动化红队可以扩大测试覆盖,但高风险部署仍需要人工设计场景、复现失败与制定缓解措施。

7. 同类对比(与头部/高知名度同类项目)

**主要对标项目:**Promptfoo、Giskard、NVIDIA NeMo Guardrails。

维度garakPromptfooNeMo Guardrails
公开定位LLM 脆弱性扫描与红队评测。[S1]已发布站内简调。已发布站内简调。
工作方式组合 target、probe 与 detector 执行检查。[S1]以当前官方资料为准。以当前官方资料为准。

公开评价中的对比(标源,非个人裁决):

本次只记录 garak 的公开定位和插件式测试结构,不把不同工具的测试结果直接比较。[S1]

8. 信息缺口与后续观察

  1. 需针对目标模型、语言和业务场景选择 probe,并保存可复现配置。
  2. 应关注 detector 的误报、漏报和人工复核流程。

9. 归纳洞察 ★

garak 的价值不在于给模型贴上“安全”或“不安全”的单一标签,而在于把失败模式拆成可配置的探测和判定流程。安全团队若要把结果用于决策,还需要把扫描输出接回具体风险、复现证据和修复验证。

10. 来源与更新时间

  • 信息截至(as_of): 2026-07-31
  • 最后复查(last_checked): 2026-07-31
  • 最后更新(last_updated): null
来源索引

可追溯来源

  1. [S1]Tier1NVIDIA/garak GitHub Repository访问日期 2026-07-31