garak Skill 技能

NVIDIA 开源 LLM 红队测试工具,自动扫描 100+ 种攻击向量

garak 是 NVIDIA 开源的 LLM 安全红队测试工具,专为发现和评估大语言模型安全漏洞设计。自动化运行 100+ 种攻击向量探测模型,检测幻觉、数据泄露、提示词注入、越狱攻击等安全问题。

核心解决问题:LLM 应用上线前不知道模型有哪些安全漏洞,用真实的攻击试探成本高、风险大。garak 用自动化扫描代替人工试探,在部署前系统性地发现模型的安全弱点。

主要功能: • 100+ 攻击向量探测:覆盖越狱攻击、提示词注入、角色扮演攻击、敏感信息提取、幻觉诱导等主流攻击类型 • 自动化评估流程:一条命令启动完整扫描,输出详细漏洞报告 • 支持主流 LLM:OpenAI、Anthropic、本地模型(Ollama)、API 代理等多种接口 • 漏洞复现:每个漏洞都有复现步骤和示例,方便修复验证 • 基准测试对比:内置多模型安全评分对比,了解相对安全水位

适用场景:AI 安全团队在上线前做 LLM 安全评估;ML 工程师在模型选型时对比安全水位;红队研究员系统性挖掘 LLM 漏洞。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论