security-audit-skill:让 AI 编程助手自动做安全审计的六阶段流水线
Cloudflare 开源了一个将 AI 编程助手转变为安全审计师的 Skill——security-audit-skill。它通过六阶段流水线(侦察→狩猎→验证→报告→结构化输出→独立核查),让 Claude Code、Codex 等 Agent 自动对代码库进行深度安全审计,并输出可机读的漏洞报告。相比人工逐行审查,这套工作流能并行调度多个子 Agent,从注入、访问控制、业务逻辑、加密等不同角度同时出击,还能复用历史审计结果持续深挖。GitHub 2026 年 6 月上线,当前进度 2,766 ⭐,由 Cloudflare 安全 AI 研究团队维护并持续更新。
功能与原则
核心能力:六阶段流水线安全审计,覆盖完整攻击面。
- Recon:并行侦察 Agent 绘制应用架构、信任边界和输入面,产出 architecture.md
- Hunt:并行泛化 Agent 从注入、访问控制、业务逻辑、加密、特性滥用、链式攻击、wildcard 等多角度出击,每个 Agent 可衍生子 Agent 深挖
- Validate:独立 Agent 尝试反驳每条发现,用对抗性审查消灭误报
- Report:产出 REPORT.md(人类可读)和 FINDINGS-DETAIL.md(MEDIUM+ 详细trace)
- Structured Output:输出 findings.json,遵循 report-schema.json schema,由 validate-findings.cjs 校验
- Independent Verification:全新 Agent 独立核查 structured output 中每条事实性声明是否与实际源码一致
设计原则:
– 只报能利用的漏洞,每条发现需要具体攻击场景
– 对抗性验证:发现者和验证者不是同一个 Agent
– 严重性 = 可能性 × 影响,而非偏离检查清单的程度
– 纵深防御缺口不算漏洞
– 多次运行结果可叠加,不同运行探索不同代码路径
认可度
- GitHub Star:2,766 ⭐(截至 2026-08-07)
- 创建时间:2026 年 6 月,上线约 6 周即突破 2.7k ⭐,增长迅速
- 更新时间:2026-08-06,最近更新
- 维护方:Cloudflare 安全 AI 研究团队,工程化程度高
- Trending:在 GitHub trending 和 weekly 热榜上亮相,被多家技术媒体报道
链接
GitHub:https://github.com/cloudflare/security-audit-skill
原作者
Cloudflare(@cloudflare)
Cloudflare 是全球领先的互联网基础设施和安全公司,其安全 AI 研究团队专注于用 AI 技术革新漏洞发现流程。该 Skill 脱胎于 Cloudflare 内部漏洞发现系统(相关博客:Build your own vulnerability harness),是内部系统的单仓库开源版本。
介绍
安全审计向来是人力密集型工作——需要懂架构、懂攻击、懂防御的工程师反复审视代码库,还要在误报和漏报之间找平衡。Cloudflare 发布的 security-audit-skill 将这一流程自动化,核心思路是让多个专业 Agent 并行作战。
第一步是侦察(Recon):多个 Agent 同时研究代码库,梳理出架构图、信任边界和所有输入面。产物是一份 architecture.md,成为后续阶段的基础。
第二步是狩猎(Hunt):这是最核心的阶段。并行 Agent 分别从注入、访问控制、业务逻辑、加密、API 滥用、链式攻击等角度展开搜索,每个 Agent 还能衍生子 Agent 继续深挖。一个 Agent 找到了注入点,另一个可能找到了越权路径,彼此独立、互不干扰。
第三步验证(Validate):用从未参与过发现的全新 Agent 去反驳每条发现。对抗性审查会淘汰大部分误报,保证最终输出的可信度。
第四步报告(Report)和第五步结构化输出(Structured Output):传统安全报告是给人看的;这个 Skill 同时产出 findings.json,用 schema 规范化漏洞描述,包含漏洞类型、严重性、利用路径、修复建议等字段,可直接导入漏洞管理系统。
第六步独立核查(Independent Verification):又一个全新 Agent 将 findings.json 中的每条事实声明与源码对照,核查是否有引用错误或夸大描述。
多次运行的结果可叠加:每次运行会读取历史 findings.json,已知漏洞跳过,专注新发现的不同代码路径。单次运行约能发现多轮累计漏洞总量的一半。
特点
- 六阶段流水线:侦察→狩猎→验证→报告→结构化输出→独立核查,覆盖完整审计生命周期
- 并行多 Agent 架构:一次调用调度多个专业 Agent 并行工作,大幅提升审计覆盖面
- 对抗性验证机制:发现者与验证者分离,最大程度减少误报
- 机器可读输出:原生输出符合 JSON Schema 的 findings.json,可对接企业内部漏洞管理平台
- 支持多种目标:覆盖 Web 协议和认证、客户端/浏览器(DOM 注入、UI 欺骗)、AI/LLM 安全(提示注入、工具滥用)、原生二进制(内存安全、内核)等
- 多次运行叠加:历史结果复用,专注新发现,审计深度随运行轮次线性增长
- 零额外依赖:validate-findings.cjs 零依赖,Node.js 即可运行 schema 校验
使用方法
安装(通过 Skills CLI):
npx skills add https://github.com/cloudflare/security-audit-skill
--skill security-audit
全局安装(用户级):
npx skills add https://github.com/cloudflare/security-audit-skill
--skill security-audit
--global
基本调用:在目标代码库目录启动 Claude Code(或 Codex 等支持的 Agent),直接下达指令:
security audit this codebase
find security vulnerabilities in ./src
do a security review, output to ~/audits/my-project
Skill 会自动识别触发词(security audit / find vulnerabilities / pen-test 等),无需手动激活。
前置依赖:
– 支持工具调用和并行子 Agent 的 AI 编程助手(Claude Code、Codex CLI、Cursor 等)
– Node.js(用于 validate-findings.cjs 进行 Phase 5 的 JSON schema 校验)
输出目录:默认输出至 ~/security-audit-skill/<repo-name>/run-<N>,也可在指令中指定路径。
使用场景与人群
适用场景:
– 正式上线前的代码安全审查
– 第三方依赖包引入前的安全评估
– CI/CD 流水线中的自动化安全门禁
– 渗透测试前的快速踩点
– LLM 后端应用的安全审计(提示注入、工具滥用检测)
目标用户:
– 安全工程师:需要快速对大量代码库做初步扫描
– 开发团队:没有专职安全人员的中小团队,需要在发版前自检
– 平台工程师:在 CI/CD 中嵌入自动化安全检查
– AI 研究者:对 AI 安全审计有兴趣,了解 LLM Agent 攻击面
输入与输出案例
输入示例 1:
security audit this codebase, output to ~/audits/my-api
Agent 自动识别为安全审计任务,激活 skill,进入六阶段流水线。
输出示例 1:
~/audits/my-api/
├── architecture.md # 阶段1:架构与攻击面图
├── REPORT.md # 阶段4:人类可读报告
├── FINDINGS-DETAIL.md # 阶段4:详细攻击路径trace
├── findings.json # 阶段5:结构化漏洞数据
└── run-1/ # 本轮运行记录
输入示例 2(针对 AI/LLM 应用):
do a security review on the LLM backend module
Skill 识别为 LLM 目标,自动加载 AI-AND-LLM.md 中的提示注入和工具滥用狩猎规则,对 LLM 输入处理、工具调用链、输出处理进行专项审计。
输出示例 2(部分 findings.json):
{
"findings": [
{
"id": "LLM-001",
"severity": "HIGH",
"type": "prompt-injection",
"title": "Unsanitized user input in system prompt construction",
"attack_scenario": "Attacker controls field 'username' which is directly concatenated into system prompt, enabling role confusion.",
"exploit_path": "src/llm_handler.js:42 → systemPrompt += username",
"likelihood": "HIGH",
"impact": "MEDIUM",
"recommendation": "Validate and escape all user-controlled fields before prompt construction."
}
]
}
每个 finding 包含 ID、严重性、类型、标题、具体攻击场景、利用路径、可能性评估、影响评估和修复建议,格式可直接导入 Jira 或内部漏洞管理系统。
评论区
登录后可评论。