security-audit-skill:让 AI 编程助手自动做安全审计的六阶段流水线

Cloudflare 开源了一个将 AI 编程助手转变为安全审计师的 Skill——security-audit-skill。它通过六阶段流水线(侦察→狩猎→验证→报告→结构化输出→独立核查),让 Claude Code、Codex 等 Agent 自动对代码库进行深度安全审计,并输出可机读的漏洞报告。相比人工逐行审查,这套工作流能并行调度多个子 Agent,从注入、访问控制、业务逻辑、加密等不同角度同时出击,还能复用历史审计结果持续深挖。GitHub 2026 年 6 月上线,当前进度 2,766 ⭐,由 Cloudflare 安全 AI 研究团队维护并持续更新。

功能与原则

核心能力:六阶段流水线安全审计,覆盖完整攻击面。

  • Recon:并行侦察 Agent 绘制应用架构、信任边界和输入面,产出 architecture.md
  • Hunt:并行泛化 Agent 从注入、访问控制、业务逻辑、加密、特性滥用、链式攻击、wildcard 等多角度出击,每个 Agent 可衍生子 Agent 深挖
  • Validate:独立 Agent 尝试反驳每条发现,用对抗性审查消灭误报
  • Report:产出 REPORT.md(人类可读)和 FINDINGS-DETAIL.md(MEDIUM+ 详细trace)
  • Structured Output:输出 findings.json,遵循 report-schema.json schema,由 validate-findings.cjs 校验
  • Independent Verification:全新 Agent 独立核查 structured output 中每条事实性声明是否与实际源码一致

设计原则
– 只报能利用的漏洞,每条发现需要具体攻击场景
– 对抗性验证:发现者和验证者不是同一个 Agent
– 严重性 = 可能性 × 影响,而非偏离检查清单的程度
– 纵深防御缺口不算漏洞
– 多次运行结果可叠加,不同运行探索不同代码路径

认可度

  • GitHub Star:2,766 ⭐(截至 2026-08-07)
  • 创建时间:2026 年 6 月,上线约 6 周即突破 2.7k ⭐,增长迅速
  • 更新时间:2026-08-06,最近更新
  • 维护方:Cloudflare 安全 AI 研究团队,工程化程度高
  • Trending:在 GitHub trending 和 weekly 热榜上亮相,被多家技术媒体报道

链接

GitHub:https://github.com/cloudflare/security-audit-skill

原作者

Cloudflare(@cloudflare)
Cloudflare 是全球领先的互联网基础设施和安全公司,其安全 AI 研究团队专注于用 AI 技术革新漏洞发现流程。该 Skill 脱胎于 Cloudflare 内部漏洞发现系统(相关博客:Build your own vulnerability harness),是内部系统的单仓库开源版本。

介绍

安全审计向来是人力密集型工作——需要懂架构、懂攻击、懂防御的工程师反复审视代码库,还要在误报和漏报之间找平衡。Cloudflare 发布的 security-audit-skill 将这一流程自动化,核心思路是让多个专业 Agent 并行作战。

第一步是侦察(Recon):多个 Agent 同时研究代码库,梳理出架构图、信任边界和所有输入面。产物是一份 architecture.md,成为后续阶段的基础。

第二步是狩猎(Hunt):这是最核心的阶段。并行 Agent 分别从注入、访问控制、业务逻辑、加密、API 滥用、链式攻击等角度展开搜索,每个 Agent 还能衍生子 Agent 继续深挖。一个 Agent 找到了注入点,另一个可能找到了越权路径,彼此独立、互不干扰。

第三步验证(Validate):用从未参与过发现的全新 Agent 去反驳每条发现。对抗性审查会淘汰大部分误报,保证最终输出的可信度。

第四步报告(Report)和第五步结构化输出(Structured Output):传统安全报告是给人看的;这个 Skill 同时产出 findings.json,用 schema 规范化漏洞描述,包含漏洞类型、严重性、利用路径、修复建议等字段,可直接导入漏洞管理系统。

第六步独立核查(Independent Verification):又一个全新 Agent 将 findings.json 中的每条事实声明与源码对照,核查是否有引用错误或夸大描述。

多次运行的结果可叠加:每次运行会读取历史 findings.json,已知漏洞跳过,专注新发现的不同代码路径。单次运行约能发现多轮累计漏洞总量的一半。

特点

  • 六阶段流水线:侦察→狩猎→验证→报告→结构化输出→独立核查,覆盖完整审计生命周期
  • 并行多 Agent 架构:一次调用调度多个专业 Agent 并行工作,大幅提升审计覆盖面
  • 对抗性验证机制:发现者与验证者分离,最大程度减少误报
  • 机器可读输出:原生输出符合 JSON Schema 的 findings.json,可对接企业内部漏洞管理平台
  • 支持多种目标:覆盖 Web 协议和认证、客户端/浏览器(DOM 注入、UI 欺骗)、AI/LLM 安全(提示注入、工具滥用)、原生二进制(内存安全、内核)等
  • 多次运行叠加:历史结果复用,专注新发现,审计深度随运行轮次线性增长
  • 零额外依赖:validate-findings.cjs 零依赖,Node.js 即可运行 schema 校验

使用方法

安装(通过 Skills CLI):

npx skills add https://github.com/cloudflare/security-audit-skill 
  --skill security-audit

全局安装(用户级):

npx skills add https://github.com/cloudflare/security-audit-skill 
  --skill security-audit 
  --global

基本调用:在目标代码库目录启动 Claude Code(或 Codex 等支持的 Agent),直接下达指令:

security audit this codebase
find security vulnerabilities in ./src
do a security review, output to ~/audits/my-project

Skill 会自动识别触发词(security audit / find vulnerabilities / pen-test 等),无需手动激活。

前置依赖
– 支持工具调用和并行子 Agent 的 AI 编程助手(Claude Code、Codex CLI、Cursor 等)
– Node.js(用于 validate-findings.cjs 进行 Phase 5 的 JSON schema 校验)

输出目录:默认输出至 ~/security-audit-skill/<repo-name>/run-<N>,也可在指令中指定路径。

使用场景与人群

适用场景
– 正式上线前的代码安全审查
– 第三方依赖包引入前的安全评估
– CI/CD 流水线中的自动化安全门禁
– 渗透测试前的快速踩点
– LLM 后端应用的安全审计(提示注入、工具滥用检测)

目标用户
– 安全工程师:需要快速对大量代码库做初步扫描
– 开发团队:没有专职安全人员的中小团队,需要在发版前自检
– 平台工程师:在 CI/CD 中嵌入自动化安全检查
– AI 研究者:对 AI 安全审计有兴趣,了解 LLM Agent 攻击面

输入与输出案例

输入示例 1

security audit this codebase, output to ~/audits/my-api

Agent 自动识别为安全审计任务,激活 skill,进入六阶段流水线。

输出示例 1

~/audits/my-api/
├── architecture.md           # 阶段1:架构与攻击面图
├── REPORT.md                 # 阶段4:人类可读报告
├── FINDINGS-DETAIL.md       # 阶段4:详细攻击路径trace
├── findings.json             # 阶段5:结构化漏洞数据
└── run-1/                   # 本轮运行记录

输入示例 2(针对 AI/LLM 应用):

do a security review on the LLM backend module

Skill 识别为 LLM 目标,自动加载 AI-AND-LLM.md 中的提示注入和工具滥用狩猎规则,对 LLM 输入处理、工具调用链、输出处理进行专项审计。

输出示例 2(部分 findings.json):

{
  "findings": [
    {
      "id": "LLM-001",
      "severity": "HIGH",
      "type": "prompt-injection",
      "title": "Unsanitized user input in system prompt construction",
      "attack_scenario": "Attacker controls field 'username' which is directly concatenated into system prompt, enabling role confusion.",
      "exploit_path": "src/llm_handler.js:42 → systemPrompt += username",
      "likelihood": "HIGH",
      "impact": "MEDIUM",
      "recommendation": "Validate and escape all user-controlled fields before prompt construction."
    }
  ]
}

每个 finding 包含 ID、严重性、类型、标题、具体攻击场景、利用路径、可能性评估、影响评估和修复建议,格式可直接导入 Jira 或内部漏洞管理系统。


GitHub: https://github.com/cloudflare/security-audit-skill

评论区

0 条评论

登录后可评论。

Skill超级捕获手 9 阅读