你的Agent Skill到底有没有用?NVIDIA开源三段式评估框架

你有没有遇到过这种情况:写了一个 Agent Skill,发到 GitHub,Star 不少,但到底有没有用?谁也说不清。

这就是 NVIDIA 推出 SkillEvaluator 的出发点——用工程化的三段式流水线,给 Skill 的质量打一个客观分。

这个框架在解决什么问题?

现在的 Skill 生态有个怪现象:写得长 = 质量好,Star 多 = 效果好。但现实是,一个 2000 行的 SKILL.md 可能在重复说明同一个规则,多个 Skill 之间可能大量重叠,而”实际有没有帮到 Agent”这件事,从来没人测过。

SkillEvaluator 把 Skill 质量评估拆成三层,每层回答一个独立的问题:

  • Tier 1 – Validation:安全吗?结构对吗? 离线跑 Schema 检查、PII 扫描、License 验证、质量打分(0~100 分 + A~F 等级)、Unicode 安全、脚本 Lint。这一层不需要 API Key,skillevaluator validate ./my-skill --checks schema,pii,license,quality,unicode,lint --no-dedup 装完直接跑。
  • Tier 2 – Deduplication:有没有重复或重叠? 用 Embedding + LLM 分析 Skill 内部和跨 Skill 的语义重叠,解决的是”上下文值不值得每次都塞给 Agent”的问题。需要配置 Embedding Provider。
  • Tier 3 – Live Evaluation:真的提升 Agent 表现了吗? 在沙箱里跑 Agent,对比”有用 Skill”和”没用 Skill”两组实验,计算 Skill Lift。需要 Agent CLI(Claude Code / Codex)+ Docker 环境。

实测效果

官方用 6 个 Benchmark × 7 个目标模型 × 3 种执行 Harness(direct chat / Codex CLI / Claude Code CLI)做了一轮全覆盖实验。核心指标是 Skill Lift:Agent 加载 Skill 后相对 Baseline 的实际提升。

这比看 SKILL.md 字数或 GitHub Star 有说服力得多。

技术细节

  • 语言:Python(3.13 + uv)
  • License:Apache-2.0
  • 安全扫描依赖 SkillSpector(NVIDIA 自研)
  • Live Eval 底层用 Harbor 框架(开源 Agent 评测引擎)
  • Tier 3 支持 Docker、本地 OS、云沙箱三种模式
  • 免费 Tier:NVIDIA Build API Key(Nemotron-3-nano-30B 模型)可直接用

怎么快速上手

一行命令装完,不需要克隆仓库:

uv tool install --python 3.13 "skillevaluator[all] @ git+https://github.com/NVIDIA/SkillEvaluator.git@v0.1.0"

然后随便找一个 Skill 目录跑 Tier 1:

skillevaluator validate ./my-skill --checks schema,pii,license,quality,unicode,lint --no-dedup

30 秒出报告,没有任何副作用——这个工具本身就是给 Skill 作者做”发布前自检”用的。

为什么这很重要

Skill 生态正在从”有就好”走向”质量可信”。随着企业内 Skill 数量增加,靠人工 review 已经不够用了。SkillEvaluator 提供的是一套可重复的质量门禁——它不排名谁更好,它回答三个最基本的问题:这个 Skill 是不是认真做的?它和现有的有没有撞车?它真的帮到 Agent 了吗?

把这三个问题答清楚,比写一千字 README 有价值得多。

GitHub:https://github.com/NVIDIA/SkillEvaluator


GitHub: https://github.com/NVIDIA/SkillEvaluator

评论区

0 条评论

登录后可评论。

陈一铭 16 阅读