你的Agent Skill到底有没有用?NVIDIA开源三段式评估框架
你有没有遇到过这种情况:写了一个 Agent Skill,发到 GitHub,Star 不少,但到底有没有用?谁也说不清。
这就是 NVIDIA 推出 SkillEvaluator 的出发点——用工程化的三段式流水线,给 Skill 的质量打一个客观分。
这个框架在解决什么问题?
现在的 Skill 生态有个怪现象:写得长 = 质量好,Star 多 = 效果好。但现实是,一个 2000 行的 SKILL.md 可能在重复说明同一个规则,多个 Skill 之间可能大量重叠,而”实际有没有帮到 Agent”这件事,从来没人测过。
SkillEvaluator 把 Skill 质量评估拆成三层,每层回答一个独立的问题:
- Tier 1 – Validation:安全吗?结构对吗? 离线跑 Schema 检查、PII 扫描、License 验证、质量打分(0~100 分 + A~F 等级)、Unicode 安全、脚本 Lint。这一层不需要 API Key,
skillevaluator validate ./my-skill --checks schema,pii,license,quality,unicode,lint --no-dedup装完直接跑。 - Tier 2 – Deduplication:有没有重复或重叠? 用 Embedding + LLM 分析 Skill 内部和跨 Skill 的语义重叠,解决的是”上下文值不值得每次都塞给 Agent”的问题。需要配置 Embedding Provider。
- Tier 3 – Live Evaluation:真的提升 Agent 表现了吗? 在沙箱里跑 Agent,对比”有用 Skill”和”没用 Skill”两组实验,计算 Skill Lift。需要 Agent CLI(Claude Code / Codex)+ Docker 环境。
实测效果
官方用 6 个 Benchmark × 7 个目标模型 × 3 种执行 Harness(direct chat / Codex CLI / Claude Code CLI)做了一轮全覆盖实验。核心指标是 Skill Lift:Agent 加载 Skill 后相对 Baseline 的实际提升。
这比看 SKILL.md 字数或 GitHub Star 有说服力得多。
技术细节
- 语言:Python(3.13 + uv)
- License:Apache-2.0
- 安全扫描依赖 SkillSpector(NVIDIA 自研)
- Live Eval 底层用 Harbor 框架(开源 Agent 评测引擎)
- Tier 3 支持 Docker、本地 OS、云沙箱三种模式
- 免费 Tier:NVIDIA Build API Key(Nemotron-3-nano-30B 模型)可直接用
怎么快速上手
一行命令装完,不需要克隆仓库:
uv tool install --python 3.13 "skillevaluator[all] @ git+https://github.com/NVIDIA/SkillEvaluator.git@v0.1.0"
然后随便找一个 Skill 目录跑 Tier 1:
skillevaluator validate ./my-skill --checks schema,pii,license,quality,unicode,lint --no-dedup
30 秒出报告,没有任何副作用——这个工具本身就是给 Skill 作者做”发布前自检”用的。
为什么这很重要
Skill 生态正在从”有就好”走向”质量可信”。随着企业内 Skill 数量增加,靠人工 review 已经不够用了。SkillEvaluator 提供的是一套可重复的质量门禁——它不排名谁更好,它回答三个最基本的问题:这个 Skill 是不是认真做的?它和现有的有没有撞车?它真的帮到 Agent 了吗?
把这三个问题答清楚,比写一千字 README 有价值得多。
GitHub:https://github.com/NVIDIA/SkillEvaluator
评论区
登录后可评论。