SkillsBench:给AI编程工具量能力的尺子,1.7k Stars的评测基准

Claude Code 写了个 Skill,怎么知道它到底靠不靠谱?光自己跑两遍不够,得有个客观尺子。

SkillsBench 就是这把尺子。它专门评测 AI 编程 Skill 和 Agent 的实际效果,核心思路很简单:给一堆真实开发任务,看 AI 工具能不能独立完成、完成质量怎么样。

测什么?

框架围绕 CLI 开发场景设计,任务覆盖这几类:

  • 单元测试生成:给定函数/模块,AI 能不能自动写出覆盖合理的测试用例
  • CLI 工具构建:能不能从零搭出一个完整的命令行工具,参数解析、帮助文档、错误处理都在线
  • 多步流水线:需要串起多个步骤才能完成的任务,AI 能不能规划好路径
  • 复杂约束任务:带边界条件、性能要求的任务,看 AI 的天花板在哪

怎么量化?

SkillsBench 给出明确的统计指标:

  • Median: 3 tests per task(大多数任务 3 个测试用例是合理中位数)
  • Ceiling: >10 tests 需要额外说明(防止刷指标)
  • 分 Terminal-Bench 1.0 和 2.0 两个版本,2.0 任务更复杂,89 个任务平均 3.5 个测试

也就是说,如果你的 Skill 生成结果远低于中位数线——那大概率是 prompt 或工具链设计出了问题。

为什么值得关注?

现在 AI 编程工具井喷,Claude Code、Cursor、Windsurf、Codex……每个都说自己强,但谁来证明?SkillsBench 提供了统一的可信评测标准。它的评测结果(公开在官网)可以帮你:

  • 横向对比不同 Agent 的能力边界
  • 验证你定制的 Skill 是否真的提升了开发效率
  • 给团队选型 AI 编程工具提供数据依据

框架本身是开源的,Apache-2.0 协议,可以本地跑,也可以贡献新任务到 benchmark 里。

快速上手

SkillsBench 的 GitHub 仓库里有完整的任务定义文档和评测脚本。开发者只需要:

  • fork 仓库,按格式提交自己的 Skill 或 Agent 评测结果
  • 参考 docs/unit-test-guidelines.md 了解评测标准
  • 使用官网 skillsbench.ai 可视化查看横向对比数据

GitHub 上 74 位贡献者、1.7k Stars 的体量,说明这个方向确实有人在认真做。对 AI 编程工具的开发者来说,这是一份值得收藏的能力地图。

GitHubhttps://github.com/benchflow-ai/skillsbench


GitHub: https://github.com/benchflow-ai/skillsbench

评论区

0 条评论

登录后可评论。

江望 15 阅读