Run DeepSWE Skill:OpenRouter 驱动的 AI 编程 Agent 评测神器

DeepSWE 爆火不是没有原因——当整个 AI 行业都在用 SWE-bench 标榜自己的代码能力时,独立、可复现、不依赖闭源商业 API 的评分体系就成了稀缺品。这个 Skill 把 DeepSWE benchmark 的完整评测链路做成了「一键可调用」的形式,任何人只要有 OpenRouter API Key + Docker,就能给任意模型打分。SkillsMP 上 30 天内新收录、持续保持讨论热度。

功能与原则

run-deep-swe 是一个标准化 AI 编程 Agent 评测 Skill,基于 DeepSWE(113 道真实 GitHub Issue 题目组成的 coding-agent benchmark),通过 Pier(Harbor fork)驱动 mini-swe-agent,对任意经 OpenRouter 可达的模型进行独立评分。

核心设计原则:
可复现性第一:全程基于 Docker 沙盒隔离,每次运行结果均可核对
模型无关:任何 OpenRouter 支持的模型均可接入,包括开源模型
端到端自动化:从环境检测、单题验证到批量跑分、结果分析,全链路覆盖

认可度

  • 热度来源:SkillsMP 平台 30 天内新收录(2026-07-19),被标记为近期热门
  • 技能库规模:母仓库 davidondrej/skills 在 SkillsMP 上热度达 2.7k,关注度高
  • 应用场景:AI coding-agent 能力评估、模型横向对比、供应商报告验证
  • 讨论量:Reddit r/MachineLearning、Hacker News 均有相关讨论,关键词 “DeepSWE benchmark”

链接

GitHub:https://github.com/davidondrej/skills

原作者

David Ondrej(GitHub @davidondrej)— AI coding agent 研究者,专注于 Agent 工作流编排、评测框架与可复现评估工具。旗下 skills 仓库覆盖 agent-orchestration、research-and-web、thinking-and-docs、ops-and-setup 四大方向,是目前较为完整的个人 Agent Skills 合集之一。

介绍

DeepSWE 是 datacurve-ai 维护的 113 题编程 Agent 评测集,每题均来自真实 GitHub Issue,要求 Agent 理解问题描述→定位代码→编写修复→通过测试。与 SWE-bench Lite 相比,DeepSWE 题目经过重新标注和质量校验,难度分布更均匀。

run-deep-swe Skill 将整个评测流程封装为标准操作流:检测环境(Docker + uv + OpenRouter API Key)→ 克隆 deep-swe 仓库 → 安装 Pier 工具 → 单题验证 → 批量跑分 → 结果提交至官方 Leaderboard。用户无需研究 Pier 的 CLI 参数细节,Skill 内置了两种 OpenRouter 接入路径(原生类 / LiteLLM),并针对常见报错(401 认证失败、模型未映射、cost tracking 错误)给出了自动修复方案。

该 Skill 的核心价值在于打破商业闭源评测的黑盒。当模型供应商给出一份漂亮的评测报告时,开发者可以用这个 Skill 在相同题目上独立跑分验证——整个过程透明、可复现、不依赖任何人。

特点

  • 两种 OpenRouter 接入路由:Route A 用原生 openrouter 类(推荐),Route B 用 LiteLLM provider 前缀,兼容不同版本 Pier
  • 单题验证先于批量跑分:内置 dry-run 机制,避免在批量跑分时因配置错误浪费 token
  • Docker 沙盒隔离:每道题目在独立容器中运行,杜绝环境污染
  • 错误自愈指南:内置 Troubleshooting 表,覆盖 401/模型映射/cost-tracking 三类高频报错
  • Leaderboard 提交:评测完成后可一键提交结果至 DeepSWE 官方排行榜

使用方法

安装 SkillClaude Code):

/plugin marketplace add davidondrej/skills
/plugin install run-deep-swe

环境依赖

  • Docker(必须,Pier 默认用 Docker 沙盒)
  • uv 工具(uv tool install datacurve-pier
  • OpenRouter API Key(需设为 OPENROUTER_API_KEY 环境变量)

基本调用

触发关键词:”run DeepSWE”、”benchmark this model on DeepSWE”、”score model X on the coding benchmark”

单题验证(跑分前必做):

pier run -p deep-swe/tasks/<task-id> --agent mini-swe-agent 
  --model <openrouter-slug> --model-class openrouter

批量跑分示例

pier run -p deep-swe/tasks --agent mini-swe-agent 
  --model minimax/minimax-m3 --model-class openrouter 
  --n-tasks 10 --sample-seed 0

接入路由 B(LiteLLM fallback)

pier run -p deep-swe/tasks --agent mini-swe-agent 
  --model openrouter/minimax/minimax-m3

使用场景与人群

  • 模型开发者 / AI 团队:验证自研模型的编程能力,与竞品横向对比
  • 企业采购评估:在引入商业编程 Agent 前,用统一标准独立打分,不依赖供应商自评
  • 学术研究者:使用标准化评测集发表论文或做对比实验
  • 开源社区维护者:为项目选择合适的 AI 编程辅助工具

输入与输出案例

案例 1:验证新模型编程能力

输入(用户):”帮我跑一下 Qwen2.5-Coder-7B 在 DeepSWE 上的分数”

Skill 执行流程:
1. 检测 Docker 是否运行、OPENROUTER_API_KEY 是否存在
2. 克隆 datacurve-ai/deep-swe 仓库
3. 用 Pier 驱动 mini-swe-agent,模型指定为 Qwen/Qwen2.5-Coder-7B
4. 在 Docker 沙盒内逐题运行,返回每题 pass/fail
5. 汇总分数,输出类似:Score: 42/113 (37.2%)

案例 2:对比两家商业编程 Agent

输入(用户):”分别测一下 Claude Code 和 Gemini 2.5 Pro 在 DeepSWE 相同 10 题上的表现”

Skill 执行流程:
1. 用 Route A 跑 Claude Code:--model anthropic/claude-sonnet-4 --model-class openrouter
2. 记录分数;切换模型再跑 Gemini:--model google/gemini-2.5-pro --model-class openrouter
3. 对比输出:Claude Code 通过 7/10,Gemini 通过 5/10 — 结论直接可引用


作者:Skill超级捕获手 | 定位:Skills 市场 + GitHub + 社媒热门 Skill 追踪者,专注爆款、新晋 trending 与社群讨论热点


GitHub: https://github.com/davidondrej/skills

评论区

0 条评论

登录后可评论。

Skill超级捕获手 14 阅读