SkillCorpus:把散落的 SKILL.md 文件聚合为可检索的 Agent 技能库

SkillCorpus:把散落的 SKILL.md 文件聚合为可检索的 Agent 技能库

SKILL.md 散落各处、版本不一、质量参差——这是 AI Agent 生态当下最尴尬的现状。SkillCorpus 想解决的就是这个问题:一条开源 pipeline,把 GitHub 上散布的 SKILL.md 文件自动聚合、去重、质量评估,最后输出结构化、可检索、Agent 直接能用的技能语料。截至 2026-09-02,GitHub 获星 445,累计更新活跃。

功能与原则

SkillCorpus 是 EverMind 团队开源的技能语料工程系统,核心是「从分散到有序」的 pipeline:

  • 聚合:自动抓取 GitHub 上公开的 SKILL.md,按仓库 / 作者 / 更新时间归档
  • 安全门控:检查每个技能的许可证,剔除侵权或恶意内容
  • 质量评估:内置评估套件,给每个技能打质量分
  • 检索匹配:根据 Agent 当前任务,从语料库里选出最相关的 0–2 个技能注入上下文
  • 导出:输出格式兼容 OpenClaw、Hermes、DeepSeek Harness 等主流 Agent 框架

设计原则是「让技能像库函数一样被复用」——不是让开发者手工管理提示词,而是让 Agent 在需要时自动查到正确的那份 SKILL.md。

认可度

  • GitHub Star:445(截至 2026-09-02,当日更新)
  • 背后团队 EverMind 运营 SkillHub(evermind.ai/skillhub),有完整的托管服务
  • 有 arXiv 论文(arXiv:2607.15557)背书,学术属性强
  • 2026-09-02 刚发布支持 OpenClaw 2.0 的更新,属于近期热点

链接

GitHub:https://github.com/EverMind-AI/SkillCorpus

原作者

EverMind AI 团队(EverMind-AI),专注于 Agent 记忆与技能基础设施,旗下还有 SkillHub 托管平台和多个 Agent 中间件项目。

介绍

AI Agent 要想真正发挥作用,需要的不只是大模型,还需要「技能」——即告诉 Agent「遇到 X 场景应该调用哪个工具、哪段流程」的操作手册。SKILL.md 正是这个场景下的事实标准,但它散落在数万个大大小小的仓库里,版本混乱、质量参差,无法被 Agent 自动发现和使用。

SkillCorpus 从这个痛点切入,提供一套完整的开源工具链:自动采集 GitHub 上所有公开的 SKILL.md 文件,按许可证过滤脏数据,用评估模块给每个技能打分,最后通过检索层让 Agent 在执行任务时动态获取最相关的那几条技能。整个流程可以本地部署,也可以接入 SkillHub 的托管 API。

核心价值是把「手工维护 Agent 提示词」变成「自动化的技能检索」——相当于给 Agent 配了一个懂行的图书管理员,而不是让它靠猜测在大量文档里大海捞针。

特点

  • 自动聚合:GitHub 扫描 + 本地 pipeline,无需手工整理
  • 许可证门控:自动过滤无许可证或传染性许可证的技能,避免法律风险
  • 质量评估:内置 Benchmark + 评分卡,每个技能有可参考的质量信号
  • 多框架兼容:OpenClaw 2.0、Hermes、DeepSeek Harness、WorkBuddy 等均有官方插件
  • 检索精确:每次任务最多注入 0–2 个最相关技能,控制上下文膨胀

使用方法

本地安装(Python)

pip install skill-corpus

基础使用

# 初始化语料库(从 GitHub 拉取所有公开 SKILL.md)
skill-corpus init

# 在任务中检索相关技能
skill-corpus search "write unit test for python function"

# 导出供 Agent 使用
skill-corpus export --format openclaw --output ./my-skills/

Python API

from skillcorpus import Corpus, SkillRetriever

corpus = Corpus.from_github()
retriever = SkillRetriever(corpus)

# 根据当前任务获取最相关的技能
skills = retriever.retrieve("fix authentication token expiry bug")
print(skills[0].content)  # 直接注入 Agent 上下文

接入 OpenClaw

# 2026-09-02 更新的 OpenClaw 2.0 插件
skill-corpus plugin install openclaw

使用场景与人群

适用场景

  • 企业内部搭建 Agent 技能中台,需要统一管理分散在各团队的 SKILL.md
  • Agent 开发者希望给自家框架增加「从大量技能里自动选一个」的能力
  • AI 产品在构建 Agent 能力层时,需要可量化的技能质量评估

目标用户

  • Agent 框架开发者(需要底层技能检索基础设施)
  • AI 产品工程师(需要让 Agent 调用标准化技能而非长篇 prompt)
  • 研究者(论文已发,可复现 SkillCorpus 的评估方法)

输入与输出案例

案例 1:按任务检索技能

Input(Agent 请求):

"帮我给这个 REST API 写集成测试,覆盖认证和限流两个模块"

SkillCorpus 检索后输出:

[Skill: api-testing-best-practices]
内容:从 HTTP method、header 构造、mock server 三个维度给出测试模板,
      附 pytest 示例代码,兼容 RESTful 和 GraphQL。
[Skill: rate-limiting-test-patterns]
内容:限流测试的边界条件清单,包括 429 响应解析、重试策略验证、
      本地时间穿越技巧。

案例 2:语料库初始化

Input(开发者操作):

skill-corpus init --sources "github --language python --min-stars 10"

Output:

✅ 扫描完成,共发现 3,241 个仓库含 SKILL.md
⏳ 许可证检查中...
✅ 通过安全门控:2,891 个技能
📊 质量评估完成,平均分 0.73
🔖 语料库已保存至 ~/.skillcorpus/corpus.db

GitHub: https://github.com/EverMind-AI/SkillCorpus

评论区

0 条评论

登录后可评论。

Skill超级捕获手 12 阅读