把文件变成知识库!这款Skill让AI检索完全不依赖云端API

你有没有遇到过这种情况——给AI丢了一堆文档,想让它当”知识库“用,结果它根本答不上来,或者回答得乱七八糟?

问题出在哪?不是AI不行,是你没给它配一个靠谱的检索层

今天挖到一个有意思的Skill,叫 creating-kb——它干的活,就是帮你把一堆文件,变成一个AI能精准检索的知识库。

它能做什么?

一句话:把任意文件变成可分发的 .skill 知识库包

传统的RAG方案,得搭向量数据库、配embedding模型、接API……一套下来光部署就够你喝一壶的。creating-kb 完全不同——它用的是纯BM25倒排索引,打包出来的是一个.skill文件(本质上就是个zip),里面自带搜索引擎,完全不依赖任何外部模型,也不走网络

具体怎么跑?三步:

  1. 收集文件——把要索引的md、txt、html文件扔到一个目录
  2. 构建包——跑一行Node脚本,自动分块、建BM25索引、打包
  3. 分发——把.skill文件扔给任何Agent,解压就能查

整个过程没有API调用、没有模型下载、即开即用。

核心优势在哪?

便携性拉满。 传统方案里,embedding模型和数据是绑定的——换个大模型、换台机器、换个平台,往往意味着重新折腾一遍。creating-kb输出的包是纯 lexical 的,任何能跑Node或Python的环境都能直接查询,不挑食。

索引质量有保障。 BM25是信息检索领域老牌算法,比朴素的关键词匹配聪明太多——它会考虑词频、文档长度、IDF权重,实测在真实语料上召回率相当能打。而且因为chunk策略灵活(默认整文档作为一个chunk),对小文件场景尤其友好。

推理层交给上层。 它的设计很聪明——检索层和推理层完全解耦。.skill包只负责召回最相关的chunk,语义理解/回答生成交给调用它的Agent自己来。这样你就能针对不同模型、不同场景灵活搭配,不用担心”某模型不支持某embedding维度”这种破事。

适合谁用?

  • 经常要给Agent喂内部文档的同学
  • 需要跨Agent/跨平台共享知识的场景(比如团队里多个Claude实例要共用一份知识库)
  • 对数据隐私有要求、不能走云端API的场景(完全离线,安全感💯)
  • 想快速搭演示/概念验证RAG pipeline的研究者

怎么装?

npx skills add https://github.com/oaustegard/claude-skills --skill creating-kb

装完跟Claude说”帮我把这些文档打包成知识库”,它就懂了。

一点局限

BM25毕竟是词匹配,不是语义搜索——如果你的语料里关键信息表述非常多样(比如同一概念有几十种不同说法),召回率会受影响。这种时候还是得上embedding方案。

但对于结构化程度高、表述相对一致的文档集,creating-kb 的体验非常顺滑,而且整个链路透明可控——你很清楚它在做什么、怎么做的。


GitHub: https://github.com/oaustegard/claude-skills ⭐ 148

(Skill在 creating-kb 子目录)


GitHub: https://github.com/oaustegard/claude-skills

评论区

0 条评论

登录后可评论。

拾遗·Skill精选官 82 阅读