把文件变成知识库!这款Skill让AI检索完全不依赖云端API
你有没有遇到过这种情况——给AI丢了一堆文档,想让它当”知识库“用,结果它根本答不上来,或者回答得乱七八糟?
问题出在哪?不是AI不行,是你没给它配一个靠谱的检索层。
今天挖到一个有意思的Skill,叫 creating-kb——它干的活,就是帮你把一堆文件,变成一个AI能精准检索的知识库。
它能做什么?
一句话:把任意文件变成可分发的 .skill 知识库包。
传统的RAG方案,得搭向量数据库、配embedding模型、接API……一套下来光部署就够你喝一壶的。creating-kb 完全不同——它用的是纯BM25倒排索引,打包出来的是一个.skill文件(本质上就是个zip),里面自带搜索引擎,完全不依赖任何外部模型,也不走网络。
具体怎么跑?三步:
- 收集文件——把要索引的md、txt、html文件扔到一个目录
- 构建包——跑一行Node脚本,自动分块、建BM25索引、打包
- 分发——把
.skill文件扔给任何Agent,解压就能查
整个过程没有API调用、没有模型下载、即开即用。
核心优势在哪?
便携性拉满。 传统方案里,embedding模型和数据是绑定的——换个大模型、换台机器、换个平台,往往意味着重新折腾一遍。creating-kb输出的包是纯 lexical 的,任何能跑Node或Python的环境都能直接查询,不挑食。
索引质量有保障。 BM25是信息检索领域老牌算法,比朴素的关键词匹配聪明太多——它会考虑词频、文档长度、IDF权重,实测在真实语料上召回率相当能打。而且因为chunk策略灵活(默认整文档作为一个chunk),对小文件场景尤其友好。
推理层交给上层。 它的设计很聪明——检索层和推理层完全解耦。.skill包只负责召回最相关的chunk,语义理解/回答生成交给调用它的Agent自己来。这样你就能针对不同模型、不同场景灵活搭配,不用担心”某模型不支持某embedding维度”这种破事。
适合谁用?
- 经常要给Agent喂内部文档的同学
- 需要跨Agent/跨平台共享知识的场景(比如团队里多个Claude实例要共用一份知识库)
- 对数据隐私有要求、不能走云端API的场景(完全离线,安全感💯)
- 想快速搭演示/概念验证RAG pipeline的研究者
怎么装?
npx skills add https://github.com/oaustegard/claude-skills --skill creating-kb
装完跟Claude说”帮我把这些文档打包成知识库”,它就懂了。
一点局限
BM25毕竟是词匹配,不是语义搜索——如果你的语料里关键信息表述非常多样(比如同一概念有几十种不同说法),召回率会受影响。这种时候还是得上embedding方案。
但对于结构化程度高、表述相对一致的文档集,creating-kb 的体验非常顺滑,而且整个链路透明可控——你很清楚它在做什么、怎么做的。
GitHub: https://github.com/oaustegard/claude-skills ⭐ 148
(Skill在 creating-kb 子目录)
评论区
登录后可评论。