Knowledge Pipeline:把文档编译成可推理的知识体系,而不是每次从零 RAG
LLM 每次回答你的问题,都是”从零思考”吗?
传统 RAG 把文档切成碎片、向量检索、拼给模型——本质上是个”搜索引擎”,不是”思考系统”。你喂它 30 篇论文,它只是把相关段落找出来,不是真正理解知识之间的关系。
Knowledge Pipeline 走了一条完全不同的路:它把文档编译成一座可推理的知识体系,而不是每次从零检索。
核心思路:从”检索”到”编译”
摄入文档时,Pipeline 不只做文本提取,而是构建三类页面:
- 📄 源页面——每份文档一个 markdown 文件
- 🔵 实体页面——从文档中提取的关键人物、概念、数据
- 💡 概念页面——跨文档共享的高层概念,关联关系自动标注
这就是它的核心创新:RAG 在文本碎片里找答案,Knowledge Pipeline 在概念网络中做推理——即使没有文档直接讨论某个问题,它也能通过概念关系网络推导出来。
一个具体例子
你丢进去 18 份文档(论文 + 审计报告 + 新闻),Pipeline 编译成:
- 23 个实体页面
- 36 个概念页面
- 3 处跨文档矛盾(自动检测并标注)
你问一个没有任何文档直接讨论的问题——”AI 在 2026 年是否会引起程序员失业?”
RAG 做法:搜索”失业”相关文本片段 → 找不到 → 用自身知识泛泛而谈。
Pipeline 做法:在概念网络中推理——论文的”算法编码” + Claude Code 的”$2.5B ARR” → AI 正在大规模替代编码工作;论文的”不对称相似度发现” = 创造性洞察 → 无法被自动化;医学的”临床判断”≈ 工程的”架构决策” → 需要上下文推理的工作不会消失。
结论:不是”失业”,而是”分层淘汰”——带引用、带推理链、带知识图谱可视化。
其他亮点
- 矛盾检测:文档 A 说增长 30%,文档 B 说下降 15%?摄入时立即标注,不会在答案里随机选一个
- 交互式推理图:每次深度回答生成 vis.js 知识图谱,可视化推理路径
- LivePPT:基于编译好的知识网络生成幻灯片,内容有深度、每页标注来源
- 本地运行:支持 Ollama,数据不出机;也支持 DeepSeek、火山引擎等任意 OpenAI 兼容 API
- 零代码:5 个斜杠命令搞定所有操作,不需要写 pipeline
安装使用
一行安装:
npx skills add YesIamGodt/knowledge-pipline
Claude Code 内斜杠命令:
/pipeline-ingest— 摄入文档(PDF/图片/视频/Word/Excel)/pipeline-query— 查询,加”推理链“关键词自动启用深度推理/pipeline-graph— 构建交互式知识图谱/pipeline-ppt— 基于知识网络生成有深度的 PPT
区别于 NotebookLM 的锁定 Google 生态、RAG 的碎片检索、ChatGPT 的每次从零开始——Knowledge Pipeline 把 LLM 变成了真正的”知识编译器”,越用越聪明。
GitHub:https://github.com/YesIamGodt/knowledge-pipline
评论区
登录后可评论。