Utopia Skill:本地优先的文档转本体知识图谱工作台 MCP 原生集成
Utopia 是一个本地优先、Agent 驱动的文档转本体知识图谱工作台,2026 年 8 月 8 日上线 GitHub,仅用约一个月便积累近 5000 Star。它不是又一个 RAG 工具,而是把知识治理的完整链路——文档抽取、语义建模、冲突检测、人工审核、版本追溯——全部收敛到一个 Rust + PostgreSQL 的自托管平台里。最大亮点是双时态图谱:每条事实同时记录「有效时间段」和「入库时间」,可以随时回溯任意时刻的实体关系图,再配合 MCP 协议让 AI Agent 直接读写上下文,这是当前大多数知识库做不到的。
核心能力与设计原则
Utopia 的设计目标是让知识治理从一次性的 LLM 输出变成可审查、可版本化、可协作的生产流程。核心能力包括:
- 文档接入:支持 PDF、Markdown、HTML、PPT、Word、Excel、网页、RSS、GitHub、Jira、Notion、WebDAV、S3 兼容存储,并可定时同步
- 语义抽取:实体、关系与时间归一化;事实强制带证据引句;向量召回与本体召回经 LLM 裁决自动消歧,结果可追溯可撤销
- 双时态图谱:记录「有效时间」与「溯源时间」两个维度,支持任意时刻的图谱快照和知识变更链
- 冲突检测:捕捉时态冲突、自反/反对称/传递环违规、基数违规,并提供「撤回事实/放宽公理/接受并存」三种处理路径
- Ontology2SQL:将自然语言问题转换为 SQL 查询,在 BIRD Mini-Dev 上取得 SQLite 和 PostgreSQL 的 SOTA
- 人工审核台账:低置信抽取和待合并候选自动进入审核队列,每次操作记录用户、时间和变更快照
- Agent Harness:内置 MCP Server,AI Agent 可以通过对话调用文档搜索、图谱查询、数据库映射等全部工具
认可度
- GitHub Star:约 4,994(截至 2026-09-06)
- GitHub Forks:452
- 最后推送:2026-09-06(今日),仍处于高度活跃开发状态
- 上线约一个月即进入 GitHub Trending 周榜 AI 方向 TOP 10
- 技术定位在 RAG 与传统知识图谱之间,属于较为独特的细分赛道
链接
GitHub 仓库:https://github.com/deeplethe/utopia
原作者
项目由 deeplethe(GitHub username)维护,Apache-2.0 开源协议。核心贡献者仅 1 人,但维护频率极高,路线图清晰、社区讨论活跃。
介绍
Utopia 诞生于一个核心观察:现有的知识管理工具要么只做文档 RAG(检索增强生成),要么只做静态知识图谱,都无法解决「知识在组织内流转时会产生冲突、版本漂移和人工误判」这个根本问题。
它的解决思路是把文档转知识图谱这件事做成一整套本地优先的协作平台:文档通过连接器接入后,LLM 负责抽取实体、关系和时态信息,结果进入审核台账,由领域专家确认后写入双时态图谱。图谱支持 ontology-driven querying,即可以针对图谱结构本身提问,系统自动生成 SQL 路径。
同时,Utopia 自身就是一台 AI Agent 的运行底座:内置 MCP Server,Agent 可以自主调用文档检索、图谱探索和数据库映射工具,不需要额外配置 LangChain 或 LlamaIndex。这对于需要让 AI 在内部知识库中做事实核查和推理的场景,有直接的工程价值。
特点
- Rust + PostgreSQL 单栈:一个 Docker 镜像加一个 PostgreSQL(带 pgvector),无需 Elasticsearch 或独立向量服务,运维成本低
- 内置五种本体包:schema.org、W3C Org、PROV-O、FOAF、IOF Core,开箱即可用,也可以接入自定义本体
- Ontology2SQL 领先:在 BIRD Mini-Dev 基准上取得 SQLite/PostgreSQL 双 SOTA,复杂自然语言问数可以直接转换为 SQL
- MCP 原生集成:Agent 通过 MCP 协议与平台交互,支持 MCP 上的 Agent 记忆(episode 写入和 retrieve 端点)
- 多用户权限体系:以知识库为单位,支持 owner、admin、editor、viewer 四级角色,公共知识库对所有部署内用户可读
使用方法
快速启动(Docker):
git clone https://github.com/deeplethe/utopia.git
cd utopia
docker compose --profile app up -d
# 打开 http://localhost:1516 注册首个账户(自动成为管理员)
配置模型端点:首次使用需在「管理 → 模型」中配置 chat 和 embedding 端点(支持任何 OpenAI 兼容端点,也支持 DeepSeek、Qwen、Ollama、vLLM,可离线部署)。
源码构建(需 Rust 1.85+、Node 20+、pnpm):
docker compose -f docker-compose.yml -f docker-compose.build.yml --profile app up -d --build
Agent MCP 调用示例:通过 MCP 协议,Claude Code 等 Agent 工具可以直接连接 Utopia 的 MCP Server,执行文档检索和图谱查询,无需额外部署。
使用场景与人群
- 适用场景:企业内部知识治理、政策文档管理、技术文档可追溯化、AI Agent 的长期记忆底座、数据库与文档的联合查询
- 目标用户:知识工程师、本体论研究者、AI Agent 开发者、需要私有化部署知识库的团队
输入与输出案例
输入:
用户上传一份 PDF 格式的产品规格文档,Utopia 的 LLM 抽取后给出:「实体:Product-X(产品),Price(属性,USD),Release-Date(属性);关系:Product-X has-component Sub-A;有效时间:2025-01-01 ~ 2026-06-30」。
输出:
经过人工审核确认后,该信息写入双时态图谱——可以查看 Product-X 在 2025 年中的组件关系是什么样,也可以回溯 Sub-A 何时被添加进规格。Agent 通过 MCP 问「Product-X 在 2025 年有哪些组件?」,系统返回历史快照视图,附带证据引句指向 PDF 原文位置。
Utopia 把「文档 → 知识图谱」这件事从一次性的 LLM 调用,升级成了一整套有时间维度、有人工治理、有 Agent 接入的工程系统。对于需要构建可信、可追溯知识库的开发者和团队,这是一个值得关注的开源选择。
评论区
登录后可评论。