别再用向量库做 RAG 了:PageIndex 把这件事彻底翻了个底朝天

把”相似度”当成”相关性”,这件事在 2026 年终于被拉下神坛。

过去三年 RAG 系统几乎都长一个样:文档切块 → 灌进向量库 → 相似度检索 → 喂给 LLM。但凡做过金融研报、法律合同、技术手册检索的人都知道,相似度检索在专业领域是个伪命题——你要的不是”看起来像”,而是”真的对”。

这就是 PageIndex 想解决的事。它来自 VectifyAI/PageIndex,GitHub 已突破 33,410 stars,最近一周日均新增 200+,被开发者社区认为是”Vectorless RAG”风潮的开源标杆。

它做了什么:扔掉向量数据库,让 LLM 自己推理

PageIndex 的思路很反常识——直接把向量数据库和分块干掉。具体两步:

  • 先把长文档变成一棵树:用 LLM 自动提取文档的目录结构,生成层级 tree,类似”目录页”但每个节点都带摘要。
  • 再让 LLM 在树上做检索:Agent 读章节标题、推理哪棵子树最可能命中、走过去。整个过程是 reasoning-based 的,不是 cosine 距离。

灵感来自 AlphaGo 的 tree search。开发者把它叫做”vectorless RAG“,或者更直白:”人类专家怎么翻手册,它就怎么检索。”

实战表现:FinanceBench 拿下 98.7%

数据是最有说服力的部分。PageIndex 在 FinanceBench 这个金融问答评测集上拿到 98.7% 准确率,是目前开源方案里最高一档。这个 benchmark 一直让传统向量 RAG 灰头土脸——专业文档里”相似度不等于相关性“这件事,靠相似度搜索是真做不到。

更关键的是可追溯:返回结果带页码和章节引用,不是”向量 ID 482739″那种黑盒。在合规、金融、医疗这些需要审计的场景,这点比准确率还重要。

接入门槛:三条命令搞定

PageIndex 的接入设计非常克制:

  • 自托管pip install pageindex → 配 OpenAI key → python3 run_pageindex.py --pdf_path xxx.pdf 即可生成 tree。
  • MCP 集成:已经发布官方 MCP server,可以直接接进 Claude Code、Cursor 或任何 MCP 客户端。
  • Cloud 版本:不想折腾的可以直接用 PageIndex Chat 或 API,秒级上手。

它还配套了 Vision-based Vectorless RAG notebook——OCR 都不需要,直接对 PDF 页面图像做推理检索。这对扫描件、复杂排版文档是个福音。

为什么技术先锋们都在转

2026 年已经有至少 5 个团队公开主张:embedding → 向量库 → 检索这条流水线是 2022 年的架构。PageIndex 是把这件事说得最响、star 最多的开源代表。

如果你正在做:

  • 金融研报 / 财报 / 监管文件检索
  • 法律合同 / 合规审查系统
  • 学术论文 / 技术手册问答
  • 任何需要可追溯、带引用回答的 RAG 应用

那 PageIndex 几乎是 2026 年绕不开的一个项目。

GitHub 链接https://github.com/VectifyAI/PageIndex (33.4k stars,MIT 协议,可商用)


GitHub: https://github.com/VectifyAI/PageIndex

评论区

0 条评论

登录后可评论。

陈一铭 10 阅读