别再用向量库做 RAG 了:PageIndex 把这件事彻底翻了个底朝天
把”相似度”当成”相关性”,这件事在 2026 年终于被拉下神坛。
过去三年 RAG 系统几乎都长一个样:文档切块 → 灌进向量库 → 相似度检索 → 喂给 LLM。但凡做过金融研报、法律合同、技术手册检索的人都知道,相似度检索在专业领域是个伪命题——你要的不是”看起来像”,而是”真的对”。
这就是 PageIndex 想解决的事。它来自 VectifyAI/PageIndex,GitHub 已突破 33,410 stars,最近一周日均新增 200+,被开发者社区认为是”Vectorless RAG”风潮的开源标杆。
它做了什么:扔掉向量数据库,让 LLM 自己推理
PageIndex 的思路很反常识——直接把向量数据库和分块干掉。具体两步:
- 先把长文档变成一棵树:用 LLM 自动提取文档的目录结构,生成层级 tree,类似”目录页”但每个节点都带摘要。
- 再让 LLM 在树上做检索:Agent 读章节标题、推理哪棵子树最可能命中、走过去。整个过程是 reasoning-based 的,不是 cosine 距离。
灵感来自 AlphaGo 的 tree search。开发者把它叫做”vectorless RAG“,或者更直白:”人类专家怎么翻手册,它就怎么检索。”
实战表现:FinanceBench 拿下 98.7%
数据是最有说服力的部分。PageIndex 在 FinanceBench 这个金融问答评测集上拿到 98.7% 准确率,是目前开源方案里最高一档。这个 benchmark 一直让传统向量 RAG 灰头土脸——专业文档里”相似度不等于相关性“这件事,靠相似度搜索是真做不到。
更关键的是可追溯:返回结果带页码和章节引用,不是”向量 ID 482739″那种黑盒。在合规、金融、医疗这些需要审计的场景,这点比准确率还重要。
接入门槛:三条命令搞定
PageIndex 的接入设计非常克制:
- 自托管:
pip install pageindex→ 配 OpenAI key →python3 run_pageindex.py --pdf_path xxx.pdf即可生成 tree。 - MCP 集成:已经发布官方 MCP server,可以直接接进 Claude Code、Cursor 或任何 MCP 客户端。
- Cloud 版本:不想折腾的可以直接用 PageIndex Chat 或 API,秒级上手。
它还配套了 Vision-based Vectorless RAG notebook——OCR 都不需要,直接对 PDF 页面图像做推理检索。这对扫描件、复杂排版文档是个福音。
为什么技术先锋们都在转
2026 年已经有至少 5 个团队公开主张:embedding → 向量库 → 检索这条流水线是 2022 年的架构。PageIndex 是把这件事说得最响、star 最多的开源代表。
如果你正在做:
- 金融研报 / 财报 / 监管文件检索
- 法律合同 / 合规审查系统
- 学术论文 / 技术手册问答
- 任何需要可追溯、带引用回答的 RAG 应用
那 PageIndex 几乎是 2026 年绕不开的一个项目。
GitHub 链接:https://github.com/VectifyAI/PageIndex (33.4k stars,MIT 协议,可商用)
评论区
登录后可评论。