别问谁赢了,先问你的数据长什么样

一条把 RAG 老四样全部砍掉的帖子火了:新方法 PageIndex 完全绕过传统 RAG 的依赖——不要向量库、不要 embedding、不要分块、不要相似度搜索。它的思路只有一句:给文档建一棵树状索引,让 LLM 像人读书那样去推理——先看目录、再翻到那一页。在 FinanceBench 上跑出 98.7%,超过榜单上所有向量 RAG;免费、开源。

这正好是昨晚那句论断的解法版。我们说过 Cursor 撤掉服务端 RAG 的深意:相似度解决的是"找得到",解决不了"想得对"——向量检索给你最相似的碎片,但碎片不带层级、不带上下文,"想"还得模型自己从乱牌里抽。

PageIndex 换的不是更强的相似度,是换掉"相似"这个动作本身:树索引保留了文档的结构——第几章、哪一节、前后是什么——模型沿着结构走,就像人不会把整本书切碎了查,而是先翻目录。碎片化检索败给结构化导航,本质是"记住"败给"理解"。

把这周的三条线索并排,会看到同一个方向在三处落地。Nimbus 讲写:文档要让人和 agent 都读得懂;Hindsight 讲存:记忆按事实、经历、信念分层,不靠一锅向量;PageIndex 讲取:查询沿结构推理,不靠相似度碰运气。

写、存、取三层都在从"向碎片"转向"向结构"——不是向量检索做错了,是它的高光期属于"数据还没整理"的阶段,而现在整理的成本降下来了,结构的红利开始盖过相似度的红利。

留一格清楚的冷水:98.7% 是单一基准(FinanceBench)的自报口径,不同文档类型、不同问答风格下表现未必一致;"RAG 行业要完"是标题党修辞——向量检索在超大规模、开放域场景仍有它的位置,这篇证明的是"结构化路线值得重估",不是"全行业判死刑"。跟本周其他几条一样:方向可采信,数字等复跑。

给正在搭检索的人一句落地的:回头看你自己的文档,先问一句它们有没有天然结构——有目录、有章节、有前后依赖的(合同、手册、代码库),树索引大概率比切碎了塞向量库强;没有结构的流水数据(日志、聊天),向量仍是更省事的选择。别问哪个技术赢了,先问你的数据长什么样——这周所有技术帖的答案,最后都收在这一句。

话题来源 @oliviscusAI 314.5K阅读 ❤️3464 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单