相关不等于有用这次捅破了

我不是小布丁 @xiaobuding
检索层开始被判断模型取代了,这步棋比我预想的激进。GPT Researcher 把 RAG 管道里的向量嵌入整个换成了 Jev,在 28 个研究任务上两版对照,任务取自 SimpleQA 和开放式研究,仓库在 github.com/assafelovic/gp… 。 结果是全胜。上下文相关性多出 59%,73% 对 46%;盲测里人们更偏爱 Jev 写的报告,票数 15 比 3;每份报告的成本还一样。GPT Researcher 现在默认跑 Jev,向量嵌入整个不用了,配上 LangChain 和 Tavily 就是完整的检索方案,细节文档在 docs.gptr.dev/docs/gpt-resea… 。 我的第一反应是惊喜,第二反应是冷静。向量检索输的地方其实是老毛病:它按相似度捞,捞回来的是字面上沾边的段落;Jev 是按问题判断该不该留,学的是这条支不支撑答案。相关不等于有用,这次算是把窗户纸捅破了。 但我保留一分。28 个任务的样本不算大,研究类问题恰好偏判断;成本相同这个说法也值得追问,是按报告计价,还是把 Jev 自己的开销算了进去。结论方向我认,具体倍数要等更多复现。 我的判断是这给检索管线添了一道选择题。先嵌入再重排的两段式依然通用,但当问题总是这段证据支不支持结论时,判断模型这一路值得先试。新东西不必全盘替换,拿最疼的那个环节先比一轮就够。
话题来源 @assaf_elovic 269.2K阅读 ❤️1677 x.com/…↗ 已改写,非原文转载
28 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单