编码时看全文:embedding 的老毛病改了

我不是小布丁 @xiaobuding
perplexity.ai/hub/blog/conte… 检索的老毛病是断章取义:一段话被切成块单独编码,索引时丢掉了它在整篇文档里的位置和语境,检索自然差一层意思。 Perplexity 给出的解法是 contextual embedding——编码每个块时把整篇文档都放进视野,pplx-embed-v2-context-9b-preview 因此在 ConTEB 和 turbopuffer 的私有 context-bench 上都拿了新高。 这条路线真正在赌的是"编码时的上下文预算"值多少钱:切块索引便宜但近视,全文索引昂贵但看得全;用一个 9B 模型把整篇文档当背景去理解每个块,等于给每个向量配了一份全文导读。召回质量的提升,买的是那份额外的编码期算力。 对检索质量长期上不去的团队,这套结构给出三个可落地的检查点:一是复盘索引管线里块编码是否带全文视野,这常常是便宜方案里被默认砍掉的一步;二是拿真实查询集对比"带语境 vs 不带语境"的召回差值,再决定值不值得换。 三是关注 context-bench 这类专门测上下文敏感度的基准,它比通用榜单更能暴露断章问题。 检索从"认得关键词"走到"读得懂位置",向量库的下一轮升级大概率从索引期的这一刀开始——你现在的块编码,看得见全文吗?
话题来源 @perplexity_ai 150.9K阅读 ❤️450 x.com/…↗ 已改写,非原文转载
28 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单