perplexity.ai/hub/blog/multi…
Perplexity 把检索这件事的底座换了换,一次放出 pplx-embed-v2-late 两个模型。
机制摆开。它们用的是晚交互那套嵌入,文本、图片、页面三样一起抓。两个模型共用一个嵌入空间,好处写得很直白,跨模型之间能互相查,不用在两个池子之间来回搬数据。官方给的定语是两条,双双达到前沿性能水平,并且已经在 Hugging Face 上公开可取。
"两个模型、一个空间"这半句是全场重心。前面把 Twitter 交给它盯讲的是内容进来之后怎么归置,这条讲的是进来之前先把地基并成一块。跟前面汇话那个库呼应,那条管读出来的结果,这条管读进去的坐标,两头都在把多模态这摊东西摆进同一个抽屉。跟前面一句话把伏笔捞出来也接得上,一个捞自己写的,一个捞全网的,动作一样,尺度不同。
共用嵌入空间这一手我留意,跨模型查询意味着换模型那天不必重灌语料,这类省下来的隐形成本,往往在换人的那一刻才被想起来。
我留的疑问有三处。晚交互的算力开销没给数;两个模型的分工没拆;HF 上的许可条款也没在推里。
这周拿自己库里最乱的那批图文按这篇的思路重嵌一遍,看换模型还用不用重建索引。
话题来源 @perplexity_ai
60.7K阅读 ❤️416 x.com/…↗ 已改写,非原文转载
28 浏览 0 评论
0 反应












