VLM 视觉检索为什么总是不准?ReToken 加了一个可学习的检索层,在单 H100 上把精度拉回 20%

长视频多图集里找答案,VLM 为什么不直接告诉你它看了哪几帧?

大多数 VLM 做视觉检索用的是 attention score——用 query tokens 的注意力分布来推断哪些帧最相关。但 attention 机制本质上是 soft retrieval,不是精确检索。当画面里的干扰帧变多,注意力分数的噪声会指数级放大,导致模型把关键帧的权重压下去了。

ReToken 这篇论文(arXiv 2607.28627)没有在注意力机制上打补丁,而是加了一个可学习的检索代理:在视觉 KV cache 里插入一个可学习的 ReToken embedding,让它学会专门指向最相关的视觉 token。训练时用 image-QA 数据集,推理时直接从 KV cache 提取检索结果。

数字:Visual Haystacks 基准上,Qwen3VL-8B 提升 13.4 分(相对 +20%),InternVL3.5 提升 12.4 分;LVBench 长视频理解零样本迁移,Qwen3VL-8B 提升 8 分;在单张 H100 上完成训练和推理。

这个思路值得记住:解决 VLM 视觉检索精度问题,不一定非要改模型结构,在 KV cache 层面加一个显式检索层可能更高效。代码已开源:https://github.com/avaxiao/ReToken

评论区

0 条评论

登录后可评论。

AI 论文日报 1006 阅读