视觉模型看到的东西太多了?一个可学习的检索token把KV缓存的干扰降了九成

多模态大模型处理图片和视频的时候,有个很反直觉的问题:模型看到的东西越多,效果反而越差。因为视觉token全量灌入KV缓存,干扰信号太多,检索时精度就下去了。

HuggingFace今日热门有一篇新论文ReToken,就是专门解决这个问题的——让模型学会只记住重要的视觉token。


问题在哪?

视觉语言模型(VLM)的标准做法是:把一张图片切成一堆patch,每个patch过一个视觉编码器,变成一串token,全部塞进KV缓存。图片小还好,一旦涉及到高分辨率图、多图、或者视频,token数量直接爆炸。

问题就来了:这些token里,真正和用户问题相关的可能只有5%,剩下95%都是背景干扰。模型在这么多噪声里捞答案,精度自然下降。

ReToken怎么做的?

ReToken的思路很直接——加一个可学习的检索token,专门负责从视觉KV缓存里挑出相关的那部分。

具体来说:

  1. 图片先过视觉编码器,正常生成所有视觉token,填满KV缓存
  2. 额外引入一个或几个learnable query token
  3. 这个query token通过attention机制,从全量视觉KV缓存里挑出相关性最高的token
  4. 最终只有稀疏的、query相关的视觉token参与后续推理

整个训练只需要一个小的image-QA数据集,不需要大规模预训练。论文在Visual Haystacks和LVBench两个基准上测了:Qwen3VL-8B提升13.4点,InternVL3.5提升12.4点,提升幅度超过20%。

为什么这个方向值得前端工程师关注?

很多人觉得这是纯模型侧的优化,和前端没关系。但实际看下来,至少有两个场景直接相关:

第一个是浏览器端的多模态AI。现在Chrome DevTools MCP、Safari MCP这些工具已经可以把整个页面DOM吐给VLM分析,图片、SVG、截图全在里面。如果要做实时分析,token数量会非常大——ReToken这种稀疏检索思路,可以帮助在端侧低显存环境下跑更大的图。

第二个是RAG管线优化。很多前端团队现在已经在搭AI搜索服务,文档里配图多的场景,ReToken的思想可以直接迁移:不要全量把图片向量存进去,而是用query-driven的稀疏检索挑相关内容。

关键数据

Qwen3VL-8B在Visual Haystacks上提升13.4pts(超过20%相对提升),InternVL3.5提升12.4pts。Qwen3VL-8B在LVBench的zero-shot长视频迁移任务上提升8.0pts。训练和长视频推理都能在单张H100上跑完,硬件门槛不高。

怎么用?

GitHub上有代码:https://github.com/avashao/ReToken

如果你在用VLM做视觉检索,或者在搭多模态RAG,可以把这个思路引入你的pipeline——加一个learnable query token做稀疏检索,比全量灌入的baseline效果好很多,而且不增加推理延迟。

这个方向目前还在早期,但sparse visual retrieval这个赛道今年明显在加速。如果你在做前端+AI的多模态相关工作,建议关注。

评论区

0 条评论

登录后可评论。

AI 论文日报 1700 阅读