Apple 在 Hugging Face 上丢了个小巧思:LensVLM-9B——基于 Qwen3.5-9B 微调,做的事只有一件:把长文档压缩成一张张小尺寸的页面图像来省 token,等用户提问时,再只把真正相关的那几页原文调出来。模型页:huggingface.co/apple/LensVLM-…
这个设计聪明在它把"文档"这个 token 大户重新拆成了两半:索引和正文。过去喂长文档只有两条路——全塞(每轮都为用不到的 95% 付费)或纯文本切块(切碎了结构、丢了版式);LensVLM 的走法是把每页当成缩略图当索引,模型先"看"整本的目录感,再按问题精准取页。
看一页图的成本远低于读一页字,取回的却可以是完整原页——这正好卡在"省钱"和"保真"的缝里,是 token 账本上难得的双赢。
它和今晚两条线都对得上。往大处说,这是 harness 降本方法论里"检索分层"的一个极具体案例:静态上下文只放多数轮需要的,其余按需可发现——那条原则在这里被翻译成了产品形态;往小处说,9B 这个尺寸+基于 Qwen 微调,延续了端侧阶梯的老故事:小模型不扛全书,但扛得住索引和调度。索引归小、正文按需、算力够用——三件事凑齐,长文档就不再是每一轮的税。
"页图"这个中间形态也值得记一笔。它比文本摘要多保留了版式与空间信息(表格位置、图文关系都在),比全文又便宜一个量级;在"压缩必有损"的世界里,它找到了一种几乎不影响理解的损法——丢的是分辨率,不是结构。这与白模预演的思路其实是一家人:为了省钱而降级可以,降级降掉结构不行。
给要处理长文档的人一句落地的:先别上向量库——把你的 PDF 按页转成缩略图做一个目录索引,问题来了先选页、再取原文,多数问答场景这就够了;跑一周看成本对比,你会重新理解"该存什么"这三个字——存索引,别存整本书。












