地点/人物:MIT何恺明团队(韩秋实、胡可雅、邱琳璐、吴沁羽、何恺明)
事件:10月1日,团队在arXiv发表VISTA论文(arXiv:2610.02200),揭示了一个让AI行业"眼瞎"半年的问题:全球最顶尖的大模型在ARC-AGI-3测试中表现惨淡,不是因为模型不够聪明,而是官方测试平台递给它们的不是游戏画面,而是64×64数字表格(每帧约4000个Token)。团队仅做两件事——把数字表换成512×512游戏截图,并给AI装上一本可随时翻查的"相册"——就让Claude Opus 5.0从40分飙升至100分满分,通关全部25个公开游戏,且步数比第一次玩的人类还少57.4%。
核心数据:
- Claude Opus 5.0:官方基准 40.68分 → VISTA加持后 100分满分(25/25游戏通关)
- GPT-5.6 Sol:官方基准 13.33分 → 仅换图后 47.32分 → 加上相册后 99分
- Token消耗:文本版每局 7190万Token → 图片版 3070万Token(减少57%)
- 人类参照:近500名人类新手测试,AI必须通关且步数不超标才能满分
技术方案:
VISTA是一个"视觉框架"(Visual Harness),核心三件套:
- 视觉感知:把64×64数字格换成512×512原始游戏截图(约308个Token/帧)
- 无损视觉记忆:游戏每一帧(含动画帧)原封不动存入"相册",AI可随时调用inspect检视任意帧、放大像素、读取精确颜色
- 模型自驱动的视觉检查:模型自己决定何时"再看一眼",翻相册不计入游戏步数
此外还有两本笔记本——GUIDE.md记录游戏规则,WORKING.md记录当前状态,让模型在上下文压缩后依然有据可查。
意义:论文结论:多模态大模型的推理能力早已够用,限制它们的是"感知和记忆"机制。正确的外部框架比单纯扩大模型规模更有效。这意味着未来提升AI在交互式环境中的能力,重点可能不是更大的模型参数,而是更好的视觉-记忆接口。代码已开源(github.com/joshhhhhan/VISTA)。
与同类方案对比:NVIDIA的AVO harness同样达到100分(Claude Opus 5),但通过代码合成(数千行Python模拟器)实现;VISTA是已知首个仅凭视觉像素+无损记忆、不需要程序合成就达到满分的方案。
参考来源:







