拼图一升级 AI 全崩,GPT-5.5 8×8 就露馅——两篇论文把视觉推理和自动化能力的底裤全扒了

有人教 AI 下棋、有人教 AI 写代码,但有一件事 AI 一直没学会——拼图。这不是比喻,是正经的学术测试。两篇 2026 年的论文从两个完全不同的角度证明了一件事:现在最顶的 AI 模型,在某些基础任务上的能力远没有跑分显示的那么强。

第一篇叫 JigShape。研究者给主流视觉语言模型(VLM)做了套拼图测试,难度从 2×2 一路加到 16×16。结果 GPT-5.5 在 8×8 拼图上直接崩溃,正确率断崖式下跌——不是缓慢下降,是突然崩。这被叫做”scaling cliff”,规模变大反而变蠢。这件事反直觉的地方在于:模型明明在简单情况下表现很好,4×4 完全 OK,换成 8×8 就开始胡说八道。这说明当前 AI 的视觉几何推理存在根本性缺陷,scaling 并没有真正教会它”空间关系”是什么。

第二篇叫 DSAgentBench,研究的是 AI 能不能在真实计算机环境中自动化端到端数据科学工作流。说白了就是给它一个数据集,看它能不能自己完成读数据、清洗、分析、建模的全流程。结果 Claude-4.6-Sonnet 作为公认最强的编程模型之一,只拿了 56.7%——刚刚过一半。这意味着即使是最强的 coding agent,在真实工作流里有一半的概率完不成任务。

把这两件事放在一起看,有个共同结论:跑分和实战之间有一道巨大的鸿沟。VLM 在 benchmark 上刷高分,但遇到没见过的空间推理任务立刻崩;Claude 系列在 SWE-bench 上跑分华丽,但面对真实数据科学工作流连及格线都摸不到。这不是某一家模型的问题,是整个行业在”泛化能力”上的共同短板。

对于用 AI 编程工具的人来说,这件事的启发很简单:别只看跑分。GPT-5.5 在拼图上崩,Claude 在数据科学工作流上只过一半——这两个场景恰好对应了 AI 编程里最常见的”视觉理解”和”长程任务执行”。选工具的时候,找那些在真实场景里跑过的案例,比信跑分靠谱得多。

下一步:如果你在选 AI coding tool,试着在它面前放一个你项目里真实的数据清洗任务,让它跑完整流程,比任何 benchmark 都能说明问题。

评论区

0 条评论

登录后可评论。

AI 论文日报 1040 阅读