GPT-5.5 做 4×4 拼图 70% 准确率,8×8 直接崩到接近随机——这件事今天被一个基准测试彻底扒开了

拼图是人类觉得再简单不过的视觉任务:把凹凸不平的碎片拼成完整图案。但一篇新论文证明了一件让很多人没想到的事——当前最强的多模态大模型,做 4×4 的小拼图还行,一旦碎片数量上去,整个就崩了,而且不是因为数据不够用,是架构本身就缺了那种能力。

评测基准长什么样

这篇论文(JigShapearXiv:2607.27670)设计了一个严格得多的拼图基准。过去很多视觉推理 benchmark 用矩形切割,碎片之间没有凹凸关系,纹理重复区域会产生歧义,ground truth 本身就不可靠。JigShape 用了咬合式切割(tab-and-blank interlocking pieces),每个碎片的边缘都是确定的凹凸关系,局部兼容性约束和视觉内容联合推理,才能得到唯一的正确解。

95,000 个实例,四种网格密度:4×4、8×8、12×12、16×16。

核心数据:scaling cliff

这是最让人意外的部分。

零样本测试结果:

  • 5 个前沿模型里,只有 GPT-5.5 在 4×4 超过随机基线,其他模型全部处于随机水平
  • GPT-5.5 在 4×4 拼图:70% 准确率
  • GPT-5.5 在 8×8 拼图:直接跌到接近随机

监督微调后的结果:

  • 4×4 拼图:>97% 准确率,看起来很强
  • 12×12 拼图:<5%,几乎完全崩溃
  • 16×16:更惨

这个现象论文称之为 scaling cliff:不是性能缓慢下降,而是在某个规模门槛突然崩塌。微调可以让模型在小规模任务上表现极好,但一旦碎片数量超过某个临界点,所有模型无一例外地失效。

为什么这件事有意思

拼图看起来是「视觉」任务,但真正难的部分是几何约束推理。每个碎片放在某个位置,不仅要考虑它看起来对不对,还要检查它和上下左右四个邻居的边缘是否咬合。这种约束满足能力是独立于图像内容的——无论图片是风景、人物还是抽象图案,拼图的结构逻辑是一样的。

当前 VLMs 擅长的是「这张图看起来像什么」——视觉内容匹配。它们能做到在简单场景下凭纹理线索猜对几张碎片的位置,但当碎片数量增加,约束数量指数级上升,模型就无法维持一致的约束满足。

这和传统 benchmark 上刷分是完全不同的能力维度。

更大的问题:这个坑不只是拼图

论文的核心结论是:scaling cliff 揭示的是当前架构的根本性局限,不是靠更多数据或更大模型就能自动解决的。几何约束满足能力是视觉推理的基础模块,它在拼图上是 8×8 崩溃,但把它换成更复杂的空间推理任务——多物体关系推理、3D 场景理解、物理模拟校验——本质上面对的是同一类约束满足问题。

如果模型在拼图上 8×8 就崩了,指望它可靠地完成需要多步空间推理的生产任务,目前来看是有结构性风险的。

论文信息

  • 标题:JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
  • 作者:Shawn Li 等(14 位作者,含 Mohit Bansal、Yue Zhao)
  • arXiv:2607.27670(2026-07-30 提交,2026-08-04 更新 v2)
  • 95K 实例,4 种网格密度(4×4 到 16×16),已开源

评论区

0 条评论

登录后可评论。

AI 论文日报 13 阅读