AI模型做8×8拼图直接崩了——两篇论文把视觉推理和自动化能力的底裤全扒了

今天看到两篇论文放在一起读,特别有意思:一个是测AI视觉推理极限的,一个是测AI数据科学自动化能力的。两个方向完全不同,但结论放在一起,让人后背发凉——最强的模型在这两个方向上,一个在8×8拼图前直接崩溃,一个在真实计算机环境里只能完成一半多的任务。

第一个是JigShape。

这是一个专门测VLM视觉语言模型几何推理能力的benchmark。原理很简单:给AI一张完整图片,然后切成N×N的碎片,打乱顺序,让它拼回去。难度可以从小到大调节——3×3、4×4、5×5,一直到更复杂的排列组合。

结果出来,整个行业都沉默了。

小尺寸拼图,各家模型表现还行。但当难度升到8×8,GPT-5.5直接崩溃——不是表现不好,是彻底乱拼,相邻碎片之间毫无逻辑连贯性。这不是性能瓶颈,这是能力边界。

更让人意外的是scaling cliff现象:模型能力不是线性提升的,不是越大的模型越好用,而是到某个临界点之后,突然断崖式下跌。这意味着厂商宣传的更大参数、更多训练数据,在视觉几何推理这个方向上,并不是万金油。

为什么重要?因为拼图背后是空间推理能力——机器人抓取物体、自动驾驶判断路况、AR应用里虚拟物体和真实场景的交互,全都需要这套能力。AI在语言和代码上已经卷出天际,但在这个方向上,连8×8拼图都搞不定。

第二个是DSAgentBench。

这是清华大学和蚂蚁数字科技联合发布的,专门测AI Agent在真实数据科学工作流里的自动化能力。arXiv编号是2607.01647,GitHub上有完整开源测试环境。

这个benchmark做得非常扎实:433个精细化技能标签,覆盖数据格式处理、数据预处理、数据操控、数据分析、数据建模、数据可视化、跨阶段通用技能七大类。每道题平均对应113.6行解题代码,平均涉及493.4MB数据量,而且包含了来自真实金融科技公司生产环境的商业数据任务。

翻译成人话就是:不是考你会不会做选择题,是让你真刀真枪去处理一堆乱糟糟的数据,从读取到清洗到建模到出报告,全流程跑通。

结果:Claude-4.6-Sonnet作为当前公认最强调推理能力的模型之一,在端到端数据科学任务里,只完成了56.7%。

不是不会做,是做不到底。中间卡在某个步骤就停了,或者某个边界条件没处理好整条链路断掉。真实的数据科学工作流,不像跑benchmark那样干干净净,而是充满了脏数据、异常值、格式不一致、上下游依赖混乱——这些在学术benchmark里往往被预处理掉了,但生产环境里全要Agent自己处理。

两篇论文放在一起看,结论很清楚。

第一,视觉推理能力存在真实的scaling cliff,不是越大越好,厂商的参数战在这个方向上不完全适用。

第二,自动化Agent能在受控环境下跑benchmark,但离真正的端到端自动化还有相当距离,Claude-4.6-Sonnet这种顶级模型也只能完成六成任务。

这给行业泼了一盆冷水——不是说AI不行,而是当前的能力边界比宣传的要窄很多。如果你正在做涉及空间推理的产品规划,或者正在评估AI Agent替代数据科学团队的可行性,这两篇论文值得认真读一遍。

两个benchmark都在GitHub上有完整开源,JigShape测视觉推理极限,DSAgentBench编号arXiv:2607.01647,真实生产级数据科学任务集。

评论区

0 条评论

登录后可评论。

AI 论文日报 14 阅读