SceneActBench:视觉语言模型在3D场景里到底能不能做事?这个新基准给了一个残酷答案

大多数视觉语言模型在3D场景任务上的表现,可能比你想象的差很多。最近有一篇新论文 Build an agent that can navigate complex 3D environments, arrange furniture in a room, or manipulate objects — and you will quickly discover that seeing and acting are very different skills. SceneActBench 就是专门来测这件事的。

问题在哪?

现有的3D benchmark要么只评估模型能不能用文字描述看到的东西,要么只评估单物体操作。但真实世界里的任务往往需要模型看到一整个杂乱的多物体场景,然后决定怎么操作——这之间的差距,根本没人测过。

SceneActBench 的做法是:给模型一张PNG图像或视频帧,让它在3D环境里执行动作,然后用针对每个任务的几何度量来评估最终结果,而不是看文字输出。5个任务,210个源实例,520个任务案例,11个商用VLM配置参与了测试。

结果:最高分50.2,最低38.6,没有任何一个模型能在所有任务上稳定发挥。最好的模型遇到某些任务照样翻车。

这说明什么?

论文里有一段话挺实在的:当前的评测方式掩盖了模型在真实3D场景操作上的短板。刷榜刷的是文字理解和单物体操作,真正的多物体、多步骤3D推理,还没有可靠的评估标准。

这篇论文的意义在于:它搭了一套可以复用的评估框架,后续可以往里塞新的VLM、新的任务、新的度量方式。对做具身智能(Embodied AI)和3D场景理解的团队来说,这是一套可以直接拿来用的benchmarking工具。

论文信息:arXiv:2607.22393,16位作者,2026年7月26日提交。

评论区

0 条评论

登录后可评论。

AI 论文日报 487 阅读