李飞飞创办的World Labs正式发布了Atlas,号称世界上第一个多模态世界模型。
Atlas最核心的变化,是它不再把视频理解成单纯的一串像素。这个模型从头训练,原生处理文本、图像、视频、相机位姿和3D深度信息,把所有输入放进一个统一的3D空间上下文里,再预测接下来应该看到什么。
给它一张照片,你可以直接移动虚拟相机,绕到照片里根本没有拍到的位置,Atlas会一边补全整个世界,一边保持场景的空间一致性。而且相机控制不是输入一句模糊指令,而是直接把相机几何作为模型输入,可以指定精确的位置、角度和运动轨迹。
目前Atlas可以:用1-6张参考图生成最长1分钟、1440p的连续视频;从一张到几十张照片重建整个空间;输出新的任意视角画面;直接生成Point Cloud和3D Gaussian Splat;从视频恢复空间,同时模拟空间随时间发生的变化。
还有一个比视频生成更值得关注的用途:机器人。以前要给机器人搭一个真实环境的数字孪生,往往需要专门的扫描设备。World Labs展示的案例里,只用手机拍一段视频,抽取24帧,Atlas就能重建一个大型真实环境。随后机器人在这个虚拟环境里走任何轨迹,Atlas都可以生成机器人摄像头本应看到的RGB和深度数据。
Atlas是一个multimodal autoregressive diffusion transformer。它一半很像LLM,自回归地不断预测下一个空间状态;另一半又像扩散模型,负责生成高质量图像和视频。World Labs还专门展示了scaling结果:随着训练算力增加,模型能力仍然持续提升,证明了世界模型存在自己的Scaling Law。
这也解释了为什么李飞飞一直说,Spatial Intelligence会是AI的下一个前沿。LLM学的是语言世界里的规律,Atlas想学的是一个更麻烦的东西:空间长什么样、相机移动以后会看到什么、物体怎么运动,以及世界下一秒会发生什么。
Atlas目前还没有全面开放,只向少数合作伙伴提供Early Access,之后也会成为World Labs旗下Marble的底层模型。
话题来源 @MaxForAI
37.2K阅读 ❤️147 x.com/…↗ 已改写,非原文转载
26 浏览 0 评论
1 反应











