World Labs发布Atlas多模态世界模型

小白爱摸鱼 @chaozuoye
李飞飞创办的World Labs正式发布了Atlas,号称世界上第一个多模态世界模型。 Atlas最核心的变化,是它不再把视频理解成单纯的一串像素。这个模型从头训练,原生处理文本、图像、视频、相机位姿和3D深度信息,把所有输入放进一个统一的3D空间上下文里,再预测接下来应该看到什么。 给它一张照片,你可以直接移动虚拟相机,绕到照片里根本没有拍到的位置,Atlas会一边补全整个世界,一边保持场景的空间一致性。而且相机控制不是输入一句模糊指令,而是直接把相机几何作为模型输入,可以指定精确的位置、角度和运动轨迹。 目前Atlas可以:用1-6张参考图生成最长1分钟、1440p的连续视频;从一张到几十张照片重建整个空间;输出新的任意视角画面;直接生成Point Cloud和3D Gaussian Splat;从视频恢复空间,同时模拟空间随时间发生的变化。 还有一个比视频生成更值得关注的用途:机器人。以前要给机器人搭一个真实环境的数字孪生,往往需要专门的扫描设备。World Labs展示的案例里,只用手机拍一段视频,抽取24帧,Atlas就能重建一个大型真实环境。随后机器人在这个虚拟环境里走任何轨迹,Atlas都可以生成机器人摄像头本应看到的RGB和深度数据。 Atlas是一个multimodal autoregressive diffusion transformer。它一半很像LLM,自回归地不断预测下一个空间状态;另一半又像扩散模型,负责生成高质量图像和视频。World Labs还专门展示了scaling结果:随着训练算力增加,模型能力仍然持续提升,证明了世界模型存在自己的Scaling Law。 这也解释了为什么李飞飞一直说,Spatial Intelligence会是AI的下一个前沿。LLM学的是语言世界里的规律,Atlas想学的是一个更麻烦的东西:空间长什么样、相机移动以后会看到什么、物体怎么运动,以及世界下一秒会发生什么。 Atlas目前还没有全面开放,只向少数合作伙伴提供Early Access,之后也会成为World Labs旗下Marble的底层模型。
话题来源 @MaxForAI 37.2K阅读 ❤️147 x.com/…↗ 已改写,非原文转载 Max For AI (@MaxForAI) on X 🚨李飞飞创办的 World Labs 发布了世界上第一个多模态世界模型。 今天, @drfeifei 创办的 @theworldlabs 正式发布 Atlas,官方称它是世界上第一个多模态世界模型。 Atlas 最核心的变化,是它不再把视频理解成单纯的一串像素。 这个模型从头训练,原生处理文本、图像、视频、相机位姿和 3D 深度信息。 它会把所有输入放进一个统一的 3D 空间上下文里, X (formerly Twitter)
26 浏览 0 评论 1 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单