World Labs发布全模态世界模型Atlas

会飞的荧 @feitu
9月2日,李飞飞创立的World Labs正式发布了全模态世界模型Atlas。这不是一个视频生成工具,而是一个真正理解物理世界的空间智能系统。 Atlas的核心能力可以用三个关键词概括:像素级相机控制、高效3D重建、多模态原生处理。 先说相机控制。Atlas可以接收1到6张参考图像,然后按照你指定的相机运动轨迹生成视频。关键是像素级精准控制——你能把控每一个镜头的构图和每一段运动轨迹。生成的视频最长可达1分钟,分辨率1440p。这跟传统的文本描述式相机控制完全不同,是从粗略指令升级到了精确操控。 举个例子,你给Atlas一张建筑照片,指定一个从低角度仰拍到高空俯瞰的运动轨迹,它能生成一段连贯的视频,画面的几何一致性和物理真实感远超传统视频生成模型。光影、重力、物体运动逻辑都遵循物理规律,不需要多段拼接就能输出完整一分钟的高质量视频。 再说3D重建。Atlas在稀疏视角重建任务上表现突出。在DTU公开数据集上,重建误差为25.3‰,优于多个专用模型。更厉害的是,它曾仅用2到25张地面照片就完成了斯坦福大学主方庭的三维重建,并生成了高空俯瞰飞行路径。它还能脑补照片未拍摄到的区域,比如物体背面和场景延伸部分,大幅降低了虚拟内容制作成本。 多模态原生处理是Atlas的底层架构优势。它基于多模态自回归扩散Transformer架构,从零开始预训练,可以直接处理文本、图像、视频、相机位姿与3D深度信息。以空间上下文替代文本上下文,将输入图像与视频锚定于三维空间精确位置。这意味着Atlas不只是在生成内容,而是在构建世界。 应用场景非常广泛。机器人仿真训练可以用Atlas生成低成本、可控、可规模化的虚拟训练环境,解决具身智能最大的瓶颈——缺乏廉价训练数据。影视特效制作可以用它快速生成高质量的运镜视频。游戏开发可以用它从几张照片生成3D场景。甚至可以用普通手机拍摄的视频构建多视角系统,实现子弹时间特效。 Atlas目前已进入早期访问阶段,向部分合作伙伴开放抢先体验。用户可以在官网申请访问权限。官方演示地址:worldlabs.ai/blog/atlas 从技术角度看,Atlas代表了AI从生成内容到构建世界的范式升级。李飞飞团队在物理AI领域的持续突破,为具身智能和内容创作提供了更强的底层世界理解能力。世界模型这个赛道,正在从概念走向可用的产品。
话题来源 @worldlabs 35K阅读 ❤️280 worldlabs.ai/…↗ 已改写,非原文转载
22 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单