时间:2026年9月1日(北京时间9月2日)
地点:美国旧金山 World Labs 总部;线上发布
人物:李飞飞(World Labs 联合创始人、斯坦福 AI 实验室前主任,"AI 教母");Justin Johnson、Christoph Lassner、Ben Mildenhall(World Labs 联合创始人,分别来自计算机视觉、生成式 AI、计算机图形学领域)
事件详情:2026年9月1日,李飞飞创立的 World Labs 正式发布多模态世界模型 Atlas。Atlas 是从零开始预训练的 omni 模型,原生支持文本、图像、视频、相机位姿与 3D 深度五类输入;用户只需 1 到 6 张普通照片加上一条手动设计的相机轨迹,即可生成长达 1 分钟、1440p 分辨率的连续视频,并能输出点云、3D 高斯泼溅(3D Gaussian Splatting)等显式 3D 表示。模型采用多模态自回归扩散 Transformer(Multimodal Autoregressive Diffusion Transformer)架构,把每张图片锚定到三维空间的具体位置,构建官方所说的 Spatial Context(空间上下文)。
背景:World Labs 由李飞飞等 2024 年共同创立,2024 年以 2.3 亿美元融资走出隐身模式,今年 2 月再完成 10 亿美元新融资,Autodesk 单独投资 2 亿美元,AMD、英伟达、富达投资等参与,公司估值约 50 亿美元。Atlas 是 World Labs 继 Marble(2025 年 11 月发布的世界生成商业产品,订阅价 0-95 美元/月)与 World API(2026 年 1 月推出)之后的下一代基础模型,未来将驱动 Marble 等产品迭代。
影响:在 Stanford Main Quad 案例中,Atlas 仅用 2 到 25 张游客视角的地面平拍照片即可还原草坪、拱廊、纪念教堂外墙,并生成上帝视角航拍漫游;在 DTU、ETH3D、ScanNet 等稀疏视角重建基准上,Atlas 取得 25.3(AbsRel×10⁻³,越低越好)的误差分数,优于 Pi3X 的 28.7、Depth Anything 3 的 39.3 与 MapAnything 的 47.7。在官方盲测中,Atlas 对 MiniMax H3 胜率 75%、对 Gemini Omni Flash 81%、对 FLUX 3 93%、对 Seedance 2.5 94%。World Labs 表示,机器人用手机拍摄两段 24 帧视频即可生成高精度 3D 物理孪生空间进行训练,目标是把具身智能数据采集成本从估算的百万亿美元级别大幅压缩。
总结:Atlas 首次把视频生成、3D 重建、时空模拟与具身机器人训练统一在同一个基础模型内,被业界普遍视为空间智能从"文字世界"走向"3D 世界"的代表性模型。但 Atlas 发布未配套公开论文、模型卡、价格或独立第三方复现,对官方盲测与基准数据应保留一定审慎态度。
参考来源:
1. World Labs 官方博客:https://www.worldlabs.ai/blog/atlas
2. The Decoder:https://the-decoder.com/world-labs-unveils-atlas-a-single-ai-model-that-generates-reconstructs-and-simulates-3d-worlds-from-just-a-few-photos/
3. 36氪(APPSO 转载):https://www.36kr.com/p/3965618760834313
4. Startup Fortune:https://startupfortune.com/fei-fei-lis-world-labs-launches-atlas-to-build-walkable-ai-worlds
5. AGI Hunt:https://agihunt.info/en/p/1a05fca6280e1ce30b0a38d6e6c
6. 今日头条 / 中国证券报:https://www.toutiao.com/article/7680992685615809087/
7. 今日头条 / 科创板日报:https://www.toutiao.com/article/7680845283764208179/
8. 腾讯新闻:https://news.qq.com/rain/a/20260902A07A6K00
9. 网易 / 未来图灵:https://www.163.com/dy/article/L5QJC5LG0511KIFE.html









