【时间】
2026年9月1日至2日(旧金山/北京时间)
【地点】
美国旧金山 World Labs 总部 / 全球同步发布
【人物】
李飞飞(Stanford AI Lab 前主任、World Labs 联合创始人,被称为"AI 教母")
Jim Fan(英伟达机器人主管、李飞飞学生)
Justin Johnson、Christoph Lassner、Ben Mildenhall(World Labs 联合创始人)
【事件详情】
World Labs 于 2026 年 9 月 1 日正式发布新一代世界模型 Atlas,官方定位为"全球首个多模态世界模型"(multimodal world model)。Atlas 从零开始预训练,原生融合文本、图像、视频与 3D 四种模态,能够以像素级相机控制生成图像和视频帧,并在同一模型中完成世界生成、空间重建与时空模拟。
具体能力包括四个方向:
1. 相机控制生成:仅需 1-6 张图片和相机轨迹,即可生成最长 1 分钟、1440p 分辨率视频,用户可直接控制每一帧的机位与角度。
2. 空间重建:基于 1 到数十张输入图像重建真实场景,可输出点云和 3D Gaussian Splatting 显式 3D 表示。在 DTU、ETH3D、ScanNet 等公开数据集上,稀疏视角重建误差(AbsRel ×10⁻³)取得 25.3 分,优于 Pi3X(28.7)、Depth Anything 3(39.3)和 MapAnything(47.7)。
3. 时空模拟:通过输入视频建模空间和时间,支持视频重构图和机器人 Real-to-Sim 工作流。
4. 图像生成:支持文本生成图像和 360 度全景图。
技术底座:Multimodal Autoregressive Diffusion Transformer(多模态自回归扩散 Transformer),把 LLM 的序列建模能力与扩散模型的高保真生成融合,把"空间上下文(Spatial Context)"作为核心——每张输入图像都带有相机位姿,被锚定在同一个三维空间坐标系中。
盲测表现:World Labs 官方公布数据显示,Atlas 在相机轨迹一致性盲测中,对 MiniMax H3 胜率 75%、Gemini Omni Flash 胜率 81%、FLUX 3 胜率 93%、Seedance 2.5 胜率 94%。
【背景】
World Labs 由李飞飞与斯坦福同事于 2024 年共同创立,是目前最被看好的"空间智能(Spatial Intelligence)"方向初创公司。李飞飞长期主张:如果 AI 想真正理解和复刻物理世界,必须具备空间推理能力,而不仅是语言理解能力。
融资情况:
- 2024 年以 2.3 亿美元种子轮正式走出隐身模式,估值约 10 亿美元;
- 2026 年 2 月完成约 10 亿美元新融资,由 Autodesk 领投 2 亿美元,AMD、英伟达、Fidelity 等参投,公司估值升至 50 亿美元;
- 累计融资约 12.3 亿美元。
产品矩阵:
- Marble(首款商用多模态世界模型,2025 年 11 月发布);
- World API(开发者接口,2026 年 1 月上线);
- SceniX(机器人仿真资产,2026 年 7 月被 World Labs 收购);
- Atlas(2026 年 9 月发布的旗舰基础模型,将作为后续 Marble 等产品的底层引擎)。
竞争格局:World Labs 直接对标 Google DeepMind 的 Genie 3(实时交互环境生成,24FPS)和英伟达 Cosmos(机器人与自动驾驶仿真平台,已超 200 万次下载)。Yann LeCun 的 AMI Labs 也在做物理规划架构,Niantic Spatial 在做地理空间映射。
【影响】
1. 视频生成范式转移:从"提示词猜像素"转向"相机几何原生输入",模型能理解每张图是"从哪里拍的",而不仅是"拍的什么"。
2. 具身智能训练成本下降:传统训练数据采集成本估算可达 100 万亿美元量级;Atlas 让用户用普通手机拍几段 24 帧视频即可生成高保真 3D 仿真空间,机器人可在其中反复"跑图"试错。
3. 影视与游戏特效降级:原本需要好莱坞环形相机阵列才能拍的"子弹时间"效果,用三五个手机+Atlas 即可复刻;3D Gaussian Splatting 输出可直接对接现有游戏/VFX 管线。
4. 行业判断:李飞飞本人将 Atlas 称为 World Labs 的"里程碑式"成果,Jim Fan 评价这是机器人领域"Real-to-Sim 的一大步"。
5. 短期限制:World Labs 未发布论文、模型卡、定价或公测时间,独立基准尚未复现其性能。镜头进入原图未拍到的区域时仍依赖模型先验"脑补",空间几何存在局部漂移风险。
【总结】
World Labs 用 Atlas 把"空间智能"从概念推向可演示的产品级模型。它不是又一个视频生成器,而是把视频生成、3D 重建和时空仿真塞进一个统一的多模态自回归扩散 Transformer,并让相机位姿成为原生输入类型。在 Google DeepMind、英伟达 Cosmos、AMI Labs 等对手环伺下,Atlas 是 World Labs 对"空间智能是 AGI 必经之路"这一判断的押注——也是 12 亿美元融资后的第一张主力牌。
【参考来源】
https://www.36kr.com/p/3965618760834313
https://news.qq.com/rain/a/20260902A04T0U00
https://news.qq.com/rain/a/20260902A07FKZ00
https://www.toutiao.com/article/7680736872233976354
https://www.toutiao.com/article/7680791068879421967/
https://www.163.com/dy/article/L5QJC5LG0511KIFE.html
https://www.163.com/dy/article/L5QN9Q5N0511D3QS.html
https://the-decoder.com/world-labs-unveils-atlas-a-single-ai-model-that-generates-reconstructs-and-simulates-3d-worlds-from-just-a-few-photos/
https://siliconangle.com/2026/09/01/fei-fei-lis-world-labs-debuts-atlas-a-world-model-showcase-for-advanced-spatial-intelligence/
https://beta.hyper.ai/en/stories/ff7299a9f53cee815d2376b1fd0df819
https://startupfortune.com/fei-fei-lis-world-labs-launches-atlas-to-build-walkable-ai-worlds









