字节跳动空间视频模型
## 产品简介 字节跳动空间视频模型是字节跳动创始人张一鸣亲自督导开发的一款实时空间视频生成 AI 模型
产品简介
字节跳动空间视频模型是字节跳动创始人张一鸣亲自督导开发的一款实时空间视频生成 AI 模型,计划于 2026 年 10 月发布。该模型基于字节现有视频生成系统 Seedance 构建,帧率约 20 FPS、延迟仅 0.05 秒,所有渲染均在云端完成,标志着字节跳动将云端渲染能力首次推向消费级 VR 场景。
核心功能
- 实时空间视频生成:用户可通过语音与动作与生成的世界实时交互,支持高帧率低延迟输出
- 云端渲染架构:所有计算与渲染在云端完成,用户端设备无需高算力,降低消费门槛
- 多模态输入支持:支持语音指令、动作捕捉、文字描述等多种输入方式
- Pico 头显深度集成:与字节跳动旗下 Pico XR 头显深度适配,打造沉浸式空间视频体验
- 双路线世界模型:同步推进具身智能/机器人视觉-语言-动作方案,以及娱乐游戏 3D 模拟方案
- Seedance 技术继承:继承 Seedance 视频模型在运动质量、物理仿真、提示词遵循方面的领先能力
特色优势
- 创始人亲督:张一鸣亲自督导开发,体现了字节跳动对该项目的战略优先级
- 超低延迟:0.05 秒端到端延迟,接近实时交互体验
- 云边协同:火山引擎已在全球 23 个边缘数据中心部署算力,保障低延迟服务
- VR 生态协同:与 Pico 头显深度整合,形成"硬件 + 内容"闭环
- 对标全球 SOTA:目标性能对标 Google Genie 3,计划年底前发布至少一款世界模型
应用场景
- 沉浸式 VR 游戏:用户以语音和肢体动作驱动游戏世界,支持动态交互
- 虚拟社交与娱乐:在虚拟空间中与 AI 生成的角色或场景实时互动
- 数字文旅与展陈:云端渲染高真实性虚拟场景,通过 VR 设备呈现
- 远程协作与会议:结合字节跳动办公产品线,提供沉浸式远程协作体验
- 具身智能训练:为机器人具身智能研究提供高质量空间视频数据
适用人群
VR 设备用户、游戏开发者、虚拟社交应用开发者、具身智能研究人员、数字文旅从业者
出品方
字节跳动(ByteDance),豆包大模型团队出品
更新动态
- 2026 年 9 月:彭博社首次披露,张一鸣亲自督导开发
- 2026 年 9 月初:字节跳动完成 296 亿美元(约 2136 亿元人民币)银团贷款,加码 AI 基建
- 2026 年内:计划发布至少一款世界模型,性能对标 Google Genie 3 全球 SOTA 水平
官网链接
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议