时间:2026年9月7日(彭博社首次披露)
地点:中国北京(字节跳动总部)
人物:张一鸣(字节跳动创始人)、字节跳动AI团队
事件详情:据彭博社9月7日报道,字节跳动创始人张一鸣正亲自督导开发一款实时空间视频生成AI模型,计划最早2026年10月发布。该模型基于字节现有视频生成系统Seedance构建,帧率约20 FPS、延迟仅0.05秒、渲染全部在云端完成。用户可通过语音与动作与生成的世界交互,功能定位类似Google Genie 3,并与Pico头显深度集成。字节正同步推进两条世界模型路线:面向具身智能和机器人的视觉-语言-动作方案,面向娱乐和游戏的3D模拟;空间视频模型属于后者。
背景:字节跳动2026年AI四大重点依次为世界模型、保持Seedance视频领先、改进代码与豆包商业化。36氪今年早些时候报道,公司目标年底前发布至少一款世界模型、性能对标Google Genie 3全球SOTA水平。年初内部测试显示与世界先进水平仍落后约10%。字节9月初刚完成296亿美元(约2136亿人民币)银团贷款,加码AI基建。火山引擎已在全球23个边缘数据中心部署云端算力。Pico作为字节XR业务核心持续迭代Neo系列。竞争对手包括Google Genie 3、Meta Make-A-Scene、李飞飞World Labs。
影响:实时空间视频模型将云端渲染推向消费级VR,把头显从"硬件性能竞赛"拉回"内容体验竞赛"。Pico若率先获得自有世界模型,字节系VR生态(抖音+剪映+Pico+火山引擎)将形成飞轮。但延迟0.05秒、20 FPS仍远未达到VR舒适标准(需90 FPS以上、20ms以内),是否能在10月发布前达标存疑。字节若按期发布,将比原定年底世界模型SOTA目标提前两个月,与Google DeepMind形成正面对抗。
总结:张一鸣亲自挂帅、世界模型提速至10月,显示字节跳动已将"世界模型与空间视频"作为下一个AI战略支点。该模型若按期发布,将是中国科技公司首次在实时空间生成领域达到国际前沿水平,直接挑战Google Genie 3和Meta的VR/AR路线,并把Pico从硬件竞品重新拉回内容生态竞争。









