字节豆包上线SeedRealtime音视频全双工模型

时间:2026年8月5日 地点:北京 人物:字节跳动Seed团队 事件详情:字节跳动Seed于2026年8月5日正式发布原生音视频全双工大模型SeedRealtime。该模型以统一架构原生融合音频、视频与文本,在连续的多模态信息流上进行实时交互,带来"边看、边听、边说"的全新体验。SeedRealtime现已全量上线豆包App,在业界率先实现音视频全双工技术的规模化落地。用户将豆包App更新至最新版本,在对话框选择"打电话"即可进入视频通话界面体验。 背景:音视频实时交互此前长期卡在两种形态之间——级联系统依赖ASR、VLM、TTS等多个模块串联,延迟层层叠加、信息逐级损耗;端到端模型虽更流畅,但很多方案仍依赖外置VAD判断轮次,本质仍是半双工交互。字节跳动Seed曾在2026年4月推出全双工语音大模型Seeduplex,并在豆包App完成规模化部署,本次SeedRealtime将能力边界从纯语音扩展到音视频联合建模,标志全双工技术正式走向全模态自然交互。 影响: - 推动AI多模态实时交互从"一问一答"升级到"连续多模态流",率先在消费级App实现规模化落地 - 国产大模型在端到端音视频全双工领域取得关键技术突破,强化中国AI在多模态交互方向的竞争力 - 豆包App率先规模化承载全模态交互,为AI助手、视频客服、在线教育等场景提供新底座 总结:SeedRealtime具备三项核心突破:音视频联合理解(结合画面消解同音词歧义、识别时序指代)、主动交互能力(持续观察画面变化、在关键目标出现时主动提醒并可调用工具)、流畅的交互节奏(在嘈杂场景中正确判断接话时机,分辨旁人闲聊与背景噪声)。端到端人工评测显示,相比级联模型,音视频对话节奏问题减少一半,单次完整顺畅交流的概率显著提升。下一步,SeedRealtime团队将在更低延迟与更自然节奏、主动感知与决策、复杂多人场景、稳定工具调用四个方向持续推进,把实时多模态理解转化为具体行动能力。 参考来源: - https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92 - https://www.ithome.com/0/985/891.htm - https://m.tmtpost.com/nictation/8092127.html - https://m.toutiao.com/article/7670395952234005035/ - https://seed.bytedance.com/seedrealtime - https://mparticle.uc.cn/article_org.html - https://www.cls.cn/detail/2195681