2026年8月5日,字节跳动Seed团队正式发布原生音视频全双工大模型SeedRealtime,并在豆包App全量上线。MarkTechPost英文报道于8月9日发布进一步技术解读。
北京,字节跳动总部;豆包App同步全量上线,覆盖Android与iOS端。
字节跳动Seed团队(ByteDance Seed Research)。
字节跳动Seed团队发布SeedRealtime,一个原生音视频全双工大模型。该模型在单一架构中原生融合音频、视频与文本,实现"边看、边听、边说"的实时交互,模型内部同步运行感知、理解、决策与表达,取代传统ASR+LLM+TTS的级联范式。
模型实现三大核心突破:
1. 音视频联合理解:原生支持声音、画面与时序信息深度融合,可结合场景消解同音词歧义、追踪视觉时序指代。
2. 主动交互能力:持续环境感知与主动表达,在察觉画面状态变化(如关键目标出现)时主动提醒,并能调用工具融入表达。
3. 流畅交互节奏:实时感知用户对话状态与节奏,在适当时机自然接话、停顿、回应,并具备抗干扰能力,可分辨旁人闲聊与背景噪声。
端到端人工评测显示,相比级联模型,SeedRealtime的对话节奏问题减少约50%,单次对话完整流畅度显著提升,是业界首个规模化落地的音视频全双工模型。
传统实时多模态系统采用级联架构(VAD+ASR+VLM+LLM+TTS),端到端延迟通常1.8-5秒,每经过一个模块信息都在损耗,且轮次判断完全依赖外部VAD。SeedRealtime用端到端统一架构取代级联范式,将"谁在说话、说什么、看到什么、何时回应"全部内化到单一模型中,是多模态交互从"半双工串行"向"全双工并行"的范式转折。
1. 业界首个规模化落地的全双工模型,对标OpenAI Realtime API与Google Gemini Live。
2. 智能座舱、实时翻译、陪同导览、远程协作等延迟敏感场景将直接受益。
3. 用户体验提升:豆包App视频通话在动态真实场景下完成更自然连续交互。
4. 字节多模态布局再下一城,与豆包、Seed团队此前BAGEL-7B-MoT多模态模型形成矩阵。
SeedRealtime标志着字节Seed团队在多模态交互领域实现"分寸感"突破——让AI像人类一样在连续信息流中同步感知与回应。该模型用端到端架构根本性解决了级联系统的三大顽疾(延迟累积、信息损耗、节奏错位),将冲击所有对延迟和节奏敏感的实时交互场景。
参考来源:
1. 字节跳动Seed官方页面:https://seed.bytedance.com/en/SeedRealtime
2. MarkTechPost报道:https://www.marktechpost.com/2026/08/09/bytedance-seed-introduces-seedrealtime-a-native-audio-visual-full-duplex-llm-that-watches-listens-and-speaks-in-one-model/
3. TechNode报道:https://technode.com/2026/08/05/bytedance-launches-seedrealtime-full-duplex-audio-video-model/
4. CSDN技术深度解析:https://blog.csdn.net/xyghehehehe/article/details/163521544
5. 江南都市报(官方授权报道):https://so.html5.qq.com/page/real/search_news?docid=70000021_9706a72bcc012752
6. 太平洋科技快讯:https://so.html5.qq.com/page/real/search_news?docid=70000021_7916a72dd1742352
7. 豆包App接入SeedRealtime报道:https://so.html5.qq.com/page/real/search_news?docid=70000021_2776a74153b75552









