时间:2026年7月20日
地点:中国杭州
人物:阿里巴巴通义实验室
事件详情:2026 年 7 月 20 日,阿里千问正式发布语音合成大模型 Qwen-Audio-3.0-TTS,在全球第三方权威榜单 Artificial Analysis 中斩获冠军,Elo 评分达到 1237。新模型包含面向实时交互的 Flash 版本(首包延时控制在 300ms 级别)和面向高质量生成的 Plus 版本。新模型在细粒度标签控制、freestyle 指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现系统性提升,可生成 16 种语言及 20 种方言的合成语音,让合成语音从"能说话"走向"会表达"。
背景:这是阿里通义实验室在 Qwen-Audio 系列上的第三代 TTS 模型。2026 年 7 月 15 日发布的 Qwen-Audio-3.0-Realtime 实时语音交互对话模型在 Artificial Analysis 语音推理子项综合排名第一,超越了 OpenAI 的 GPT-Realtime-2,在 VoiceBench 语音问答基准上 Plus 版本获得 92.5 分。本次 TTS 模型与 Realtime 模型共同构成阿里 Qwen 语音双旗舰。
影响:
- Qwen-Audio-3.0-TTS 击败 ElevenLabs、OpenAI、Google 等全球顶级 TTS 系统登顶 Artificial Analysis,标志国产语音合成首次全面领跑
- 16 种语言 + 20 种方言的覆盖远超国际竞品,对跨境客服、外语教育、有声书出海、内容本地化等场景形成降维打击
- 300ms 首包延时让实时语音对话达到"类真人"体验,将推动 AI 语音 Agent 在智能客服、情感陪伴、虚拟主播等场景全面落地
- "会表达"的 AI 语音将冲击传统配音行业、广播行业、有声书制作行业的内容生产模式
总结:当 AI 语音从"能说话"走向"会表达"时,声音将成为继文本、图像、视频之后的"第四种 AI 内容形态"。阿里 Qwen-Audio-3.0-TTS 登顶全球榜单意味着中国厂商第一次在 TTS 这一被 ElevenLabs、OpenAI、Google 长期垄断的赛道上完成超越——这是国产 AI 在"多模态"维度的一次重要反超。
参考来源:
- https://so.html5.qq.com/page/real/search_news?docid=70000021_2716a5f09bd95152
- https://so.html5.qq.com/page/real/search_news?docid=70000021_5336a5f1f8c90965
- https://so.html5.qq.com/page/real/search_news?docid=70000021_8966a56f77440952
- https://so.html5.qq.com/page/real/search_news?docid=70000021_8526a57924458452
- https://www.ithome.com/









