7月20日,阿里巴巴发布了语音合成大模型 Qwen-Audio-3.0-TTS。这次不是“能说话”而已,而是直接把 AI 语音拉进“表演时代”。
为什么值得看
在全球第三方权威榜单 Artificial Analysis 里,Qwen-Audio-3.0-TTS-Plus 已经拿到了语音合成冠军,Elo 评分达到 1237。简单说:不只是会说,更会“演”。
两个版本怎么选
- Flash:首包时延 300ms 级别,优先低延迟,适合实时交互
- Plus:音质和表现力更强,优先高质感,适合内容制作
核心升级点
- 细粒度标签控制,可精确调节情绪、语速、风格
- freestyle 指令遵循,支持更自由的语音表现要求
- 多语种与方言覆盖,复杂声学场景鲁棒性提升
- 音频品质提升到录音棚级别
谁最适合用
- 做内容创作用 AI 配音、有声书、视频旁白
- 做产品需要高品质语音交互、品牌音色
- 做多语言出海内容、方言内容
如果你之前觉得 AI 语音“机械感太重”,这个版本值得再试一次。