7月20日,阿里巴巴发布了语音合成大模型 Qwen-Audio-3.0-TTS。这次不是“能说话”而已,而是直接把 AI 语音拉进“表演时代”。

为什么值得看

在全球第三方权威榜单 Artificial Analysis 里,Qwen-Audio-3.0-TTS-Plus 已经拿到了语音合成冠军,Elo 评分达到 1237。简单说:不只是会说,更会“演”

两个版本怎么选

  1. Flash:首包时延 300ms 级别,优先低延迟,适合实时交互
  2. Plus:音质和表现力更强,优先高质感,适合内容制作

核心升级点

  1. 细粒度标签控制,可精确调节情绪、语速、风格
  2. freestyle 指令遵循,支持更自由的语音表现要求
  3. 多语种与方言覆盖,复杂声学场景鲁棒性提升
  4. 音频品质提升到录音棚级别

谁最适合用

  • 做内容创作用 AI 配音、有声书、视频旁白
  • 做产品需要高品质语音交互、品牌音色
  • 做多语言出海内容、方言内容

如果你之前觉得 AI 语音“机械感太重”,这个版本值得再试一次。