时间:2026年9月23日
地点:杭州/北京
人物:阿里千问团队
事件详情:千问 9 月 23 日正式发布 Qwen-Audio-3.1 系列语音大模型,一次性推出 5 款模型:三大核心模型 Qwen-Audio-3.1-ASR(语音识别)、Qwen-Audio-3.1-TTS(语音合成)、Qwen-Audio-3.1-Realtime(实时语音交互)全面进化,并新增基于下一代架构的 Qwen-Audio-3.1-ASR-Next(音频理解)与 Qwen-Audio-3.1-TTS-Next(音频创作)。五款模型共同形成覆盖"理解—生成—交互—创作"的完整音频能力栈。
背景:Qwen-Audio-3.1-ASR 升级重点是结构化、听得广、听得准、听得快、听得清五项核心能力,支持 30 种语言和 16 种中文方言;在阿里内部自建的中文方言测试集上,对 16 种中文方言的原文转写平均字错误率(CER)仅为 10.38%,温州话和苏州话识别能力断层领先;AST 方言语音翻译为普通话测试中,11 个子集 10 个最优,平均语义句准率达 82.10%。TTS 升级重点是跨语言音色合成,一个音色可跨语种自然迁移,并能通过指令控制合成语音的情绪、语速和表达方式。Realtime 模型则在 τ-Voice 半双工语音转文字适配版上的整体任务成功率从 78.4% 提升至 82.0%,对背景语音的响应率从 73.0% 降至 13.0%。
影响:本次最大亮点是价格大幅下探——Qwen-Audio 全线语音模型价格下调,其中 TTS 降价约 70%,Realtime 降幅约 85%,ASR 降幅高达 95%。具体来看,Qwen-Audio-3.1-ASR-Flash 输入 0.8 元、输出 2.7 元/百万 tokens;Qwen-Audio-3.1-TTS-Flash 输入 1.5 元、输出 12 元/百万 tokens;Qwen-Audio-3.1-TTS-Next 输入 6 元、输出 12 元/百万 tokens;Qwen-Audio-3.1-Realtime-Plus 输入 5~40 元、输出 40~150 元/百万 tokens。此外,千问办公还发布了两款智能硬件——磁吸手机背面 4G 录音转写设备 QwenNote A2 和桌面机器人 Eva,Qwen-Audio-3.1-Realtime 将逐步接入这些硬件。
总结:阿里通过"能力拓展 + 价格下探 + 软硬件入口"三路并进,把语音定位为连接人、内容与 AI 的自然入口。AI 眼镜、桌面机器人等新终端的普及将带来更多语音调用需求,而最高 95% 的降幅有望显著降低中小微企业规模化应用门槛,推动国内 AI 语音赛道向市场化、普惠化转型。
参考来源:
- 36氪:阿里一口气上新5款千问模型,价格最高降95% (https://www.36kr.com/p/3996196939616387
- 北京商报:阿里发布语音模型系列Qwen-Audio-3.1 (https://www.bbtnews.com.cn/2026/0923/606703.shtml
- 每日经济新闻:千问发布Qwen-Audio-3.1系列语音大模型;高瓴创投原合伙人严文韬正式入职DeepSeek (https://www.nbd.com.cn/articles/2026-09-23/4590490.html
- 头条/证券时报:千问发布Qwen-Audio-3.1系列语音大模型 Qwen-Audio全线语音模型价格均下调 (https://www.toutiao.com/article/7688629471754191370/
- 第一财经:千问发布Qwen-Audio-3.1 下调Qwen-Audio全线语音模型价格 (https://www.yicai.com/brief/103375713.html
- 智东西:千问发布Qwen-Audio-3.1系列语音大模型 (https://zhidx.com/p/597129.html







