时间:2026年9月23日
地点:杭州/中国
人物:阿里千问团队
事件详情:阿里千问今天推出Qwen-Audio-3.1系列语音大模型,五款新模型同步亮相,覆盖语音识别(ASR)、语音合成(TTS)、实时语音交互(Realtime)、音频理解(ASR-Next)和音频创作(TTS-Next)全链路。Qwen-Audio-3.1-ASR支持30种语言和16种中文方言识别,新增分角色转写和原生转写润色,首字响应延迟约160毫秒,在KeSpeech与WSYue的11个公开子集上平均字错误率4.55%,在温州话等11个中文方言子集上同样取得最优结果。基于下代架构的Qwen-Audio-3.1-ASR-Next把识别对象从"语音中的文字"扩展到"完整音频信息",可理解情绪、环境声与机械声,完成声音描述、事件定位与音频问答推理。Qwen-Audio-3.1-TTS-Next支持统一生成人声、音效和环境声,最高48kHz输出;Qwen-Audio-3.1-Realtime升级全双工实时交互,可在对话中切换语言并主动调用Agent工具。
背景:在Qwen-Audio-3.0拿下多项语音任务全球第一后,国产大模型厂商持续在语音链路掀起"高质低价"的攻势。就在两天前的骁龙峰会上,阿里千问刚把Qwen Book定位为原生智能体电脑搭档,与高通、阶跃等厂商联合推动端侧大模型落地。本次五款模型齐发,意味着千问把语音栈从单点能力升级为"理解—生成—交互—创作"的全栈矩阵,瞄准的是智能客服、播客、有声书、车载、IoT眼镜等需要多模态语音交互的赛道。
影响:千问同步把Qwen-Audio全线价格下调,其中TTS降价约70%,Realtime降幅约85%,ASR降幅高达95%。官方已确认Qwen-Audio-3.1-Realtime正与Qoder、千问办公等Agent以及QwenNote、A2、Eva、千问AI眼镜、乐奇AI眼镜等智能硬件对接。叠加降价与硬件预集成,语音Agent开发的单位成本将进入历史新低,迫使依赖高价闭源语音API的厂商重新评估技术栈与定价策略。
总结:千问一次性把语音栈翻修成"五件套+全线降价",标志着国产大模型已把语音赛道拉进"价格碾压+端云协同"的新一轮军备竞赛。
参考来源:
1. https://www.ithome.com/1/006/280.htm
2. https://www.chinaz.com/ainews/31305.shtml
3. https://www.yicai.com/news/103375714.html
4. https://news.qq.com/rain/a/20260923A08NP100
5. https://news.qq.com/rain/a/20260923A08O2J00
6. https://www.163.com/dy/article/L7H671O70550B1DU.html
7. https://finance.sina.com.cn/jjxw/2026-09-23/doc-inisuxhc8601721.shtml
8. https://www.toutiao.com/article/7688627955311919657







