时间:2026年8月17日 16:24
地点:杭州(阿里云总部)
人物:阿里巴巴通义实验室
事件详情:阿里云于8月17日正式宣布 Qwen-Audio-3.0 系列语音模型上线千问 AI 平台和阿里云百炼平台。该系列共包含三款自研模型:语音识别大模型 Qwen-Audio-3.0-ASR、语音合成大模型 Qwen-Audio-3.0-TTS,以及实时语音交互对话模型 Qwen-Audio-3.0-Realtime。开发者可通过 API 服务调用全部能力,也可订阅 Token Plan 使用。
背景:在全球权威 AI 评测平台 Artificial Analysis 今年 7 月的语音排行榜上,Qwen-Audio-3.0 系列一举拿下语音识别(ASR)、实时交互(RealTime)与语音合成(TTS)三大赛道全球第一,实现"大满贯"。具体来看,ASR 模型支持复杂语境和专业领域识别,错字率仅 1.7%;TTS-Plus 在 Artificial Analysis 语音竞技场以 1236 Elo 评分登顶,领先 Gemini 3.1 Flash TTS 与 Sonic 3.5;Realtime 模型综合排名超越 OpenAI GPT-Realtime-2,支持端到端语音理解与对话,可边听边说、随时打断追问。
影响:该系列模型已在千问 App、千问办公、Qoder 等产品中规模化落地,标志着阿里语音 AI 从单点能力升级为覆盖识别、合成、实时交互的全栈体系。三冠成绩进一步巩固通义千问在多模态方向的全球竞争力,也意味着国产语音大模型在国际权威榜单上首次实现 ASR、TTS、RealTime 三大赛道同时登顶。
总结:阿里 Qwen-Audio-3.0 系列以"三冠王"姿态登陆千问 AI 平台,是国产语音大模型在国际权威榜单上首次实现 ASR、TTS、RealTime 三大赛道同时登顶。无论对开发者生态还是多模态应用落地,都具有重要的标杆意义。
参考来源:
1. 凤凰网科技:https://new.qq.com/rain/a/20260817A08R8G00
2. IT之家(腾讯分发):https://new.qq.com/rain/a/20260817A08DTK00
3. IT之家原文:https://www.ithome.com/0/990/679.htm
4. 阿里云官方/IT之家:https://so.html5.qq.com/page/real/search_news?docid=70000021_3416a82c41396252
5. 凤凰网科技(早期 ASR Flash 发布):https://new.qq.com/rain/a/20260731A086CI00
6. 凤凰网科技(Realtime 登顶 OpenAI 报道):https://so.html5.qq.com/page/real/search_news?docid=70000021_8526a57924458452
7. CSDN TTS-Plus 评测:https://blog.csdn.net/diaobei2017/article/details/102139168









