7月15日,阿里通义实验室低调上线了一个新模型:Qwen-Audio-3.0-Realtime。没有盛大发布会,没有CEO站台,但它在权威评测平台 Artificial Analysis 的 Speech Reasoning 子项里,综合排名已经冲到全球第一,超过了 OpenAI 的 GPT-Realtime-2。

这次升级了什么

官方说法是四条主线同时提升:智商、Agent 工具调用、共情对话、双工交互流畅度。简单理解就是:又聪明,又像真人

两个版本怎么选

  1. Plus:推理更强,适合需要深度问答和复杂任务
  2. Flash:速度更快,适合实时对话、低时延场景

关键数据

  1. VoiceBench 语音问答基准:Plus 版本拿到 92.5 分
  2. 支持 Function Call 标准协议,能直接调用外部工具
  3. 打断检测准确率、响应时延领先,支持毫秒级响应

适合谁用

  • 做智能客服、语音助手、语音 Agent
  • 做教育培训、口语陪练、实时翻译
  • 做娱乐互动、情感陪伴、语音交互产品

如果你已经在用 OpenAI 语音能力,可以重点关注这条新竞品;如果更在意国内合规和中文体验,Qwen-Audio-3.0 现在值得纳入选型。