时间:2026年9月23日
地点:合肥(科大讯飞总部)
人物:科大讯飞(002230.SZ)语音识别团队
事件详情:科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。该模型采用三大关键技术——非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入——实现语音识别效果整体跃升,在中英文混合、方言、专业术语、高噪、小音量、快语速、儿童等复杂声学场景下WER(词错误率)显著下降,整体推理成本仅相对上一代增加10%。Spark-ASR-2.0将于9月24日起逐步接入讯飞输入法,并通过讯飞开放平台提供API服务,后续将陆续落地讯飞AI眼镜、智能办公本、讯飞听见等终端与办公产品。
背景:上一代Spark-ASR-1.0于2025年科大讯飞全球1024开发者节首发,凭借非自回归路径将效果相对提升16%、推理成本下降84%,成为讯飞语音业务的核心底座。本代Spark-ASR-2.0建立在几天前刚上线的全国产语音基座大模型Spark-Audio-1.0-Preview之上,向"流畅成文"演进——不仅追求一字不差还原,更结合上下文逻辑与语境理解精简冗余、精修细节,使结果文字更连贯、语义更清晰。讯飞官方对比显示,Spark-ASR-2.0在方言、高噪、小音量等复杂声学场景上的主要任务效果均优于业界当前最优水平。
影响:Spark-ASR-2.0把LLM能力引入ASR流水线,并以极低的边际成本(推理成本仅+10%)换取大幅效果跃升,将重塑国内语音云服务在中英混合、方言与高噪场景下的体验,直接利好讯飞输入法、讯飞听见、讯飞AI眼镜等C端与办公产品。同时,与同期阿里豆包语音、火山引擎大模型流式语音识别等同类服务形成正面竞争,进一步压缩语音识别API价格空间。讯飞官方已开放体验链接与API地址供开发者和企业测试。
总结:科大讯飞以"非自回归+LLM增强自回归"双路架构为基础推出Spark-ASR-2.0,以仅10%的推理成本增量换取复杂声学场景下的WER显著下降,次日即接入讯飞输入法,并通过开放平台API服务讯飞AI眼镜、智能办公本、讯飞听见等全场景终端,再次巩固其在中文语音识别领域的领先地位。
参考来源:
1. IT之家:科大讯飞发布全新语音识别大模型 Spark-ASR-2.0,明日上线讯飞输入法 https://www.ithome.com/1/006/345.htm
2. 东方财富/界面新闻:科大讯飞发布语音识别大模型Spark-ASR-2.0 https://finance.eastmoney.com/a/202609233882466230.html
3. 东方财富/第一财经:科大讯飞发布全新语音识别大模型Spark-ASR-2.0 https://finance.eastmoney.com/a/202609233882457172.html
4. 腾讯新闻/IT之家:科大讯飞发布全新语音识别大模型Spark-ASR-2.0 https://news.qq.com/rain/a/20260923A09N0W00
5. 新浪财经:科大讯飞发布全新语音识别大模型Spark-ASR-2.0 https://wap.cj.sina.cn/pc/7x24/5109420
6. 同花顺财经:讯飞全新语音识别大模型Spark-ASR-2.0来了!利好 https://news.10jqka.com.cn/20260923/c680212266.shtml
7. 界面新闻:科大讯飞发布语音识别大模型Spark-ASR-2.0 https://www.jiemian.com/article/15133130.html
8. 讯飞开放平台:语音听写大模型(中英)v2.0 API https://www.xfyun.cn/services/spark_asr_zh_en_v2.0







