时间:2026年9月15日
地点:上海(中国)
人物:阶跃星辰(StepFun)研发团队
事件详情:阶跃星辰正式发布 StepAudio 3 系列五款语音大模型,包括 Realtime、ASR、TTS、Gen 和 Music,覆盖实时语音交互、语音识别、真人级语音生成、综合音频创作和音乐创作五大场景。其中 Realtime、ASR 两款在 Artificial Analysis 多个权威榜单中位列全球第一。
背景:StepAudio 系列是阶跃星辰的核心语音大模型产品线,此前的 StepAudio 2.5 已在语音领域建立口碑。此次升级为 StepAudio 3,模型从单一对话能力扩展为完整音频内容生成矩阵,五款模型同步上线阶跃星辰开放平台,开发者可通过 API 接入。
影响:一、StepAudio 3 Realtime 以 98.9% 综合得分登顶 Artificial Analysis Conversational Dynamics 榜单,并以 99.7% 的语音推理准确率登顶 Speech Reasoning 榜单,成为业内首款"边听边想、边想边说"的实时全双工语音模型;二、StepAudio 3 ASR 在非流式语音识别榜单以 1.7% 的词错误率(WER)并列全球第一,复杂声音场景错误率较豆包 ASR 2.0 平均降低 43.0%;三、StepAudio 3 Gen 可一次生成人声、音效、环境音和背景音乐,并支持多角色台词与时序编排,重塑影视、游戏、有声书的音频生产流程;四、五款模型已全面开放,Realtime 与 Gen 模型限免。
总结:StepAudio 3 在语音全链路(识别、生成、实时交互、综合创作、音乐)实现多维度全球领跑,标志着中国语音大模型在实时对话与原生推理能力上达到国际领先水平,为全球开发者提供完整语音 AI 工具栈。
参考来源:
1. IT之家 - 阶跃发布 StepAudio 3 系列语音大模型,拿下多个全球第一 - https://www.ithome.com/1/002/602.htm
2. 凤凰网科技 - 阶跃发布 StepAudio 3 系列语音大模型,多款模型登顶全球第一 - https://tech.ifeng.com/c/8wRQDJ8y964
3. 腾讯新闻 - 阶跃发布 StepAudio 3 系列语音大模型,多款模型登顶全球第一 - https://news.qq.com/rain/a/20260915A0968L00
4. 今日头条 - 阶跃星辰发布全新语音大模型 StepAudio 3 - https://www.toutiao.com/article/7685679884433146383/
5. 阶跃星辰开放平台 - StepAudio 3 Realtime 模型文档 - https://platform.stepfun.com/docs/zh/guides/models/stepaudio-3-realtime
6. 阶跃星辰开放平台 - 语音模型列表 - https://platform.stepfun.com/docs/zh/llm/audio







