时间:2026年8月25日
地点:美国纽约州阿蒙克(IBM 总部)
人物:Brian Kingsbury(IBM 杰出研究科学家)、George Saon(IBM 语音战略主管)、Samuel Thomas(IBM 高级研究科学家)、Takashi Fukuda(IBM Research-Tokyo 高级技术员工)等 8 人团队
事件详情:IBM 于 2026 年 8 月 25 日正式发布两款 Granite Speech 5.0 Turbo CTC 英文语音识别模型,分别为 Apache 2.0 商用版与 CC-BY-NC-SA-4.0 非商用版,两个模型均采用 4.7 亿参数、16 层 Conformer 编码器架构,抛弃了前代与 Granite 语言模型耦合的设计,转为纯 CTC 非自回归解码。IBM 报告称该模型在单张 NVIDIA H200 GPU 上批量推理可达 12,600 RTFx,相当于 1 秒转录 3.5 小时英文音频,速度比上一代 Granite Speech 提升超 20 倍。
背景:此前的 Granite Speech 3.3 和 4.x 系列均依赖 Conformer 编码器 + Granite LM + LoRA 自回归生成;本次 5.0 砍掉了 LM 解码器,改为"8 倍时间下采样 + 16,384 子词词表 + 自条件 CTC"的纯编码器架构。训练数据方面,商用 Apache 版基于约 6 万小时公开英语音频,非商用版叠加 GigaSpeech 与 SPGI Speech 等受限数据,训练量提升至约 7.5 万小时。性能方面,OpenASR 公开榜单上非商用版词错误率 4.85%、商用版 5.00%;远场 FFASR 榜单上两个模型分别位列准确率第 5 与第 9,同时为榜单上速度最快两项。
影响:4.7 亿参数级别的小模型叠加 12,600 RTFx 的吞吐量,使 Granite Speech 5.0 可在笔记本电脑、手机等边缘设备上本地运行实时英文转录,大幅降低客服通话、会议记录、视频字幕、呼叫中心质检等高并发场景的算力与带宽成本。Apache 2.0 商用授权也让企业可直接将该模型集成进生产流水线,无需额外授权谈判,进一步压缩商用 ASR 方案的总体拥有成本。
总结:IBM 通过"砍掉 LM 解码器"这一逆向选择,在 4.7 亿参数级别跑出了 12,600 RTFx 的吞吐,把 ASR 的"轻量 + 极速"标准推到了一个新量级;随着 Apache 2.0 商用许可放开,企业级英文转录的成本与门槛将被重新定义。
参考来源:
1. Hugging Face 官方博客:https://huggingface.co/blog/ibm-granite/granite-speech-5-0-470m-turboctc
2. Unite.AI 报道:https://www.unite.ai/ibm-says-granite-speech-5-0-transcribes-3-5-hours-of-speech-in-one-second/
3. IBM Research 官方博客:https://research.ibm.com/blog/introducing-granite-4-2
4. OrcaRouter 技术解析:https://www.orcarouter.ai/blog/granite-speech-5-0-470m-turboctc-apache-explained
5. Discernion 行业报道:https://www.discernion.com/article/extremely-fast-and-accurate-transcription-with-granite-speech-50-turbo-ctc
6. RuntimeWire 深度报道:https://runtimewire.com/article/ibm-granite-speech-5-turboctc-transcription









