Granite Speech 5.0 Turbo CTC

4.7亿参数实现12,600 RTFx吞吐量,一秒转录3.5小时音频的极速语音识别模型

AI音频 部分免费

Granite Speech 5.0 Turbo CTC 是 IBM 于 2026 年 8 月 25 日正式发布的一款紧凑型英文语音识别模型,以 4.7 亿参数实现了超过 12,600 RTFx 的推理吞吐量——单块 NVIDIA H200 GPU 批量推理时可在一秒内转录超过 3.5 小时的英文音频,速度比上一代 Granite Speech 提升超过 20 倍。

该模型采用纯编码器架构,抛弃了此前 Granite Speech 系列依赖的语言模型解码器,改为 16 层 Conformer 编码器加连接主义时序分类(CTC)的设计。推理时为单次非自回归贪婪解码,无需逐 token 采样生成,大幅降低延迟。为将 100 帧/秒的 log Mel 频谱前端降至 12.5 tokens/秒的输出速率,模型通过三层 2 倍时序下采样(第一层在 log Mel 阶段堆叠向量,第二、三层在 Conformer 前两个模块中以步幅卷积实现)将 token 生成率从上一代编码器的每秒 50 个字符压缩至 12.5 个 tokens,从而实现极速转录。

IBM 同时发布了两个版本:Apache 2.0 商用版(granite-speech-5.0-470m-turboctc)基于约 6 万小时英文音频训练,BPE 分词;非商用版(granite-speech-5.0-470m-turboctc-NC)叠加 GigaSpeech 和 SPGI Speech 数据,SentencePiece 分词。两个版本均提供 FP32 和 BF16 的 safetensors 权重,在 Hugging Face Transformers 中通过 AutoModelForCTC 和 AutoProcessor 原生支持。Apache 版在 OpenASR 公开英文短语音测试集上词错误率(WER)约 5.00%,远场 ASR 评测(FFASR Leaderboard)排名第 9 且为榜上速度最快的两款模型之一。

4.7 亿参数级别搭配 12,600 RTFx 的吞吐,使 Granite Speech 5.0 Turbo CTC 成为笔记本、手机等边缘设备上本地实时英文转录的理想选择。企业可将其直接接入生产流水线,用于客服通话记录、会议纪要生成、视频字幕转写、呼叫中心质量检测等高并发场景,无须额外授权谈判。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论