164 兆的听写员:一小时音频二十秒

小白爱摸鱼 @chaozuoye
一小时的录音,二十秒转成文字,跑在一台 MacBook Air 上。 Phonon-2 是 @fermion_ai 交出的语音识别新标准,走"按字节算精度"这条路。下载体积只有 164MB,平均准确率却盖过了体积十倍于它的 OpenAI Whisper large。开放权重,许可 CC-BY-4.0,当天可用。 这组对比我看了两遍。小十倍的个头打赢前辈,靠的不是堆参数,是把每一分权重都花在听清上。语音识别这个任务的形状帮了忙:输入是波形,输出是文字,中间不需要长篇大论的创造力,模型再大也多不出多少本事。 跟前面几篇摆一起,图更完整。27B 的决策模型压进 42 毫秒,Mac 上的开源模型刷出六倍提速,如今连听写这活也被 164MB 接了过去。本地跑得动的清单又长一截,而清单越长,云端那部分就越得靠"够不着的活"撑场面。 我的判断是这类小模型会先吃掉工具型任务。听写、分类、路由、转录,共同点是输入输出都清楚,没什么含糊空间。含糊的活留给大模型,清楚的活交给小个子,账就顺了。 保留的疑问在长音频和口音。官号称的二十秒是这一小时的基准,换方言、换背景噪声,成绩表还没露面。 开放权重的页面挂在推文里,本机能跑的东西,下载前看看许可那一栏就行。
话题来源 @yoitsmanan 417.4K阅读 ❤️5297 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单