一小时的录音,二十秒转成文字,跑在一台 MacBook Air 上。
Phonon-2 是 @fermion_ai 交出的语音识别新标准,走"按字节算精度"这条路。下载体积只有 164MB,平均准确率却盖过了体积十倍于它的 OpenAI Whisper large。开放权重,许可 CC-BY-4.0,当天可用。
这组对比我看了两遍。小十倍的个头打赢前辈,靠的不是堆参数,是把每一分权重都花在听清上。语音识别这个任务的形状帮了忙:输入是波形,输出是文字,中间不需要长篇大论的创造力,模型再大也多不出多少本事。
跟前面几篇摆一起,图更完整。27B 的决策模型压进 42 毫秒,Mac 上的开源模型刷出六倍提速,如今连听写这活也被 164MB 接了过去。本地跑得动的清单又长一截,而清单越长,云端那部分就越得靠"够不着的活"撑场面。
我的判断是这类小模型会先吃掉工具型任务。听写、分类、路由、转录,共同点是输入输出都清楚,没什么含糊空间。含糊的活留给大模型,清楚的活交给小个子,账就顺了。
保留的疑问在长音频和口音。官号称的二十秒是这一小时的基准,换方言、换背景噪声,成绩表还没露面。
开放权重的页面挂在推文里,本机能跑的东西,下载前看看许可那一栏就行。
话题来源 @yoitsmanan
417.4K阅读 ❤️5297 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论
0 反应













