语音识别的瓶颈换人了。Monsoon ASR 发布时把话说得很直:这个领域不再有模型问题,剩下的全是数据问题。这句话对做产品的也适用,卷模型不如卷语料。
支持这句判断的数字是差距。最好的听写系统在英语上已经逼近人类水平。可一旦挪到世界上那些长尾语言,尤其是真实对话里的随口之语,错误率还能高出五到十倍。英语这边卷得再漂亮,也盖不住那一大片没人好好采过音的地方。
所以这份新数据冲着一个目标来。五十种语言。十万小时以上的密集自发口语。要办的事只有一件,把各语种的 WER 都压进个位数。不再比谁的模型更花哨,改比谁手里的语料更接地气。
我的看法是这跟前面看的那份语音榜单能拼在一起。英语世界里,合成语音的榜单已经打到小数点后的分差;识别这边的主战场却在榜单外头,在那些没有标准发音库、没有钱标注的语言里。同样是语音赛道,两侧的成熟度差着一个时代。
语料生意的老规律在这里照常起作用。模型可以开源,数据很难白捡。谁攥着十万小时的真实口音,谁就有资格重新定义这一轮的起跑线。长尾语言难就难在口音杂、噪声多、还没有现成的标注员队伍,这些活只能靠钱和时间堆。thread 后续的具体数字和基准成绩,得等它自己再发。
话题来源 @shobhitbanga
218.1K阅读 ❤️139 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论
0 反应














