英语流利说那一套,已经能够被Jev+网易有道的实时ASR模型Confucius4-R2T2平替了,更关键的是,R2T2和项目仓库都是开源的!
两个模型的分工其实挺好玩的。R2T2是真流式,以低至160ms的间隔往外吐词,而且还有个stable prefix的机制,已经提交的文本只增加不修改。传统流式ASR会来回改词,例如,I want to book可能会变成I want to look,给人看字幕还行,但下游要是接了另一个模型,它就得跟着反复撤销自己刚做的判断。
正因为有了R2T2这一层创新,我们才能做到直接把识别出来的内容拿过来,计算漏读多读和错读。
再说到最近很火的Jev,它只能在事先声明的内容里回答:是否、选一个、1-5打分。所以项目中我们只问它文本层面的事,例如,读的是不是原文那个词、错法属于哪一类、整段意思有没有走样。之所以用Jev,关键还是——快!
如果你有NVIDIA的卡,不妨试试本地部署一下,小显存也能跑起来,实时ASR模型+实时分类模型,效果顶尖。很适合本地部署起来,在家大声朗读练起来。
R2T2模型:huggingface.co/netease-youdao…
开源项目:github.com/wquguru/dashen…
我有个做英语培训的朋友,他之前用商业的语音识别方案,成本高得离谱。换了这个开源方案后,他说成本降了不少,效果也差不多。特别是那个stable prefix机制,确实解决了传统流式ASR来回改词的问题。
如果你也在做语音识别相关的项目,可以试试这个方案。特别是那些对实时性有要求的场景,用这个方案确实是个不错的选择。
15 浏览 0 评论
0 反应














