R2T2加Jev做实时语音评测,延迟低至160毫秒

英语流利说那套实时语音评测,现在可以用开源方案平替了。两个模型分工协作,效果相当不错。 R2T2是网易有道出的实时语音识别模型,真流式输出,延迟低至160毫秒。它有个很聪明的机制叫stable prefix——已经识别出来的文字只增不改,不会出现传统流式ASR那种来回改词的情况。比如你读I want to book,传统方案可能先显示I want to look再改成book,看着很别扭。R2T2不会,它会等足够确定了才输出。 模型地址:huggingface.co/netease-youdao… 我有个做英语学习App的朋友,他之前用商业ASR方案,成本高不说,延迟也控制不好。换了R2T2后,识别速度和稳定性都提升了不少,关键是完全开源,数据可控。 Jev这边负责判断。它只能在事先声明的内容里回答:是否、选一个、1-5打分。所以项目里只问它文本层面的事,比如读的是不是原文那个词、错法属于哪类、整段意思有没有走样。用Jev的关键原因就是快,分类判断几乎无延迟。 开源项目地址:github.com/wquguru/dashen… 两个模型配合起来,就能做到实时识别+实时评测。你读一段英文,R2T2负责把语音转成文字,Jev负责判断你读得对不对、哪里错了。整个过程几乎无感知,体验很流畅。 我试了一下本地部署,NVIDIA的卡就能跑,小显存也没问题。识别准确率挺高的,特别是那些长句子,不会出现识别到一半就改来改去的情况。 如果你也在做语音评测相关的应用,可以试试这个方案。特别是那些需要实时反馈的场景,用这个组合能省不少成本。
17 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单