英语流利说那套练习模式,现在可以用开源方案完全平替了。Jev加上网易有道的实时ASR模型Confucius4-R2T2,效果不输商业产品,关键是R2T2和项目仓库都是开源的。
这两个模型的分工挺有意思。R2T2是真流式,以低至160ms的间隔往外吐词,还有个stable prefix机制,已经提交的文本只增加不修改。传统流式ASR会来回改词,比如"I want to book"可能变成"I want to look",给人看字幕还行,但下游要是接了另一个模型,它就得跟着反复撤销自己刚做的判断。正因为有了R2T2这一层创新,才能做到直接把识别出来的内容拿过来,计算漏读多读和错读。
Jev这边负责判断和分类。它只能在事先声明的内容里回答:是否、选一个、1-5打分。所以项目中只问它文本层面的事,比如读的是不是原文那个词、错法属于哪类、整段意思有没有走样。用Jev的关键还是快。
我有个朋友最近在准备雅思口语,以前用流利说练了半年,效果一般。后来换成这套开源方案,本地部署了一个小显存就能跑的版本,每天对着麦克风大声朗读。R2T2实时识别他说的内容,Jev马上判断发音是否准确、语法有没有问题、表达是否地道。练了一个月,口语流利度明显提升。
这套方案特别适合有NVIDIA显卡的用户,小显存也能跑起来。实时ASR模型加实时分类模型,效果顶尖。本地部署的好处是数据不出门,不用担心隐私问题,而且没有网络延迟,练习体验更流畅。
项目地址:huggingface.co/netease-youdao…
开源项目:github.com/wquguru/dashen…
话题来源 @wquguru
❤️321 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论
0 反应













