英语流利说那套实时语音评测系统,现在可以用开源方案平替了。Jev配合网易有道的Confucius4-R2T2实时ASR模型,效果相当不错,关键是整个方案都是开源的。
R2T2这个模型的流式处理很有意思,延迟低至160ms,而且有个stable prefix机制——已经提交的文本只增不改。传统流式ASR会来回改词,比如"I want to book"可能突然变成"I want to look",看字幕还行,但要是下游接了另一个模型,它就得跟着反复撤销刚做的判断。R2T2解决了这个问题。
Jev这边只能在事先声明的内容里回答:是否、选一个、1-5打分。所以项目中只问它文本层面的事,比如读的是不是原文那个词、错法属于哪类、整段意思有没有走样。用Jev的关键原因是快。
两个模型分工明确:R2T2负责实时语音识别,Jev负责实时质量评估。有NVIDIA显卡的话可以本地部署,小显存也能跑起来。实际用下来,朗读一段英文文章,系统能实时给出漏读、多读、错读的反馈,延迟几乎感觉不到。
对于想练口语但不想花钱买会员的人来说,这个方案值得试试。本地部署没有网络延迟,隐私也有保障。
R2T2模型:huggingface.co/netease-youdao…
开源项目:github.com/wquguru/dashen…
21 浏览 0 评论
0 反应














