HuggingFace上开源的ASR和TTS模型直接能跑!我花了一周时间,把真正值得关注的语音模型全部理了一遍。
先搞清楚一件事
ASR(听):大模型架构负责多语种与高精度语义纠错,但端侧声学小模型在CPU上同样能打。
TTS(说):目前早就是小模型的天下,几十MB的ONNX模型在普通CPU上就能跑出播放速度4倍以上的生成速度。
ASR:多语种求准 vs 端侧极速
中文、粤语及多语种霸榜首选:Hojo-ASR-Multi-V1,Open ASR Leaderboard多语种榜单第一,WER表现直接对标甚至超过Azure、ElevenLabs等闭源API。
资源受限/CPU玩家看这两个:SenseVoiceSmall(约234M参数,中文极轻量)和whisper-large-v3-turbo(809M参数,支持99种语言)。
纯英文场景:想要极速英文识别,看英伟达的parakeet-tdt-0.6b-v2,仅0.6B,实时率极其强悍。
TTS:小而美的世界,CPU轻松带动
Hojo-TTS-Light-40M:仅40M参数,整包236MB ONNX格式。在普通CPU上RTF约0.23(合成速度是播放速度的4倍多)。
高拟真克隆/商用级:CosyVoice2-0.5B,零样本克隆能力第一梯队,自然度和情绪极其出色,且开源协议友好(Apache-2.0)。
极小算力/树莓派与英文小钢炮:Kokoro-82M(英文圈近期爆火的82M小模型)和Piper(15-28M参数,极致轻量)。
实测避坑
LLM底座有时候会过度脑补:比如四川话用手楞个捂上一捂会被自作聪明改写成用手能够捂上一捂。
专有名词失手:未见过的冷门人名、剑名、地名是通病,强依赖音素猜测。
模型在部分语言下噪音影响比较明显:加了5dB白噪声的环境下,实测一段带噪英文直接被脑补成了西班牙语。
对所有想要用AI做语音处理的人来说都很有价值。特别是那些想要搭建自动化语音系统的用户,这些模型提供了很好的解决方案。
话题来源 @wquguru
53.8K阅读 ❤️529 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论
0 反应











