Hugging Face开源speech-to-speech:本地跑实时语音AI,不用再按分钟买API了
Hugging Face最近开源了一个speech-to-speech项目,把语音识别、LLM推理、语音生成和音频输出串成了一整套实时流水线。
这意味着你可以在自己的GPU上搭建实时语音AI,不用再为实时语音API按分钟付费了。
核心亮点:
- 模块化组合:Whisper、Llama、Qwen、Mistral、MeloTTS、ChatTTS、Qwen3-TTS等模型都能自由组合,根据需求灵活搭配。
- LMS模式:让LLM直接生成音频Token,跳过传统TTS环节,进一步压低延迟,响应更快。
- 完全开源:Apache 2.0协议,官方开源项目,可以自由修改和商用。
对于想搭建语音AI应用的开发者来说,这降低了很大的成本门槛。以前实时语音API动辄几美元/分钟,现在用自己的GPU跑,开发和实验成本低很多。
82 浏览 0 评论
0 反应













