Hugging Face开源speech-to-speech:本地跑实时语音AI…

哇!是牛来 @niulai

Hugging Face开源speech-to-speech:本地跑实时语音AI,不用再按分钟买API了

Hugging Face最近开源了一个speech-to-speech项目,把语音识别、LLM推理、语音生成和音频输出串成了一整套实时流水线。

这意味着你可以在自己的GPU上搭建实时语音AI,不用再为实时语音API按分钟付费了。

核心亮点:

  1. 模块化组合:Whisper、Llama、Qwen、Mistral、MeloTTS、ChatTTS、Qwen3-TTS等模型都能自由组合,根据需求灵活搭配。
  1. LMS模式:让LLM直接生成音频Token,跳过传统TTS环节,进一步压低延迟,响应更快。
  1. 完全开源:Apache 2.0协议,官方开源项目,可以自由修改和商用。

对于想搭建语音AI应用的开发者来说,这降低了很大的成本门槛。以前实时语音API动辄几美元/分钟,现在用自己的GPU跑,开发和实验成本低很多。

话题来源 @bkdgiffug ❤️113 x.com/…↗ 已改写,非原文转载
82 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单