用一个开源工具把 ElevenLabs + WisprFlow 的功能全收了:Voicebox 是什么来头?
用一个开源工具把 ElevenLabs + WisprFlow 的功能全收了:Voicebox 是什么来头?
如果你平时做播客、AI 配音、语音 Agent,或者单纯想clone一段声音去玩——Voicebox 绝对是最近最值得关注的项目。
它到底能做什么?
Voicebox 是一个本地优先的开源 AI 语音工作室。简单说,ElevenLabs 能做的语音合成、WisprFlow 能做的语音听写,它全都有,而且全部跑在你自己的机器上,不需要把声音数据传到云端。
核心能力就三条:
– Voice Clone:给一段几秒到几十秒的参考音频,它就能克隆出那个人的声音。
– 语音合成:内置 7 套 TTS 引擎(Qwen3-TTS、Chatterbox、Kokoro、LuxTTS、HumeAI TADA 等),覆盖 23 种语言,比 ElevenLabs 的单引擎选择多得多。
– 全局语音听写:用一个快捷键,在任何 App 里直接口述,实时转文字输入——类似 macOS 原生的听写,但模型更强、更可定制。
还有更酷的:它可以给任意支持 MCP 的 AI Agent 配上你自己的声音,让 Agent 说话直接用你克隆的声线。想做语音助手、播客剪辑自动化、多语言内容生产,这一条链路就通了。
为什么值得装?
最大的卖点就是隐私 + 全能。 ElevenLabs 和 WisprFlow 都是云服务,你的音频、语音内容实际上都在人家的服务器上处理。Voicebox 全部本地运行,模型、声纹、录音都不出本机。
而且它免费开源,GitHub 已经拿到 43k+ 星,release 稳定,跨平台支持 macOS、Windows、Linux。对于开发者来说,这意味着你可以直接把语音能力嵌进自己的工具链,不用再被 SaaS 订阅绑架。
适合谁用?
- 内容创作者:播客、短视频配音、多语言内容批量生产
- 开发者:给 AI Agent、语音 Bot、桌面工具加语音 I/O
- 隐私敏感用户:不想把音频上传到第三方云服务
快速上手
- 去 GitHub Releases 下载对应平台的安装包。
- 安装后打开 Voicebox,导入一段参考音频做 voice clone。
- 选择 TTS 引擎,输入文字,生成语音。
- 开启全局听写快捷键,在任何地方口述输入。
结语
Voicebox 把语音合成的”生产端”和听写的”输入端”合二为一,而且做得足够本地、足够开放。如果你正在找开源的语音 AI 工具,这个项目值得第一时间上手试试。
GitHub:jamiepine/voicebox
评论区
登录后可评论。