Voicebox:本地运行的 AI 语音工作室,一站式克隆、合成、听写全拿下
Voicebox:本地运行的 AI 语音工作室,一站式克隆、合成、听写全拿下
Voicebox 是一个本地优先的 AI 语音工具,一句话定位:在本地机器上完成语音克隆、语音合成、听写输入、Agent 语音输出完整闭环。它同时填补了 ElevenLabs(输出)和 WisprFlow(输入)之间的空白——两个云端独大产品各自占据一半,而 Voicebox 把两端都做了,还加了 MCP 集成让 AI Agent 直接开口说话。48,600+ GitHub Star,Trending 常客,2026 年最受关注的开源语音项目之一。
功能与原则
Voicebox 围绕”本地隐私 + 全链路语音 I/O”两条核心原则设计。数据不离机器:模型、语音数据、捕获内容全部本地运行。功能覆盖语音输入(听写)、语音输出(TTS)、语音克隆三大块,并通过 MCP 协议将能力暴露给所有主流 AI 编码客户端(Claude Code、Cursor、Windsurf 等),实现 Agent”有声音”的最后一公里。
认可度
- GitHub Star:48,623(截至 2026-08-04)
- 今日新增 443 stars,持续占据 GitHub Trending
- 6,000+ forks,464 open issues,111 open PRs,社区活跃
- 被多家 AI 媒体列为”2026 年最值得关注开源语音项目”
链接
GitHub:https://github.com/jamiepine/voicebox
原作者
@jamiepine(GitHub username: jamiepine)——独立开发者,专注开源音频/语音工具生态。Voicebox 是其核心项目,配套网站 voicebox.sh 提供文档和下载。
介绍
Voicebox 是一个免费开源的本地 AI 语音工作室,可以视为 ElevenLabs + WisprFlow 的本地合体版。核心能力包括:从几秒音频零样本克隆任意声音、支持 23 种语言和 7 种 TTS 引擎(Qwen3-TTS、Chatterbox、Kokoro、TADA 等)、全局听写热键配合 Whisper 实现任意文本框的语音输入、以及 MCP 协议让 AI Agent 直接用克隆声音开口说话。
整个技术栈采用 Tauri(Rust)构建桌面端,Python FastAPI 提供后端推理服务,前端 React + TypeScript + TailwindCSS。推理侧根据平台不同使用 MLX(Apple Silicon)或 PyTorch(CUDA/ROCm/DirectML),Qwen3 本地 LLM 共享 TTS 运行时,一份模型缓存同时服务语音合成和听写润色。
核心使用场景:内容创作者用克隆声音配音、视频博主多角色播客、开发者给 AI 助手赋予真实音色、隐私敏感用户完全本地处理语音数据、以及需要语音输入/输出一体化解决方案的任何人。
特点
- 7 大 TTS 引擎:Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox Multilingual、Chatterbox Turbo、TADA(来自 HumeAI)、Kokoro,各有语言/质量/速度优势,一键切换
- 23 种语言覆盖:从英语到阿拉伯语、日语、印地语、斯瓦希里语等,Chatterbox Multilingual 是目前支持最广的引擎
- 零样本声音克隆:几秒参考音频即可克隆,支持多采样提升质量;50+ 预设音色通过 Kokoro 和 Qwen CustomVoice 无需参考音频直接使用
- 全局听写 + 自动粘贴:macOS 全局热键,话音落后自动粘贴进焦点文本框;LLM 二次润色去除嗯啊语气;支持 Whisper Turbo(8 倍速于 Large)
- MCP Agent 语音输出:一个
voicebox.speak()调用,Claude Code / Cursor / Cline 等 MCP 感知 Agent 就能用你克隆的声音报结果;同一套 pill 覆盖听写和 Agent 说话两种方向 - 后处理音效链:8 种 Spotify pedalboard 音效(Pitch Shift、Reverb、Delay、Chorus、Compressor 等),可建预设、可按音色 Profile 记忆
- Stories 多轨编辑器:多角色对话、播客、有声书场景下的多轨时间线编辑,支持裁剪、分割、版本 pinning
- 多平台支持:macOS(MLX/Metal)、Windows(CUDA/DirectML)、Linux(CUDA/ROCm)、Intel Arc 加速;Windows/Linux 自动粘贴功能 Roadmap 中
使用方法
安装(macOS 示例):
访问 https://voicebox.sh/download/mac-arm 下载 DMG,或通过 Docker:
docker compose up
语音克隆:
- 打开 Voicebox → Profiles → New Profile
- 上传或录制参考音频(几秒即可)
- 保存 Profile,自动完成零样本克隆
TTS 合成:
curl -X POST http://127.0.0.1:17493/generate
-H "Content-Type: application/json"
-d '{"text": "Deploy complete. Ready for review.", "profile_id": "abc123", "language": "en"}'
MCP 集成(Claude Code):
claude mcp add voicebox
--transport http
--url http://127.0.0.1:17493/mcp
--header "X-Voicebox-Client-Id: claude-code"
然后在 Claude Code 中直接调用:
await voicebox.speak({ text: "Tests passing. Ready to merge.", profile: "Morgan" });
听写:
按设定热键(默认可自定义),对着麦克风说话,macOS 上自动粘贴到焦点文本框;可在 Settings → Accessibility 授权后享受无感粘贴体验。
使用场景与人群
- 内容创作者 / 播客主:克隆自己声音后批量配音,多角色场景用 Stories 编辑器切换不同音色 Profile,无需进棚
- AI 开发者:给 Claude Code、Cursor 等 Agent 赋予真实音色,Agent 完成任务后语音播报,告别盯着终端等结果
- 隐私敏感用户:所有模型和数据本地运行,不走任何云端,适合医疗、法律、金融等保密场景
- 无障碍用户:语音输入 + LLM 润色,帮助表达障碍用户更流畅地输出文字
- 多语言内容团队:23 种语言覆盖,Chatterbox Multilingual 特别适合小语种内容生产
输入与输出案例
案例 1:声音克隆 + TTS
– 输入:上传一段 10 秒的参考音频(某播客主持人的声音),保存为 Profile “Alex”
– 输出:用 Alex 的声音说出任意文字——”今天我们来聊聊 AI Agent 的最新进展”,生成的 WAV/MP3 文件本地保存
案例 2:MCP Agent 语音播报
– 输入:在 Claude Code 中执行 await voicebox.speak({ text: "Deploy to production successful. 3 services updated.", profile: "Morgan", personality: true })
– 输出:Morgan 的克隆声音用带有角色风格的语调播报部署结果,屏幕出现语音气泡显示状态
GitHub:https://github.com/jamiepine/voicebox
评论区
登录后可评论。