不想再按 $0.18/千字符交订阅费?这个开源语音工作站把 ElevenLabs 从里到外拆了一遍
不想再按 $0.18/千字符交订阅费?这个开源语音工作站把 ElevenLabs 从里到外拆了一遍
个人开发者 debpalash 用了 1564 次提交,把一个语音克隆工具做成了一个完整的本地语音工作站。
VoiceStudio(曾用名 OmniVoice-Studio,2026年8月改名为 VoiceStudio)目前托管在 GitHub(https://github.com/debpalash/VoiceStudio),已累积约 11,463 颗星、1808 个 Fork,AGPL-3.0 开源协议,最近一次更新是 2026年8月22日。
它的核心定位很直接——做一个完全本地运行的 ElevenLabs 替代品:语音克隆、视频配音、全局听写、转录、有声书制作,一套工具,全部离线。
项目边界:它能做什么,不能做什么
VoiceStudio 目前的 16 个 TTS 引擎覆盖了 646 种语言的语音合成,默认引擎是 OmniVoice(来自 k2-fsa),零样本语音克隆只需 3 秒参考音频。11 个 ASR 引擎负责转录,默认用 WhisperX,支持 99 种语言。
支持 macOS(Apple Silicon)、Windows 10/11 x64、Linux x86_64(glibc 2.39+),计算后端包括 NVIDIA CUDA、Apple Silicon MPS/MLX、AMD ROCm(Linux)、CPU,GPU 不足 8GB 显存时会自动将 TTS 模型卸载到 CPU,不影响工作流,只是更慢。
它不能做什么,或者说还需要你付出额外努力的:
音色质量有上限。 对大多数英语、西班牙语、中文场景,克隆质量与 ElevenLabs v2.5 相当。但极端场景——婴儿哭声、专业歌唱——仍有明显差距。这是开源模型的物理限制,不是 VoiceStudio 的问题,但你需要知道。
首次启动门槛不低。 需要下载模型权重,首次安装可能占用 10GB+ 磁盘空间和 5-30 分钟下载时间,网络慢的环境建议提前配 HuggingFace Token(docs/setup/huggingface-token.md 有说明)。
活跃 beta,版本之间可能有破坏性变更。 作者在 README 里明确写了”Active beta. Use the latest release for stable work or main for current fixes.” 生产环境建议锁定特定版本,发版节奏大约每月一次,8月11日刚发了 v0.5.0。
真实使用门槛:你的机器能不能跑?
| 最低配置 | 推荐配置 | |
|---|---|---|
| 内存 | 8 GB | 16 GB+ |
| 显存 | 4 GB(TTS 自动卸载到 CPU) | 8 GB+(NVIDIA RTX 3060+) |
| 磁盘 | 10 GB 可用 | 20 GB+ SSD |
| GPU | 可选,CPU 模式可用 | NVIDIA CUDA |
| macOS | 13.3+ Apple Silicon | M1/M2/M3/M4 全系 |
| Intel Mac | 不支持本地后端 | 需用远程后端模式 |
没有 NVIDIA 显卡也能跑,只是 TTS 生成速度约为 GPU 模式的 1/3。Apple Silicon Mac 是无 GPU 用户体验最好的平台——App 会自动启用 MLX 优化,在 Apple Neural Engine 上跑出接近 GPU 的吞吐量。
适合谁,不适合谁
适合:
- 有出海内容需求的多语言创作者(粤语、藏语、孟加拉语、斯瓦希里语等小语种语音克隆)
- 对数据隐私有强要求的企业或团队(所有音频在本地处理,不上云)
- 需要批量生产有声书、播客配音的个人开发者(EPUB/PDF 直接导入,导出 .m4b)
- 想在 Claude Code/Cursor 里调用本地语音能力的 AI 开发者(内置 MCP Server)
不适合:
- 追求开箱即用、零配置体验的普通用户(仍然需要折腾环境和模型下载)
- 主要做英文配音、追求 ElevenLabs v3 那种极致音色的专业工作室(现阶段质量还有差距)
- macOS Intel 用户(本地后端不支持,只能走远程模式)
- Windows AMD GPU 用户(PyTorch 没有 Windows 版 ROCm 轮子,只能跑 CPU)
技术架构:一个人怎么搭出来的
后端是 FastAPI,97 个端点,用 SQLite 持久化状态,AI 管线由四个开源组件构成:WhisperX(转录)、Demucs(人声分离)、OmniVoice(核心 TTS)、Pyannote(说话人分离)。前端是 React + Vite,Tauri 打包成跨平台桌面应用。整体代码质量在开源社区口碑不错。
有意思的是,debpalash 在 GitHub README 里直接写了”built with Claude Code and AI agents”——整个项目是在 AI 编程助手的帮助下完成的。他在 Discord 里面回应问题很及时,对于一个个人维护者来说,Issue 回复速度比很多商业项目还快。
和 ElevenLabs 的真实差距
直接对比更直观:
| 维度 | VoiceStudio | ElevenLabs |
|---|---|---|
| 价格 | 免费(AGPL-3.0) | $5-$330/月,按字符计费 |
| 语音克隆 | ✅ 3 秒零样本 | ✅ 3 秒零样本 |
| 音色设计维度 | 性别/年龄/口音/音高/情感/方言/语速 | 性别/年龄 |
| 语言覆盖 | 646 | 约 32(取决于套餐) |
| 视频配音 | ✅ 完全本地 | ✅ 仅云端 |
| 有声书制作 | ✅ EPUB/PDF → .m4b | ❌ |
| 数据隐私 | 本地为主,联网可选 | 云端处理 |
| API Key | 不需要 | 需要 |
| GPU 支持 | CUDA/MPS/ROCm/CPU | 云端 |
| 桌面应用 | ✅ Tauri 跨平台 | ❌ 仅 Web |
| TTS 引擎数 | 16(可切换) | 1 托管引擎 |
| MCP 集成 | ✅ | ❌ |
ElevenLabs 的护城河是云端体验的一致性和预置语音库——你不需要选引擎、不需要调参数,付费就能得到稳定输出。VoiceStudio 的护城河是本地化、语言广度、引擎可替换性,以及零账单。
下一步建议:怎么跑起来
第一步,从 GitHub 下载最新 release 安装包(https://github.com/debpalash/VoiceStudio/releases/latest),macOS 用户首次需要右键选择”打开”绕过 Gatekeeper,Intel Mac 用户请参考文档配置远程后端。
第二步,首次启动后等待模型下载完成,然后进入 Voice Cloning 面板,拖入一段 3 秒以上的目标音频(干净、近距离收音效果最好),输入文本,选语言,点击 Generate。
第三步,如果你有 NVIDIA 显卡,去 Settings → Engines 切换到 CUDA 模式能显著提升速度;如果是 Apple Silicon,MPS 会自动启用,不需要额外配置。
第四步,想接入 AI 编程工作流?在 Claude Desktop 或 Cursor 的 MCP 设置中添加 VoiceStudio 服务端地址(默认 localhost:3900),即可通过 AI 指令调用本地语音合成能力。
链接汇总:
- GitHub 仓库:https://github.com/debpalash/VoiceStudio
- 最新 Release(含安装包):https://github.com/debpalash/VoiceStudio/releases/latest
- 官方文档:https://github.com/debpalash/VoiceStudio/blob/main/README_CN.md
- Discord 社区:https://discord.gg/bzQavDfVV9
- KDnuggets 入门教程:https://tastytech.in/getting-started-with-omnivoice-studio-kdnuggets
- 竞品对比(Ship or Skip):https://shiporskip.io/compare/elevenlabs-voice-studio-3-real-time-voice-cloning-multilingual-dubbing-vs-omnivoice-600-language-zero-shot-tts-k2fsa-huggingface-trending-2026
评论区
登录后可评论。