不想再按 $0.18/千字符交订阅费?这个开源语音工作站把 ElevenLabs 从里到外拆了一遍

不想再按 $0.18/千字符交订阅费?这个开源语音工作站把 ElevenLabs 从里到外拆了一遍


个人开发者 debpalash 用了 1564 次提交,把一个语音克隆工具做成了一个完整的本地语音工作站。

VoiceStudio(曾用名 OmniVoice-Studio,2026年8月改名为 VoiceStudio)目前托管在 GitHub(https://github.com/debpalash/VoiceStudio),已累积约 11,463 颗星、1808 个 Fork,AGPL-3.0 开源协议,最近一次更新是 2026年8月22日。

它的核心定位很直接——做一个完全本地运行的 ElevenLabs 替代品:语音克隆、视频配音、全局听写、转录、有声书制作,一套工具,全部离线。

项目边界:它能做什么,不能做什么

VoiceStudio 目前的 16 个 TTS 引擎覆盖了 646 种语言的语音合成,默认引擎是 OmniVoice(来自 k2-fsa),零样本语音克隆只需 3 秒参考音频。11 个 ASR 引擎负责转录,默认用 WhisperX,支持 99 种语言。

支持 macOS(Apple Silicon)、Windows 10/11 x64、Linux x86_64(glibc 2.39+),计算后端包括 NVIDIA CUDA、Apple Silicon MPS/MLX、AMD ROCm(Linux)、CPU,GPU 不足 8GB 显存时会自动将 TTS 模型卸载到 CPU,不影响工作流,只是更慢。

它不能做什么,或者说还需要你付出额外努力的:

音色质量有上限。 对大多数英语、西班牙语、中文场景,克隆质量与 ElevenLabs v2.5 相当。但极端场景——婴儿哭声、专业歌唱——仍有明显差距。这是开源模型的物理限制,不是 VoiceStudio 的问题,但你需要知道。

首次启动门槛不低。 需要下载模型权重,首次安装可能占用 10GB+ 磁盘空间和 5-30 分钟下载时间,网络慢的环境建议提前配 HuggingFace Token(docs/setup/huggingface-token.md 有说明)。

活跃 beta,版本之间可能有破坏性变更。 作者在 README 里明确写了”Active beta. Use the latest release for stable work or main for current fixes.” 生产环境建议锁定特定版本,发版节奏大约每月一次,8月11日刚发了 v0.5.0。

真实使用门槛:你的机器能不能跑?

最低配置 推荐配置
内存 8 GB 16 GB+
显存 4 GB(TTS 自动卸载到 CPU) 8 GB+(NVIDIA RTX 3060+)
磁盘 10 GB 可用 20 GB+ SSD
GPU 可选,CPU 模式可用 NVIDIA CUDA
macOS 13.3+ Apple Silicon M1/M2/M3/M4 全系
Intel Mac 不支持本地后端 需用远程后端模式

没有 NVIDIA 显卡也能跑,只是 TTS 生成速度约为 GPU 模式的 1/3。Apple Silicon Mac 是无 GPU 用户体验最好的平台——App 会自动启用 MLX 优化,在 Apple Neural Engine 上跑出接近 GPU 的吞吐量。

适合谁,不适合谁

适合:

  • 有出海内容需求的多语言创作者(粤语、藏语、孟加拉语、斯瓦希里语等小语种语音克隆)
  • 对数据隐私有强要求的企业或团队(所有音频在本地处理,不上云)
  • 需要批量生产有声书、播客配音的个人开发者(EPUB/PDF 直接导入,导出 .m4b)
  • 想在 Claude Code/Cursor 里调用本地语音能力的 AI 开发者(内置 MCP Server)

不适合:

  • 追求开箱即用、零配置体验的普通用户(仍然需要折腾环境和模型下载)
  • 主要做英文配音、追求 ElevenLabs v3 那种极致音色的专业工作室(现阶段质量还有差距)
  • macOS Intel 用户(本地后端不支持,只能走远程模式)
  • Windows AMD GPU 用户(PyTorch 没有 Windows 版 ROCm 轮子,只能跑 CPU)

技术架构:一个人怎么搭出来的

后端是 FastAPI,97 个端点,用 SQLite 持久化状态,AI 管线由四个开源组件构成:WhisperX(转录)、Demucs(人声分离)、OmniVoice(核心 TTS)、Pyannote(说话人分离)。前端是 React + Vite,Tauri 打包成跨平台桌面应用。整体代码质量在开源社区口碑不错。

有意思的是,debpalash 在 GitHub README 里直接写了”built with Claude Code and AI agents”——整个项目是在 AI 编程助手的帮助下完成的。他在 Discord 里面回应问题很及时,对于一个个人维护者来说,Issue 回复速度比很多商业项目还快。

和 ElevenLabs 的真实差距

直接对比更直观:

维度 VoiceStudio ElevenLabs
价格 免费(AGPL-3.0) $5-$330/月,按字符计费
语音克隆 ✅ 3 秒零样本 ✅ 3 秒零样本
音色设计维度 性别/年龄/口音/音高/情感/方言/语速 性别/年龄
语言覆盖 646 约 32(取决于套餐)
视频配音 ✅ 完全本地 ✅ 仅云端
有声书制作 ✅ EPUB/PDF → .m4b
数据隐私 本地为主,联网可选 云端处理
API Key 不需要 需要
GPU 支持 CUDA/MPS/ROCm/CPU 云端
桌面应用 ✅ Tauri 跨平台 ❌ 仅 Web
TTS 引擎数 16(可切换) 1 托管引擎
MCP 集成

ElevenLabs 的护城河是云端体验的一致性和预置语音库——你不需要选引擎、不需要调参数,付费就能得到稳定输出。VoiceStudio 的护城河是本地化、语言广度、引擎可替换性,以及零账单。

下一步建议:怎么跑起来

第一步,从 GitHub 下载最新 release 安装包(https://github.com/debpalash/VoiceStudio/releases/latest),macOS 用户首次需要右键选择”打开”绕过 Gatekeeper,Intel Mac 用户请参考文档配置远程后端。

第二步,首次启动后等待模型下载完成,然后进入 Voice Cloning 面板,拖入一段 3 秒以上的目标音频(干净、近距离收音效果最好),输入文本,选语言,点击 Generate。

第三步,如果你有 NVIDIA 显卡,去 Settings → Engines 切换到 CUDA 模式能显著提升速度;如果是 Apple Silicon,MPS 会自动启用,不需要额外配置。

第四步,想接入 AI 编程工作流?在 Claude Desktop 或 Cursor 的 MCP 设置中添加 VoiceStudio 服务端地址(默认 localhost:3900),即可通过 AI 指令调用本地语音合成能力。


链接汇总:

评论区

0 条评论

登录后可评论。

拾光·开源拾遗 1061 阅读