VoiceStudio Skill:开源本地AI语音工作站,ElevenLabs替代品

什么是 VoiceStudio

VoiceStudio 是一个开源的本地优先 AI 语音工作室,定位是 ElevenLabs 的开源替代品。它把声音克隆、声音设计、视频配音、语音转写、有声书制作四大能力打包成本地桌面应用,支持 646 种语言,不注册账号、不按 API 调用量付费、声音文件不上传到任何云端。GitHub 今日 Trending 上榜。

核心功能与设计原则

VoiceStudio 四大核心功能:

  1. 声音克隆:只需 3 秒音频即可零样本(zero-shot)克隆目标声音,支持 646 种语言
  2. 声音设计:无需样本,通过描述(性别、年龄、口音、音高、情绪等维度)凭空生成新声音
  3. 视频配音:上传视频 → 自动转写 → 翻译 → 重新配音 → 输出 MP4,整条跨国视频本地流水线一次完成
  4. 有声书:导入 EPUB/PDF,自动生成多角色的 .m4b 有声书,不同角色分配不同音色

设计原则:本地优先——所有重载工作(克隆、配音、转写)默认走本地模型,音频数据不出设备,不注册账号,不按量计费。

认可度

  • GitHub Star:约 11,500★(截至 2026-09-02,来源 AISignal,+53 stars/周,增速 14.7%)
  • Forks:约 1,800
  • GitHub Trending:2026-09-02 今日上榜
  • 多平台收录:Aetos AI Signal、AI Toolbase、GitHub Stars 等

链接

GitHub:https://github.com/debpalash/VoiceStudio

原作者

debpalash(GitHub username: debpalash),独立开发者,专注开源语音/音频工具,AGPL-3.0 开源协议。

详细介绍

VoiceStudio 的核心卖点是把「AI 语音工作室」的所有能力本地化。传统方案(如 ElevenLabs、ElevenLabs API)需要用户上传声音样本到云端服务器,按调用量付费,数据经过第三方服务器。VoiceStudio 则将整个流程搬到了本地设备:克隆走本地推理,设计走本地模型,视频配音的转写-翻译-配音链路也全部本地执行。

声音克隆方面,3 秒音频零样本克隆是技术亮点,通常需要数十秒到数分钟音频才能达到可用质量,而 VoiceStudio 声称 3 秒即可。声音设计功能则面向那些「没有参考样本但知道想要什么声音」的场景——通过描述性文字(”中年男性,稍有南方口音,语气沉稳”)生成对应音色。

视频配音功能集成了一条完整流水线:输入 MP4 → 内嵌语音识别转写 → 翻译(多语言)→ TTS 重新配音 → 导出 MP4。对需要做本地化内容的创作者来说,这省去了在多个工具间切换的成本。

有声书功能支持 EPUB 和 PDF 导入,能分析文本识别不同角色并分配不同声音,生成完整的有声书文件。适合做小说、播客脚本或学习资料的音频化。

此外还有一个系统级听写小插件:在任何 App 里用快捷键唤起,把语音实时转成文字。

主要特点

  • 全本地执行:克隆、设计、配音、转写全部走本地模型,不上传音频到云端
  • 3 秒零样本克隆:极少量参考音频即可克隆音色,降低了样本采集门槛
  • 按描述生成声音:无需声音样本,直接通过文字描述生成目标音色
  • 完整视频配音流水线:转写→翻译→配音本地一站完成,无需多工具切换
  • 646 种语言覆盖:支持绝大多数主流语言和方言
  • 多角色有声书:自动识别角色并分配不同声音,适合小说/剧本类内容
  • 零账号依赖:不注册、不登录、不按 API 调用量付费
  • 开源透明:AGPL-3.0 协议,代码可见可审计

使用方法

安装:

# 克隆仓库
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio

# 安装依赖(推荐使用 conda 或 venv)
pip install -r requirements.txt

# 启动应用
python run_voice_studio.py

或直接访问官网下载打包好的桌面客户端:https://voicestudio.sh/

声音克隆:

  1. 打开 VoiceStudio,选择「Clone Voice」
  2. 上传或录制 3 秒目标声音样本
  3. 输入想生成的文本
  4. 选择语言和音色参数,点击生成

声音设计:

  1. 选择「Design Voice」
  2. 用描述性文字定义音色(如:「女性,30岁左右,带轻微英式口音,语气温暖」)
  3. 调整音高、语速等参数
  4. 预览并导出

视频配音:

  1. 选择「Dub Video」,导入 MP4 文件
  2. 选择源语言和目标语言
  3. 等待本地转写 + 翻译完成后,选择配音音色
  4. 导出配音后的 MP4

使用场景与目标人群

适用场景:

  • 需要本地化视频内容的 YouTube/短视频创作者(视频配音本地化)
  • 有声书制作(个人作者、工作室)
  • 播客制作(多角色分配不同声音)
  • 隐私敏感场景(医生、律师、金融从业者不想让声音数据上云)
  • 开发者在自有产品中集成语音能力

目标用户:

  • 内容创作者、播客主、有声书制作人
  • 需要本地化视频的出海团队
  • 对数据隐私有要求的专业人士
  • 语音类 AI 产品开发者(参考架构)

输入与输出案例

声音克隆案例:

输入:一段 3 秒的中文女声朗读音频,内容为「今天天气很好」
输出:VoiceStudio 克隆出该音色,生成一段 30 秒的新文本语音「欢迎收听本期节目」,音色与原样本高度相似

视频配音案例:

输入:一段英文产品介绍视频(MP4,时长 2 分钟)
输出:VoiceStudio 自动转写英文文本 → 翻译成中文 → 用克隆的中文音色重新配音 → 导出中文版 MP4,全程本地,耗时约 5-8 分钟(取决于硬件)

效果说明: 本地模型质量取决于硬件配置(GPU 推荐 NVIDIA RTX 3060 及以上),在 CPU 上运行速度较慢但功能完整。


GitHub: https://github.com/debpalash/VoiceStudio

评论区

0 条评论

登录后可评论。

Skill超级捕获手 12 阅读