VoiceStudio Skill:开源语音克隆、合成与多语言配音一站式工具

VoiceStudio Skill:开源语音克隆、合成与多语言配音一站式工具

VoiceStudio 是目前 GitHub 上最热的开源语音 AI 项目之一,定位于 ElevenLabs 的全本地替代方案。一句话概括:一个开源应用搞定语音克隆、语音设计、视频配音、听写转录和有声书合成,支持 646 种语言,完全本地运行。2026 年 10 月单日新增 star 超 3000,GitHub 总 star 已突破 5.3 万,是语音 AI 领域当下最炙手可热的开源项目。

功能与原则

VoiceStudio 围绕四大核心能力设计:

  • 语音克隆:上传一段参考音频,即可复刻任意音色,支持本地运行
  • 语音合成(TTS):输入文本生成自然语音,多引擎可选(默认 OmniVoice)
  • 视频配音(Dubbing):上传视频,自动生成与画面时间轴对齐的配音轨道
  • 听写转录 & 有声书:批量将音频转为文字,或将文本批量转为有声书

设计原则强调本地优先:所有推理默认在用户本机完成,远程服务完全可选,无强制云端依赖。用户可选择接入远程 worker 提升速度,但数据始终留在本地。

认可度

  • GitHub Star:53,434 ⭐(截至 2026-10-05)
  • Forks:5,957
  • 今日增长:单日 +3,483 stars(2026-10-04/05 期间)
  • GitHub Trending:持续占据 AI / 语音分类 trending 榜首
  • 趋势来源:GitHub Trending 2026-10-04 日榜 / 月榜双榜单常驻

链接

GitHub 仓库:https://github.com/debpalash/VoiceStudio

原作者

debpalash(Palash Deb)— 独立开发者,专注于开源语音 AI 工具链。VoiceStudio 是其核心项目,同时维护 VoiceStudio MCP 集成和 agent-skills 生态。

介绍

VoiceStudio 脱胎于对商业语音合成服务(如 ElevenLabs、ElevenLabs API)的不满:高昂的订阅费、数据必须上云、以及有限的语言支持。它的核心思路是把最强大的语音模型(k2-fsa/OmniVoice、CosyVoice、XTTS 等)本地化,让任何人在自己的电脑上跑出商业级语音效果。

项目支持多种推理引擎,用户可按硬件条件选择:NVIDIA GPU 用户走 CUDA 加速(最快),Apple Silicon 用户走 Metal MPS,CPU 也能跑只是慢一些。安装方式极为简洁——一条安装命令搞定所有依赖,Windows/macOS/Linux 全平台支持,还提供 Docker 部署选项。

除了桌面 GUI,VoiceStudio 还提供本地 API 服务和 MCP(Model Context Protocol)接口,可以直接被 AI coding agent(如 Claude Code、Cursor、Codex)调用。这意味着开发者可以在 agent 工作流里直接加入语音生成能力——比如让 AI agent 读完代码后用克隆的声线做语音汇报。

特点

  • 全本地运行:语音推理不依赖云端API,数据完全私有(GPU 加速/CPU 降速两档)
  • 646 种语言支持:覆盖全球主流语言及小语种,超越多数商业方案
  • 多引擎可选:默认 OmniVoice,支持切换 XTTS、Coqui、Fish-Speech 等多种 TTS 引擎
  • 视频配音(Dubbing):上传视频自动生成分轨配音,时间轴自动对齐
  • MCP + Local API:提供标准 API 和 MCP 协议,可无缝接入 AI agent 工作流
  • 一键安装脚本:curl 安装命令覆盖全平台,桌面应用一行命令装好
  • 跨平台:macOS(.dmg)/ Windows(.exe)/ Linux(AppImage/Deb) + Docker

使用方法

桌面应用安装(最简)

# macOS / Linux / WSL
curl -fsSL https://voicestudio.sh/install | sh

# Windows PowerShell
irm https://voicestudio.sh/install | iex

安装完成后启动应用,上传参考音频克隆音色,或直接输入文本合成语音。

接入 AI Coding Agent

# 安装 VoiceStudio skill 到 Claude Code
npx skills add debpalash/VoiceStudio

# 在 agent 对话中调用
npx skills add debpalash/VoiceStudio --skill voicestudio

本地 API 启动

# 克隆仓库
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio

# 安装依赖
bun install
bun run setup:api

# 启动 API 服务
bun run dev

API 启动后默认监听本地端口,可通过 curl 或任何 HTTP 客户端调用语音合成接口。

使用场景与人群

适用场景:

  • 内容创作者制作多语言配音视频(YouTube/TikTok/小红书)
  • 有声书制作方快速将文本转为高质量音频
  • 开发者将语音合成能力嵌入 AI agent 工作流
  • 企业内部语音助手定制(完全私有化部署)
  • 研究者测试/对比不同 TTS 引擎效果

目标用户:

  • 独立开发者 & AI 工具爱好者
  • 内容创作者(播客、视频、有声书)
  • 需要私有化语音合成的企业团队
  • 语音 AI 研究人员

输入与输出案例

案例 1:语音克隆

  • Input:上传一段 30 秒英语音频(目标音色),输入文本 “Hello, this is a test of the VoiceStudio cloning engine.”
  • Output:生成一段与参考音色高度相似的英语语音,时长约 3 秒,保留原音频的语调特征

案例 2:视频配音(Dubbing)

  • Input:上传一段 2 分钟中文产品介绍视频,选择目标语言日语,启用自动时间轴对齐
  • Output:生成一条日语配音轨道,音频与原视频画面时间轴精确对齐,可直接导出混音

GitHub:https://github.com/debpalash/VoiceStudio | 53,434 ⭐截至 2026-10-05


GitHub: https://github.com/debpalash/VoiceStudio

评论区

0 条评论

登录后可评论。

Skill超级捕获手 10 阅读