OmniVoice Skill:覆盖 600+ 语言的零样本语音克隆 TTS 神器
近期 GitHub Trending 上最值得关注的开源语音模型之一,OmniVoice 在 9 月 12 日单日新增 572 颗星,登顶语音类项目榜首。它是 k2-fsa 团队(此前贡献了 FunASR、Paraformer、Zipformer 等语音工具链)推出的零样本多语种 TTS,首次让一个开源模型覆盖 600+ 种语言,做到”听到 3 秒样本就能克隆声线”。对于想把语音能力塞进 AI Agent / Coding Agent / 本地工作流的开发者来说,这是一次门槛大幅降低的关键更新。
功能与原则
OmniVoice 的核心能力可以拆成三块:零样本多语种 TTS(600+ 语言)、音色克隆(Voice Cloning)、音色设计(Voice Design)。模型基于一种”diffusion language model”风格的全新架构,把扩散过程和语言模型的 token 化思路结合起来,在保证音质的同时把推理实时率(RTF)压到 0.025——比实时合成快约 40 倍。
设计上它走的是”小而全 + 强可控”:不做花哨的多模态,只把”说人话”这件事做到覆盖广、可控、跑得快。细粒度控制层面支持非语言符号(如 [laughter])、拼音/音素级发音纠错,可指定性别、年龄、音高、口音/方言、低语等声学属性,还内置了 SOTA 级别的零样本声音克隆。模型权重在 Hugging Face 上以 Apache 2.0 开源,适合作为本地语音服务、Agent 工具调用后端、播客/有声书/视频配音流水线,以及多语种客服机器人的统一 TTS 引擎。
认可度
- GitHub Star 数:截至 2026-09-12 约 12,585 stars(单日新增约 572 stars,在 GitHub Trending 语音类中排名第一)
- Fork 数:约 1,927
- 讨论热度:已发布 arXiv 论文 2604.00688,README 中提供 Hugging Face 模型与可在线试玩的 Space 演示;Reddit r/MachineLearning 与 r/LocalLLaMA 在 9 月初多次出现该项目的对比帖;在 X/Twitter 上”600 语言 TTS”成为近一周最常被转发的开源语音话题
- Trending 经历:2026-09-12 进入 GitHub Trending 日榜,持续在语音类目登顶;近 30 天维持稳定上升通道
链接
- GitHub 仓库:https://github.com/k2-fsa/OmniVoice
- Hugging Face 模型:https://huggingface.co/k2-fsa/OmniVoice
- 在线 Demo:https://huggingface.co/spaces/k2-fsa/OmniVoice
- 论文:https://arxiv.org/abs/2604.00688
- 项目主页:https://zhu-han.github.io/omnivoice
原作者
项目作者是 k2-fsa 团队(组织名 k2-fsa),核心维护者来自清华大学深圳国际研究生院的朱涵(Han Zhu)等人,论文一作也是 Zhu Han。k2-fsa 团队此前在 Kaldi、FunASR、Paraformer、Zipformer、SeACo-Paraformer、SenseVoice 等项目中都贡献过核心模型,社区里被视为”中文语音 + 工业级落地”方向的代表团队。OmniVoice 是他们从 ASR 走到 TTS、首次把方向反过来做的开源工作。
介绍
OmniVoice 是一个大规模多语种零样本 TTS 模型,主打”任何语言、任何音色、零样本克隆”。它用一种新颖的 diffusion language model 风格架构,把扩散模型的迭代去噪过程跟语言模型的 token 化预测结合起来,既保留了扩散模型对韵律和细节的建模能力,又利用了 language model 的长度扩展和并行推理特性。
模型能直接根据一段 3~10 秒的参考音频克隆出说话人声线,完全不需要针对目标说话人再微调;也可以在没有任何参考音频的情况下,通过”性别、年龄、音高、口音、是否低语”等属性 prompt,设计出一个全新音色。对超长尾语言(包括很多非洲、东南亚、土著小语种)的支持是它最大的差异化优势——在它出现之前,开源 TTS 覆盖语言数通常在 50~200 之间。
在工程侧,OmniVoice 提供 pip / uv 两条安装路径,PyTorch 2.8 + CUDA 12.8 / Apple Silicon / Intel Arc XPU 都能跑,推理实时率最低 0.025,意味着单卡 GPU 就能并发支持多条语音流;同时也给出了完整的 Python API 和命令行工具,可以很方便地集成到现有服务里。
特点
- 600+ 语言覆盖:目前覆盖最广的开源零样本 TTS,完整语言列表见仓库
docs/languages.md,远超同类项目 - 零样本声音克隆:3~10 秒参考音频即可还原说话人声线,无需微调
- 音色设计(Voice Design):通过性别、年龄、音高、口音、whisper 等属性 prompt 直接”画出”一个新说话人
- 细粒度控制:支持非语言符号(例如
[laughter])、拼音/音素级发音纠错 - 超快推理:RTF 最低 0.025,单卡 4090 即可并发服务多条语音流
- Apache 2.0 开源:模型权重 + 推理代码完全开放,可商用,可本地部署
- 工程链完整:Python API + CLI + Hugging Face 一键试用 + Colab 教程,上手几乎零门槛
使用方法
1. 安装(推荐 Python 3.10 + 虚拟环境)
# NVIDIA GPU
pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 --extra-index-url https://download.pytorch.org/whl/cu128
pip install omnivoice
# Apple Silicon
pip install torch==2.8.0 torchaudio==2.8.0
pip install omnivoice
2. Python API 最小示例(声音克隆)
from omnivoice import OmniVoice
ov = OmniVoice(repo="k2-fsa/OmniVoice", device="cuda")
# 参考音频 + 转写文本
ref_audio = "ref.wav"
ref_text = "这是一段示例参考语音。"
out = ov.clone_voice(
ref_audio=ref_audio,
ref_text=ref_text,
text="你好,这是用 OmniVoice 克隆出来的合成语音。",
output_path="cloned.wav",
)
3. CLI 工具
# 零样本克隆
omnivoice clone --ref-audio ref.wav --ref-text "示例文本" --text "要合成的内容" --out out.wav
# 通过属性设计音色
omnivoice design --gender female --age young --pitch high --text "你好世界" --out hello.wav
4. 接入 Claude Code / Agent
把它包成 MCP tool(server 形式)或者直接用 CLI,就能让任何 Coding Agent(Claude Code、Codex、Grok Build)具备”读文字 + 出一段人声”的能力,适合做长视频配音、有声书批量生产、客服语音外呼等场景。
使用场景与人群
- AI Agent / Coding Agent 开发者:把 OmniVoice 包成 MCP tool 或 CLI,让 Claude Code、Codex、Cursor 直接生成多语种人声(短视频、有声书、教学视频的配音)
- 内容创作者 & 自媒体团队:用”声音克隆 + 600 语言”做多语种出海内容(原声 + 目标语种同步配音)
- 独立游戏 / 互动叙事开发者:无需专业配音演员,即可在本地为不同角色快速生成可微调的音色
- 企业客服与 IVR 厂商:用 Voice Design 生成品牌专属音色,配合 RAG 实时合成答案
- 研究机构 & 多语种 NGO:覆盖大量低资源语言,做应急广播、语言保护、有声词典
适合人群:有 Python 基础、愿意跑本地模型、对语音质量要求高、对数据隐私敏感(不想把声音素材发给商业 API)的开发者与团队。
输入与输出案例
案例 1:零样本声音克隆
- 输入:
ref.wav(3 秒中文人声,说话人 A)+ 转写文本 + 目标文本"今天天气不错,要不要一起去公园?" - 输出:
out.wav,说话人 A 的声线,自然度接近真人,无明显机械感;可继续指定语速、情绪等细粒度属性
案例 2:Voice Design 凭空造一个音色
- 输入:属性 prompt =
gender=male, age=middle, pitch=medium-low, accent=British, whisper=false,文本 ="This is a brand-new voice generated by OmniVoice." - 输出:一段英式男声,稳定、可复用,适合作为 AI 助手默认音色;同一套属性可以反复生成多个音色变体(温度采样),直到选到满意的”声音品牌”
总体来看,OmniVoice 在 9 月 12 日单日 572 颗星的速度,直接把它推到了 GitHub 语音类 trending 第一。它最大的意义不在于”又开源了一个 TTS”,而在于”600+ 语言 + 零样本克隆 + 极快推理 + Apache 2.0″这四件事第一次同时成立——对任何想给 Agent 接语音能力的团队来说,都是当下最值得装起来试一次的方案。
评论区
登录后可评论。