OmniVoice Skill:覆盖 600+ 语言的零样本语音克隆 TTS 神器

近期 GitHub Trending 上最值得关注的开源语音模型之一,OmniVoice 在 9 月 12 日单日新增 572 颗星,登顶语音类项目榜首。它是 k2-fsa 团队(此前贡献了 FunASR、Paraformer、Zipformer 等语音工具链)推出的零样本多语种 TTS,首次让一个开源模型覆盖 600+ 种语言,做到”听到 3 秒样本就能克隆声线”。对于想把语音能力塞进 AI Agent / Coding Agent / 本地工作流的开发者来说,这是一次门槛大幅降低的关键更新。

功能与原则

OmniVoice 的核心能力可以拆成三块:零样本多语种 TTS(600+ 语言)、音色克隆(Voice Cloning)、音色设计(Voice Design)。模型基于一种”diffusion language model”风格的全新架构,把扩散过程和语言模型的 token 化思路结合起来,在保证音质的同时把推理实时率(RTF)压到 0.025——比实时合成快约 40 倍。

设计上它走的是”小而全 + 强可控”:不做花哨的多模态,只把”说人话”这件事做到覆盖广、可控、跑得快。细粒度控制层面支持非语言符号(如 [laughter])、拼音/音素级发音纠错,可指定性别、年龄、音高、口音/方言、低语等声学属性,还内置了 SOTA 级别的零样本声音克隆。模型权重在 Hugging Face 上以 Apache 2.0 开源,适合作为本地语音服务、Agent 工具调用后端、播客/有声书/视频配音流水线,以及多语种客服机器人的统一 TTS 引擎。

认可度

  • GitHub Star 数:截至 2026-09-12 约 12,585 stars(单日新增约 572 stars,在 GitHub Trending 语音类中排名第一)
  • Fork 数:约 1,927
  • 讨论热度:已发布 arXiv 论文 2604.00688,README 中提供 Hugging Face 模型与可在线试玩的 Space 演示;Reddit r/MachineLearning 与 r/LocalLLaMA 在 9 月初多次出现该项目的对比帖;在 X/Twitter 上”600 语言 TTS”成为近一周最常被转发的开源语音话题
  • Trending 经历:2026-09-12 进入 GitHub Trending 日榜,持续在语音类目登顶;近 30 天维持稳定上升通道

链接

  • GitHub 仓库:https://github.com/k2-fsa/OmniVoice
  • Hugging Face 模型:https://huggingface.co/k2-fsa/OmniVoice
  • 在线 Demo:https://huggingface.co/spaces/k2-fsa/OmniVoice
  • 论文:https://arxiv.org/abs/2604.00688
  • 项目主页:https://zhu-han.github.io/omnivoice

原作者

项目作者是 k2-fsa 团队(组织名 k2-fsa),核心维护者来自清华大学深圳国际研究生院的朱涵(Han Zhu)等人,论文一作也是 Zhu Han。k2-fsa 团队此前在 Kaldi、FunASR、Paraformer、Zipformer、SeACo-Paraformer、SenseVoice 等项目中都贡献过核心模型,社区里被视为”中文语音 + 工业级落地”方向的代表团队。OmniVoice 是他们从 ASR 走到 TTS、首次把方向反过来做的开源工作。

介绍

OmniVoice 是一个大规模多语种零样本 TTS 模型,主打”任何语言、任何音色、零样本克隆”。它用一种新颖的 diffusion language model 风格架构,把扩散模型的迭代去噪过程跟语言模型的 token 化预测结合起来,既保留了扩散模型对韵律和细节的建模能力,又利用了 language model 的长度扩展和并行推理特性。

模型能直接根据一段 3~10 秒的参考音频克隆出说话人声线,完全不需要针对目标说话人再微调;也可以在没有任何参考音频的情况下,通过”性别、年龄、音高、口音、是否低语”等属性 prompt,设计出一个全新音色。对超长尾语言(包括很多非洲、东南亚、土著小语种)的支持是它最大的差异化优势——在它出现之前,开源 TTS 覆盖语言数通常在 50~200 之间。

在工程侧,OmniVoice 提供 pip / uv 两条安装路径,PyTorch 2.8 + CUDA 12.8 / Apple Silicon / Intel Arc XPU 都能跑,推理实时率最低 0.025,意味着单卡 GPU 就能并发支持多条语音流;同时也给出了完整的 Python API 和命令行工具,可以很方便地集成到现有服务里。

特点

  • 600+ 语言覆盖:目前覆盖最广的开源零样本 TTS,完整语言列表见仓库 docs/languages.md,远超同类项目
  • 零样本声音克隆:3~10 秒参考音频即可还原说话人声线,无需微调
  • 音色设计(Voice Design):通过性别、年龄、音高、口音、whisper 等属性 prompt 直接”画出”一个新说话人
  • 细粒度控制:支持非语言符号(例如 [laughter])、拼音/音素级发音纠错
  • 超快推理:RTF 最低 0.025,单卡 4090 即可并发服务多条语音流
  • Apache 2.0 开源:模型权重 + 推理代码完全开放,可商用,可本地部署
  • 工程链完整:Python API + CLI + Hugging Face 一键试用 + Colab 教程,上手几乎零门槛

使用方法

1. 安装(推荐 Python 3.10 + 虚拟环境)

# NVIDIA GPU
pip install torch==2.8.0+cu128 torchaudio==2.8.0+cu128 --extra-index-url https://download.pytorch.org/whl/cu128
pip install omnivoice

# Apple Silicon
pip install torch==2.8.0 torchaudio==2.8.0
pip install omnivoice

2. Python API 最小示例(声音克隆)

from omnivoice import OmniVoice

ov = OmniVoice(repo="k2-fsa/OmniVoice", device="cuda")

# 参考音频 + 转写文本
ref_audio = "ref.wav"
ref_text  = "这是一段示例参考语音。"
out = ov.clone_voice(
    ref_audio=ref_audio,
    ref_text=ref_text,
    text="你好,这是用 OmniVoice 克隆出来的合成语音。",
    output_path="cloned.wav",
)

3. CLI 工具

# 零样本克隆
omnivoice clone --ref-audio ref.wav --ref-text "示例文本" --text "要合成的内容" --out out.wav

# 通过属性设计音色
omnivoice design --gender female --age young --pitch high --text "你好世界" --out hello.wav

4. 接入 Claude Code / Agent

把它包成 MCP tool(server 形式)或者直接用 CLI,就能让任何 Coding Agent(Claude Code、Codex、Grok Build)具备”读文字 + 出一段人声”的能力,适合做长视频配音、有声书批量生产、客服语音外呼等场景。

使用场景与人群

  • AI Agent / Coding Agent 开发者:把 OmniVoice 包成 MCP tool 或 CLI,让 Claude Code、Codex、Cursor 直接生成多语种人声(短视频、有声书、教学视频的配音)
  • 内容创作者 & 自媒体团队:用”声音克隆 + 600 语言”做多语种出海内容(原声 + 目标语种同步配音)
  • 独立游戏 / 互动叙事开发者:无需专业配音演员,即可在本地为不同角色快速生成可微调的音色
  • 企业客服与 IVR 厂商:用 Voice Design 生成品牌专属音色,配合 RAG 实时合成答案
  • 研究机构 & 多语种 NGO:覆盖大量低资源语言,做应急广播、语言保护、有声词典

适合人群:有 Python 基础、愿意跑本地模型、对语音质量要求高、对数据隐私敏感(不想把声音素材发给商业 API)的开发者与团队。

输入与输出案例

案例 1:零样本声音克隆

  • 输入:ref.wav(3 秒中文人声,说话人 A)+ 转写文本 + 目标文本 "今天天气不错,要不要一起去公园?"
  • 输出:out.wav,说话人 A 的声线,自然度接近真人,无明显机械感;可继续指定语速、情绪等细粒度属性

案例 2:Voice Design 凭空造一个音色

  • 输入:属性 prompt = gender=male, age=middle, pitch=medium-low, accent=British, whisper=false,文本 = "This is a brand-new voice generated by OmniVoice."
  • 输出:一段英式男声,稳定、可复用,适合作为 AI 助手默认音色;同一套属性可以反复生成多个音色变体(温度采样),直到选到满意的”声音品牌”

总体来看,OmniVoice 在 9 月 12 日单日 572 颗星的速度,直接把它推到了 GitHub 语音类 trending 第一。它最大的意义不在于”又开源了一个 TTS”,而在于”600+ 语言 + 零样本克隆 + 极快推理 + Apache 2.0″这四件事第一次同时成立——对任何想给 Agent 接语音能力的团队来说,都是当下最值得装起来试一次的方案。


GitHub: https://github.com/k2-fsa/OmniVoice

评论区

0 条评论

登录后可评论。

Skill超级捕获手 179 阅读