微软 VibeVoice:51K Stars 的开源语音 AI 家族,ASR 60 分钟长音频一次性转写
微软最近开源了一个让我挺意外的项目——VibeVoice。没错,就是那个微软。
说实话,之前我对微软的 AI 开源项目没什么感觉,感觉总是慢半拍。但 VibeVoice 这次不一样——GitHub 已经有 51,000+ stars,TTS 论文被 ICLR 2026 收录为 Oral,ASR 模型直接集成进了 Hugging Face Transformers。这个进度,不慢了。
它能干什么?
VibeVoice 不是一个模型,是一整个语音 AI 家族,分四个方向:
VibeVoice-ASR-7B:语音转文字,亮点是一次性处理 60 分钟连续音频,还带说话人区分、时间戳、结构化输出。想象一下:你丢进去一整场会议录音,出来的是「谁、在什么时候、说了什么」的完整记录。支持 50+ 语言,自定义热词提升专有名词识别率。
VibeVoice-ASR-BitNet:边缘 CPU 推理版。模型从 4.62GB 压缩到 1.58GB,普通 CPU 就能跑,延迟低于实时——不需要 GPU,不需要云。适合隐私敏感场景(医疗、金融)本地部署。
VibeVoice-Realtime-0.5B:实时 TTS,参数量只有 0.5B,首音频延迟 ~300ms。做语音助手、实时播报、无障碍工具的核心模块。
VibeVoice-TTS-1.5B:长音频生成,最长 90 分钟,支持 4 人对话——做播客、做有声书、多角色内容的神器。不过要注意,这块的代码后来被微软主动从仓库里移除了(原因是发现被用于不一致的用途),权重还在但代码 Disabled。
技术上有意思的地方
核心创新是一个 7.5Hz 超低帧率连续语音 tokenizer——传统语音模型要把音频切成小片段处理,切着切着上下文就丢了,说话人对不上号。VibeVoice 的方案是用超低帧率在维持音频保真度的同时大幅提升长序列处理效率。
底层框架是 next-token diffusion:LLM 负责理解文本上下文和对话流,diffusion head 负责生成高保真声学细节。这个组合在 ICLR 2026 拿了 Oral,不是随便糊弄的。
适合谁用?
如果你要做会议/播客转写——ASR-7B 直接出结构化结果,比拼接多个短片段模型靠谱太多。
如果你在做本地语音 AI 产品——BitNet 版本不需要 GPU,CPU 就能跑,隐私敏感场景的首选。
如果你在研究语音模型——Hugging Face Transformers 已经集成了,直接 pipeline("speech-to-text", model="microsoft/VibeVoice-ASR") 开箱即用,门槛很低。
TTS 部分:代码目前 Disabled,如果你只需要 TTS,可以看看 speech-to-speech 那条技术线(Qwen3-TTS、Kokoro 等)或等微软重新开源。
快速上手
# ASR - 60分钟长音频转写
# 直接用 Hugging Face Transformers(需要 transformers >= 5.3.0)
from transformers import pipeline
transcriber = pipeline("speech-to-text", model="microsoft/VibeVoice-ASR")
result = transcriber("your_audio_file.wav")
print(result)
# CPU 推理(BitNet 版本)
# 模型从 Hugging Face 下载,4.62GB -> 1.58GB,RTF < 1
小结
微软 VibeVoice 是 2025–2026 年开源语音 AI 里最值得关注的项目之一。51K stars 不是白来的——ASR 能力强、工程化完整、社区活跃度高。TTS 代码移除是遗憾,但 ASR 和 Realtime 那两条线已经足够有料。
GitHub:https://github.com/microsoft/VibeVoice
评论区
登录后可评论。