时间:2026年10月2日
地点:美国雷德蒙德
人物:Microsoft AI 语音团队、Microsoft Foundry Models 高级产品总监 Naomi Moneypenny
事件详情:Microsoft AI 于 10 月 1 日发布三款面向语音 Agent 的音频模型:流式转录模型 MAI-Transcribe-2-Streaming、文本转语音模型 MAI-Voice-2.1 与高速版 MAI-Voice-2.1-Flash。MAI-Transcribe-2-Streaming 是微软首个实时流式语音转写模型,支持 60 种语言并具备自动连续语言检测,接收到音频后约 100 毫秒即可输出首批"部分文本",随上下文持续修订,在 Artificial Analysis 流式榜上以 2.5% 词错误率、0.13 秒延迟登顶榜首,文字出现速度据微软内部评测约为最接近竞品的两倍,年底前优惠价 0.54 美元/小时。MAI-Voice-2.1 支持 23 种语言 26 个地区变体,可在同一声音下用各语言原生口音切换,定价 22 美元/百万字符;MAI-Voice-2.1-Flash 端到端延迟 150 毫秒、可生成 45 秒音频,推理速度比同档模型快 55%、价格低约 60%,定价 15 美元/百万字符。三款模型均支持仅凭几秒参考音频克隆声音并设有同意护栏,一项 4000 人 Turing 测试中 50.3% 听众认为 MAI-Voice 与真人录音同样或更像真人。
背景:微软此前的 MAI-Transcribe-2 仅能处理录音文件,9 月 3 日曾以 5.2% 词错误率宣传"业内最准",但缺少流式输出。OpenAI、Google(Gemini Live)与 Meta(开源语音识别)均已在实时语音赛道布局;微软此次把"实时转录 + 多语 TTS + 声音克隆"打包到 Foundry、MAI Playground、Vercel、Azure Voice Live、LiveKit(即将)与 OpenRouter,意在把语音 Agent 的延迟-成本曲线同时压低。
影响:微软在 Artificial Analysis 流式榜上首次夺冠,把"边听边处理"延迟推到 100 毫秒级,并把多语 TTS 与声音克隆纳入同一栈,对 ElevenLabs、OpenAI Realtime 与 Google Gemini Live 的语音开发者体验形成直接竞争;价格(流式 0.54 美元/小时、Flash TTS 15 美元/百万字符)也将进一步压缩客服、字幕、会议、AI 陪伴等场景的语音推理预算。
总结:微软用一款 2.5% WER、0.13 秒延迟的实时转录模型,把语音 Agent 的"听-想-说"循环压缩到单次对话节奏内,同时以 Flash 版 TTS 把成本砍到 15 美元/百万字符,正式在实时语音栈上对 ElevenLabs 与 OpenAI 形成包抄。
参考来源:
1. https://the-decoder.com/microsoft-ai-releases-new-transcription-and-text-to-speech-models-for-voice-agents/
2. https://www.unite.ai/microsoft-launches-mai-transcribe-2-streaming-and-two-mai-voice-models/
3. https://www.techcityauthority.com/2026/10/microsoft-ai-streaming-transcription-model.html
4. https://www.ithome.com/1/009/183.htm
5. https://hellomarvisaitoday.com/articles/9244b5fc-03f6-4df3-b21e-7328e19d0c25
6. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/mai-voices
7. https://www.huanqiu.com/article/4TRcz6NRsnX
8. https://urgent.news/2026/10/01/microsoft-launches-mai-transcribe-2-streaming-a-model-for-low-latency







