时间:2026年8月26日(美国西部时间)
地点:美国加州山景城(Google 总部)
人物:Diego Melendo Casado(Gemini Audio 工程高级总监)、Luke Leonhard(Gemini Audio 幕僚长)
事件详情:Google 于 8 月 26 日通过官方博客发布 Gemini 3.5 Transcribe 语音转文字模型,作为 Gemini Audio 系列的最新成员。该模型基于 Gemini 3 Pro 架构构建,提供两套 API 接口:Live API(gemini-3.5-transcribe-live)用于实时流式转写,延迟控制在 1 秒以内;Interactions API(gemini-3.5-transcribe)用于录制音频处理,单次支持最长 1 小时。模型同时支持 Function Calling,可将复杂任务委派给其他 Gemini 模型执行。
背景:据 Google 官方引用 Artificial Analysis 基准数据,Gemini 3.5 Transcribe 在非流式场景下的词错误率(WER)为 2.6%,流式场景为 4.0%,FLEURS 多语言基准测试分别为 5.04% 和 5.50%;相比前代 Chirp 3(WER 7.32%),最终转录完成速度提升约 70%。该模型支持超过 85 种语言的自动检测、最多 3 人说话人识别(3 人以上仍为实验性)、最多 1000 词的自定义词汇表,并能够处理自我修正(如"周二——不,周三")、自动删除"嗯""呃"等口头禅以及自动格式化输出文本。
影响:模型已落地到多款 Google 自家产品,包括 Android 版 Gboard 的"Rambler"功能、macOS 版 Gemini 应用、Google Antigravity 的提示框,并即将支持 Chrome 浏览器任意网页表单的语音输入。Google AI Studio 与 Gemini Enterprise Agent Platform 已开放公开预览,开发者可通过 Gemini API 直接调用。第三方平台 Agora、LiveKit、Pipecat、Vercel、LangChain、Fishjam 与 Vision Agents 已率先基于 Gemini Live API 构建语音应用,Grab 等企业也已在试用。
总结:Gemini 3.5 Transcribe 将语音转文字从"逐字记录"推进到"理解式转写",通过单次推理同时完成噪声抑制、口头禅清理、自我修正识别与意图解析,叠加 2.6% 的低错误率与 70% 的速度提升,将对传统多阶段语音流水线形成降维冲击,并为开发者构建 Voice Agent 提供开箱即用的底座。
参考来源:
1. Google 官方博客:https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/
2. The Decoder:https://the-decoder.com/googles-gemini-3-5-transcribe-turns-speech-to-text-in-85-languages-while-auto-correcting-your-verbal-stumbles/
3. DataNorth AI:https://datanorth.ai/news/google-launches-gemini-3-5-transcribe
4. The Value Engineering:https://thevalue.engineering/news/google-deepmind-gemini-3-5-transcribe-voice-ai.html
5. AGI Hunt 实测:https://agihunt.info/en/p/1a03f0bbc5082f8b9603ae6a732
6. Google AI 开发者文档:https://ai.google.dev/gemini-api/docs/models/gemini-3.5-transcribe
7. DeepMind 模型卡:https://deepmind.google/models/model-cards/gemini-3-5-audio
8. AIBase:https://news.aibase.com/news/28794
9. 站长之家:https://www.chinaz.com/ainews/30648.shtml
10. 网易科技:https://www.163.com/dy/article/L5AET9NV05198NMR.html









