Gemini 3.5 Transcribe 今日发布
Google推出的新一代智能语音转文字模型,基于Gemini 3 Pro架构,支持实时流式转写(延迟低于1秒)和预录音频
Gemini 3.5 Transcribe是Google于2026年8月26日发布的最新语音转文字模型,作为Gemini Audio系列的旗舰产品,该模型基于Gemini 3 Pro架构打造,代表了语音识别领域的重要技术突破。
Gemini 3.5 Transcribe提供两套API接口以满足不同应用场景需求。Live API(gemini-3.5-transcribe-live)面向实时语音交互场景,支持双向连续流式转写,延迟控制在1秒以内,适合构建语音助手、实时字幕、会议同传等产品。Interactions API(gemini-3.5-transcribe)面向预录音频处理场景,支持最长1小时的音频文件转写,提供说话人归属和词级时间戳,适用于通话记录分析、会议纪要生成、播客字幕制作等场景。
该模型的核心能力体现在对自然语言的深度理解与处理上。它能够智能处理口语中的自我修正现象(如"我们周二——不,周三见面"),自动删除"嗯""呃"等口头禅,并直接输出格式化文本。借助内置的函数调用(Function Calling)能力,模型在转写过程中可将复杂任务委派给其他Gemini模型执行,例如根据语音内容自动创建日历事件、生成待办事项、触发文件分析等高级操作。
性能指标方面,据Google官方引用Artificial Analysis基准数据,Gemini 3.5 Transcribe在非流式场景下词错误率(WER)达到2.6%,流式场景为4.0%;在FLEURS多语言基准测试中分别为5.04%和5.50%。相较前代Chirp 3(WER 7.32%),最终转录完成速度提升约70%。模型支持超过85种语言的自动检测与转写,能应对全球主要地区口音与方言。最多支持3人说话人识别(3人以上为实验性功能),并提供最多1000词的自定义词汇表以适应医疗、法律、技术等垂直领域的专业术语。
在产品落地上,Gemini 3.5 Transcribe已集成到Google多款自家产品中,包括Android版Gboard的Rambler功能、macOS版Gemini应用、以及Google Antigravity的提示框语音输入,即将在Chrome浏览器任意网页表单中支持语音输入。第三方平台中,Agora、LiveKit、Pipecat、Vercel、LangChain、Fishjam与Vision Agents已率先基于Gemini Live API构建语音应用,Grab等企业已在生产环境试用。开发者可通过Google AI Studio中的Gemini API和Gemini Enterprise Agent Platform直接调用模型能力。
Gemini 3.5 Transcribe将语音转文字从传统的"逐字记录"阶段推进到"理解式转写"阶段,通过单次推理同时完成噪声抑制、口头禅清理、自我修正识别与意图解析,叠加2.6%的低词错误率与70%的速度提升,为开发者构建Voice Agent应用提供了开箱即用的底座,同时对传统多阶段语音处理流水线形成降维竞争。
评论与建议
登录 后参与评论或提建议