时间:2026年9月15日(北京时间16日凌晨)
地点:美国山景城 / 全球同步发布
人物:Google DeepMind Gemini Audio 团队;主工程师 Tom Ouyang、技术员工 Malini Jaganathan
事件详情:Google DeepMind 于9月15日正式上线两款实时语音对话模型——Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,定位公司迄今最强的语音代理模型,重点升级了并行推理能力。
Gemini 3.8 Live 面向规模化部署,主打成本与对话智能平衡;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,强调推理深度与多步处理能力,可边思考边说话,并在背景任务执行时给出“让我先看一下”等自然过渡语音。
在 Artificial Analysis 的 Speech to Speech Quality Index 上,Extended Thinking 以 82.6 分位居榜首;在 Sierra τ-Voice-banking 基准上拿下 35.1%,在 τ-Voice 上拿下 68.6%;Big Bench Audio 跑分 97.7%;标准版 Gemini 3.8 Live 在 Speech Agent Arena 排名第二,并在 ServiceNow EVA-Bench 上推进复杂工作流的帕累托前沿。
技术细节方面,3.8 Live 支持近实时视觉输入与 97 种语言中途切换,可在后台调用工具或 API 时继续对话;Extended Thinking 在保持流畅对话的前提下深度推理,会用语音进度播报陪伴用户走完多步任务。所有音频输出均内嵌 SynthID 水印以保障可追溯性。
合作生态方面,Agora、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents 等实时通信平台已第一时间接入 Live API;Salesforce、Genspark、Lumeris 等企业也在评估其低延迟与工具调用能力。
背景:这是 Google DeepMind 首次将 Live 系列语音模型与文本模型对齐到 3.8 代际。此前 Live 线停留在 Gemini 3.1 Flash Live Preview 与 Gemini 3.5 Live 系列,而文本线已迭代到 3.8 Flash。两款新模型既保留 Live 的低延迟,又补齐了推理与工具调用能力,意味着开发者可在生产环境中构建更可靠的语音代理。
影响:1) 语音代理进入“可深度推理”时代,客服、金融咨询、复杂售后等场景可直接落地;2) Live API 与 Search Live、Gemini Enterprise、Gemini app 全渠道打通,企业部署门槛大幅下降;3) 文本/语音模型首次对齐代际,Google 在实时多模态竞赛中重新拿到话语权。
总结:Gemini 3.8 Live 双模型把语音代理从“会说话”推到“会边想边说”,并通过 Live API 矩阵全面接入开发者与企业端;Google 在文本与语音双线的代际同步上首次实现,标志着实时多模态 AI 进入新阶段。
参考来源:
- https://deepmind.google/blog/introducing-gemini-3-8-live-and-3-8-live-extended-thinking/
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
- https://artificialanalysis.ai/speech-to-speech?api-benchmarks=agentic-performance-vs-cost-to-run#speech-to-speech-arena-results-tabs
- https://servicenow.github.io/eva/#results
- https://ai.google.dev/gemini-api/docs/live-api
- https://aistudio.google.com/live
- https://www.orcarouter.ai/blog/gemini-3-8-live-leak
- https://www.scriptbyai.com/google-ai-timeline-biggest-moments









