时间:2026年9月1日
地点:美国加州山景城(Google DeepMind)
人物:Google DeepMind高级产品经理 Rohan Doshi
事件详情:
谷歌于9月1日宣布在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中,正式推出"智能体视频理解"(Agentic Video Understanding)功能。该功能将模型核心推理与原生视频工具结合,可在视觉帧、音频和转录文本中动态搜索、扫描和检查目标视频片段,不再以固定1 FPS帧率被动读取整段视频。
在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型可将分析成本降低最高 66%,Token 消耗量降低最高 88%,同时准确率提升最高 7%。效率提升在长视频场景尤为明显,传统静态处理会让开发者在高 Token 成本和丢失关键细节之间取舍。Google 指出 Gemini 3.7 Flash 搭配智能体视频理解位于准确率与成本的帕累托最优前沿。
新功能解锁四类核心能力:亚秒级时刻检索(精准定位 1 FPS 下容易错过的瞬间状态变化)、长视频"大海捞针"搜索(数小时视频中回答复杂查询)、异常检测(对感兴趣时间窗口以更高帧率重新采样)、动作与物体计数(精准跟踪重复物理动作和不同物体)。
该功能已通过 Google AI Studio 与 Gemini Enterprise Agent Platform 的 Gemini API 正式开放,支持视频上传和 YouTube 视频链接,按标准 Gemini API Token 定价,不额外收取功能费。开发者只需在 API 配置中将 processing 设为 "agentic" 即可启用。
后续几个月,智能体视频理解将接入 Gemini App 与 YouTube 的 Ask YouTube 功能,为消费者带来与视频画面更紧密结合的问答体验。
背景:
Gemini 此前的视频处理采用静态采样方式,默认按每秒1帧读取整段视频,长视频场景下开发者不得不在高 Token 成本与丢失关键细节之间二选一。智能体视频理解基于今年 1 月推出的"智能体视觉"(Agentic Vision)能力,将模型推理与代码执行结合,能主动定位图像区域并放大检查。新功能将该模式扩展到视频的帧、音频、转录三种模态,通过智能循环调用内部工具加载相关部分,大幅减少开发工作量。Google 正加速将 Gemini 推向"Agent 化",本次功能升级延续了 Gemini 3 Flash 12月发布时定下的视觉与空间推理路线图。
影响:
1. 长视频类应用(视频审核、安防回溯、赛事集锦、课程检索)成本将大幅下降,过去因算不过账而搁置的需求有望加速落地。
2. Gemini API 按 Token 计费,结合 Gemini 3.7 Flash 首发价较 3.6 Flash 砍半,本次"更低成本+更高准确率"组合拳对 Anthropic、OpenAI 视频模型形成竞争压力。
3. 模型层正在吃掉 Agent 框架层的工具链,视频 Agent 中间件创业公司面临平台化挤压。
总结:
Google 通过"智能体视频理解"将 Gemini 的视频处理从被动抽帧升级为主动检索,Token 消耗最高降 88% 的同时准确率提升 7%,重新定义了长视频场景的成本基准,并将 AI Agent 生态进一步推向基础设施层。
参考来源:
1. The Decoder(英文):https://the-decoder.com/google-geminis-new-agent-based-video-analysis-cuts-token-usage-by-up-to-88-percent/
2. IT之家(中文):https://www.ithome.com/0/997/190.htm
3. AlphaSignal(英文):https://alphasignal.ai/news/google-deepmind-s-gemini-3-7-flash-cuts-video-analysis-costs-by-66
4. Agentic Tribune(英文):https://agentictribune.com/article/20260901-google-rolls-out-agentic-video-understanding-in-gemini-flash-to-cut-token-use-and-costs
5. BlockBeats(中文):https://www.theblockbeats.info/flash/364831
6. Cyber Corsairs(英文):https://cybercorsairs.com/gemini-learns-to-search-inside-your-videos
7. Vitalii(英文):https://vitalii.no/news/google-launches-agentic-video-analysis-for-gemini-dbac60c7
8. Turing Wire(英文):https://turingwire.com/post/2026/09/01/google-deepmind-launches-agentic-video-understanding-with-ge









