Google 给 Gemini 加了"智能体视频理解":少看多懂,token 最高省 88%
Google 给最新一批 Gemini 模型新增了一项能力,叫 Agentic Video Understanding(智能体视频理解)。核心改动是把"被动扫描整段视频"换成"模型自己挑要看哪些片段"。
过去的 Gemini 默认按 1 FPS 抽帧,把全部关键帧一次性塞进上下文;新模式沿时间轴巡查,需要时才去拿画面、音频或转录文本,遇到快速运动或镜头切换的瞬间会主动提高采样频率。
Google 自家给的数据:token 消耗最多下降 88%,端到端分析成本最多下降 66%,准确率反而最高上升约 7%。也就是说,同样一段视频跑一遍分析,费用大约能砍到三分之一,质量不会跟着跌。
首批能用上的是 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite,接入走 Gemini API 或 Google AI Studio。这对做视频摘要、长课程分析、客服取证这类的团队比较实用——不用再怕模型把整段视频从头读到尾。
话题来源 @Google
447.8W阅读 ❤️4410 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论
0 反应











