Gemini 智能体视频理解上线:主动挑帧少看多懂,token 最高省 88%、成本降 66%

Google 给 Gemini 加了"智能体视频理解":少看多懂,token 最高省 88% Google 给最新一批 Gemini 模型新增了一项能力,叫 Agentic Video Understanding(智能体视频理解)。核心改动是把"被动扫描整段视频"换成"模型自己挑要看哪些片段"。 过去的 Gemini 默认按 1 FPS 抽帧,把全部关键帧一次性塞进上下文;新模式沿时间轴巡查,需要时才去拿画面、音频或转录文本,遇到快速运动或镜头切换的瞬间会主动提高采样频率。 Google 自家给的数据:token 消耗最多下降 88%,端到端分析成本最多下降 66%,准确率反而最高上升约 7%。也就是说,同样一段视频跑一遍分析,费用大约能砍到三分之一,质量不会跟着跌。 首批能用上的是 Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Lite,接入走 Gemini API 或 Google AI Studio。这对做视频摘要、长课程分析、客服取证这类的团队比较实用——不用再怕模型把整段视频从头读到尾。
话题来源 @Google 447.8W阅读 ❤️4410 x.com/…↗ 已改写,非原文转载
你可能想问
  • Gemini 3.7 Flash 智能体视频理解怎么减少 token 消耗 #Gemini
  • 用 Gemini API 做长视频摘要分析成本能降多少 #Gemini
20 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单