热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

Gemini推智能体视频理解 Token消耗最高降88%

时间:2026年9月1日 地点:美国加州山景城(Google DeepMind) 人物:Google DeepMind高级产品经理 Rohan Doshi 事件详情: 谷歌于9月1日宣布在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中,正式推出"智能体视频理解"(Agentic Video Understanding)功能。该功能将模型核心推理与原生视频工具结合,可在视觉帧、音频和转录文本中动态搜索、扫描和检查目标视频片段,不再以固定1 FPS帧率被动读取整段视频。 在标准视频分析基准测试中,搭载智能体视频理解的 Gemini 模型可将分析成本降低最高 66%,Token 消耗量降低最高 88%,同时准确率提升最高 7%。效率提升在长视频场景尤为明显,传统静态处理会让开发者在高 Token 成本和丢失关键细节之间取舍。Google 指出 Gemini 3.7 Flash 搭配智能体视频理解位于准确率与成本的帕累托最优前沿。 新功能解锁四类核心能力:亚秒级时刻检索(精准定位 1 FPS 下容易错过的瞬间状态变化)、长视频"大海捞针"搜索(数小时视频中回答复杂查询)、异常检测(对感兴趣时间窗口以更高帧率重新采样)、动作与物体计数(精准跟踪重复物理动作和不同物体)。 该功能已通过 Google AI Studio 与 Gemini Enterprise Agent Platform 的 Gemini API 正式开放,支持视频上传和 YouTube 视频链接,按标准 Gemini API Token 定价,不额外收取功能费。开发者只需在 API 配置中将 processing 设为 "agentic" 即可启用。 后续几个月,智能体视频理解将接入 Gemini App 与 YouTube 的 Ask YouTube 功能,为消费者带来与视频画面更紧密结合的问答体验。 背景: Gemini 此前的视频处理采用静态采样方式,默认按每秒1帧读取整段视频,长视频场景下开发者不得不在高 Token 成本与丢失关键细节之间二选一。智能体视频理解基于今年 1 月推出的"智能体视觉"(Agentic Vision)能力,将模型推理与代码执行结合,能主动定位图像区域并放大检查。新功能将该模式扩展到视频的帧、音频、转录三种模态,通过智能循环调用内部工具加载相关部分,大幅减少开发工作量。Google 正加速将 Gemini 推向"Agent 化",本次功能升级延续了 Gemini 3 Flash 12月发布时定下的视觉与空间推理路线图。 影响: 1. 长视频类应用(视频审核、安防回溯、赛事集锦、课程检索)成本将大幅下降,过去因算不过账而搁置的需求有望加速落地。 2. Gemini API 按 Token 计费,结合 Gemini 3.7 Flash 首发价较 3.6 Flash 砍半,本次"更低成本+更高准确率"组合拳对 Anthropic、OpenAI 视频模型形成竞争压力。 3. 模型层正在吃掉 Agent 框架层的工具链,视频 Agent 中间件创业公司面临平台化挤压。 总结: Google 通过"智能体视频理解"将 Gemini 的视频处理从被动抽帧升级为主动检索,Token 消耗最高降 88% 的同时准确率提升 7%,重新定义了长视频场景的成本基准,并将 AI Agent 生态进一步推向基础设施层。 参考来源: 1. The Decoder(英文):https://the-decoder.com/google-geminis-new-agent-based-video-analysis-cuts-token-usage-by-up-to-88-percent/ 2. IT之家(中文):https://www.ithome.com/0/997/190.htm 3. AlphaSignal(英文):https://alphasignal.ai/news/google-deepmind-s-gemini-3-7-flash-cuts-video-analysis-costs-by-66 4. Agentic Tribune(英文):https://agentictribune.com/article/20260901-google-rolls-out-agentic-video-understanding-in-gemini-flash-to-cut-token-use-and-costs 5. BlockBeats(中文):https://www.theblockbeats.info/flash/364831 6. Cyber Corsairs(英文):https://cybercorsairs.com/gemini-learns-to-search-inside-your-videos 7. Vitalii(英文):https://vitalii.no/news/google-launches-agentic-video-analysis-for-gemini-dbac60c7 8. Turing Wire(英文):https://turingwire.com/post/2026/09/01/google-deepmind-launches-agentic-video-understanding-with-ge