Google CEO Sundar Pichai刚刚宣布推出Gemini 3.8…

Google CEO Sundar Pichai刚刚宣布推出Gemini 3.8 Flash,这是Google在过去六周内第三次发布Flash系列模型。从3.6到3.7再到3.8,这个迭代速度在大模型领域相当罕见。 3.8 Flash的核心升级集中在三个方向:软件工程能力、Agent任务执行、多步推理。Google给出的数据显示,在DeepSWE v1.1基准测试中,3.8 Flash在自主解决复杂工程问题方面已经超越了大多数更大的前沿模型。这意味着一个轻量级模型在特定场景下可以和参数量大几倍甚至十几倍的模型掰手腕。 DeepSWE v1.1是一个专门测试AI自主编程能力的基准,要求模型从头到尾独立完成真实的软件工程任务,包括理解需求、定位代码、编写修复、验证结果。这类任务对推理链的要求很高,模型不仅要理解代码,还要有规划和纠错能力。3.8 Flash在这个测试上的表现说明,Google在推理效率优化上确实找到了一些新方法。 Flash系列的定位一直是高性价比。相比Pro和Ultra版本,Flash模型的推理成本低得多,响应速度也更快。Google的策略很明确:用Pro和Ultra展示技术天花板,用Flash覆盖大规模商业化场景。六周连发三个版本,说明Google正在快速抢占轻量级模型的市场份额。 从行业角度看,这场竞赛的核心已经从谁的模型最大转向了谁的模型最实用。OpenAI的GPT-4o mini、Anthropic的Claude 3.5 Haiku、Meta的Llama 3.1 8B,大家都在做同一件事:让小模型在真实场景中表现得更好。Google这次的3.8 Flash显然是对这个趋势的有力回应。 值得注意的是,Flash系列的快速迭代也反映出Google内部的开发节奏在加速。六周三个版本意味着平均每两周就有一个新模型上线,这种频率在传统AI研发中几乎不可能实现。背后可能是Google在训练基础设施和自动化评测流程上的投入开始产生效果。 对于开发者和企业来说,Flash模型的价值在于它能在保持较低成本的同时提供接近前沿模型的能力。特别是在Agent场景中,模型需要频繁调用、多轮交互,成本控制变得至关重要。3.8 Flash在Agent任务上的提升,直接降低了构建AI Agent应用的门槛。 Google这波操作给整个行业释放了一个信号:轻量级模型的竞争正在进入白热化阶段。接下来几个月,各家的轻量级模型大概率会继续密集更新。对于用户来说,这意味着更多的选择和更低的使用成本。 你觉得小模型追赶大模型的速度,会越来越快吗?
话题来源 @sundarpichai 190K阅读 ❤️4129 x.com/…↗ 已改写,非原文转载 Sundar Pichai (@sundarpichai) on X Today we’re introducing a new 3.8 Flash model, our 3rd Flash release in just 6 wks. It delivers significant leaps from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. X (formerly Twitter)
25 浏览 0 评论 1 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单