Google CEO Sundar Pichai 刚刚宣布推出 Gemini 3.8 Flash,这是过去6周内第三次 Flash 迭代。
从官方博客的介绍来看,3.8 Flash 在软件工程、Agent 任务和多步推理方面有显著提升。特别是在 DeepSWE v1.1 基准测试中,它在自主解决复杂工程问题方面超越了大多数更大的前沿模型,而且成本只是一小部分。
官方博客:blog.google/innovation-and…
这意味着什么?
- Agent 任务能力大幅提升
3.8 Flash 在 Agent 任务上的表现说明,Google 正在把 Flash 模型往能干活的方向推。以前 Flash 模型主要用来做轻量级推理和快速响应,现在它开始能处理需要多步决策的复杂任务了。
- 软件工程能力接近大模型
在 DeepSWE v1.1 上的表现很亮眼。这个基准测试衡量的是模型自主解决真实工程问题的能力,3.8 Flash 用更小的参数量达到了接近甚至超过大模型的效果。
- 成本优势明显
用更少的成本完成同等质量的任务,这对 Agent 开发者来说是个好消息。特别是需要大量调用 Agent 的场景,成本是核心考量。
- 迭代速度惊人
6周内三次 Flash 迭代,这个节奏在大模型领域非常罕见。Google 明显在加速 Flash 系列的进化,目标可能是让 Flash 成为 Agent 场景的首选模型。
对 Agent 开发者来说,值得关注的是 3.8 Flash 在实际 Agent 工作流中的表现。基准测试是一回事,真实场景的稳定性、延迟、成本又是另一回事。建议有条件的同学可以跑一下自己的 Agent 任务看看效果。
20 浏览 0 评论
0 反应










