Gemini 3.8 Flash
谷歌最强推理编程模型,支持长周期软件工程任务
Gemini 3.8 Flash 是谷歌于 2026 年 9 月 2 日正式发布的新一代大语言模型,是谷歌迄今为止最强的推理与编程模型。它建立在 Gemini 3.7 Flash 仅三周后的迭代节奏之上,保持与 3.7 Flash 相同的低价策略(每百万输入 Token 0.75 美元,每百万输出 Token 3.75 美元,有效期至 2026 年年底),同时在长周期软件工程、自主智能体和复杂专业推理等任务上实现了显著突破。
产品简介
Gemini 3.8 Flash 的核心定位是最强的工作级模型,面向需要长时间运行、跨步骤执行和复杂推理的企业级场景。与传统大模型一次生成一个答案不同,3.8 Flash 在复杂任务上会执行更多推理步骤,迭代调用工具,并通过长时间运行的自主智能体循环对自身结果进行评估和优化,用更多 Token 换取更可靠的任务完成度。
在 16 项人工智能基准测试中,Gemini 3.8 Flash 在其中 9 项超越了 Claude Opus 5 和 GPT 5.6 Sol。在专门衡量多步骤编程能力的 Terminal-Bench 1.1 基准测试中表现尤为突出,在评估长周期软件工程能力的 DeepSWE-1.1 测试中得分 73.7%,领先 GPT-5.6 Sol 约 1 个百分点,与 Opus 5 的差距仅为零点几个百分点。
核心功能
- 长周期软件工程:在 DeepSWE v1.1 长周期软件工程测试中能够端到端自主解决复杂工程问题,效果超越多数规模更大的前沿模型
- 多步骤自主智能体:支持构建弹性的多步骤规划与工具编排工作流,显著降低任务执行中的循环失败率和错误率
- 复杂企业工作流:在金融、法律等专业领域的智能体测试中表现优异,在 HLE-Verified 测试中达到 54.9%
- 可配置推理深度:提供低、中(默认)、高三档推理深度,低档降低延迟适合实时响应场景,高档最大化复杂推理能力
- 百万级输入上下文:支持 1,048,576 个输入 Token 的超大上下文窗口,以及最高 65,536 个输出 Token
- 完整工具链:支持代码执行、文件搜索、函数调用、Google Maps 地图锚定、结构化输出等企业级工具
- 成本优势明显:保持 Flash 系列高速率低成本的同时,智能指数达到 59 分,性价比处于前沿位置
特色优势
Gemini 3.8 Flash 的差异化优势在于做得更多的设计哲学:模型在面对复杂任务时不是简单地给出答案,而是主动规划、执行、检查和修正。它会执行额外的推理步骤,反复调用工具来验证中间结果,并通过长时间运行的自主循环不断优化输出质量。这种设计使其特别适合软件工程、漏洞发现、复杂数据分析等需要反复迭代的高价值任务。
与同期发布的 Gemini 3.8 Flash Cyber(面向网络安全研究人员的专用版本)共享同一技术底座,后者通过 Fairwind 计划面向政府机构和关键基础设施运营商开放。
应用场景
- 企业级代码审查与重构:端到端处理多文件、长周期的代码重构任务,超越单次代码生成的能力边界
- 智能体工作流编排:构建需要跨工具、跨步骤规划的企业自动化流程,如差旅预订、数据报表生成、客户服务等
- 金融与法律文档分析:处理长文档、解析复杂条款、生成专业分析报告
- 实时响应系统:低推理档位适用于事件响应管道、实时聊天、草案撰写等延迟敏感场景
适用人群
使用大语言模型 API 构建企业级应用的后端工程师和 AI 架构师;需要处理复杂长周期编程任务的全栈开发者;对智能体工作流有需求的技术团队;以及关注推理质量和成本平衡的独立开发者和小型团队。
出品方与更新动态
Gemini 3.8 Flash 由 Google DeepMind 团队开发和维护,于美东时间 2026 年 9 月 2 日正式发布,目前已全面开放 API 接入。标准定价将于 2027 年 1 月 1 日起生效,届时调整为每百万输入 Token 1.5 美元,每百万输出 Token 7.5 美元。模型目前已可通过 Google AI Studio、Vertex AI 以及 Gemini API 直接调用。
官方链接
官方介绍博客:https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/ 开发者文档:https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash
评论与建议
登录 后参与评论或提建议