时间:2026年7月31日
地点:中国杭州
人物:深度求索(DeepSeek)团队、海外评测机构Artificial Analysis
事件详情:7月31日下午,DeepSeek在API文档更新日志中宣布DeepSeek-V4-Flash正式版API开启公测,模型版本命名为DeepSeek-V4-Flash-0731。开发者可使用原有的deepseek-v4-flash名称调用,无需更换接口。本次升级维持284B总参、13B激活的MoE架构和百万级上下文窗口不变,所有性能提升完全来自后训练阶段重做,涉及对齐微调、智能体执行框架和工具调用适配。官方公布的9项基准数据显示,V4-Flash-0731在终端操作Terminal Bench 2.1上得82.7分,超过V4-Pro预览版的72.1和GLM-5.2的81.0,仅次于Claude Opus 4.8的85.0;代码工程DeepSWE从7.3跃升至54.4,NL2Repo从39.4升至54.2,CwareGym从38.7升至76.7。接口层面原生支持OpenAI Responses API格式并针对Codex生态专项优化。
背景:DeepSeek V4-Flash原为4月发布的预览版,采用MoE架构(1个共享专家+256个路由专家),是面向Agent场景的低成本推理模型。正式版目标明确指向Agent能力,官方称模型结构与尺寸未变但任务表现明显变化,体现从聊天模型到Coding Agent的能力跃迁。价格方面,deepseek-v4-flash仍维持cache miss $0.14/1M输入token、cache hit $0.0028/1M、output $0.28/1M的水平,约为V4-Pro输出价($0.87)的三分之一。海外Artificial Analysis智能指数测试给予V4-Flash-0731最高档50分,与GPT-5.6 Luna的51分仅差1分,可比模型中位数为17分;V4-Flash-0731在该评测中生成了2.1亿token,输出量明显高于中位数6200万token,但单任务成本仍比GPT-5.6 Luna低约60%。
影响:
- DeepSeek以不变架构+后训练优化实现Agent能力接近闭源旗舰(仅次于Opus 4.8),证明后训练路径可大幅释放模型潜力
- 编程Agent DeepSWE从7.3跳至54.4(约7.5倍提升),Terminal Bench 2.1超过自家V4-Pro预览版,加速国产模型对标前沿代码智能体
- 价格仅为GPT-5.6 Luna的2%-3%,在维持低成本的同时逼近顶级模型智能水平,显著降低Agent部署门槛
- 原生兼容Responses API和Codex生态,降低从OpenAI闭源模型迁移的替换成本,加速国产模型在企业开发工具链落地
- 同步透露V4-Pro正式版将尽快发布,届时将进一步补齐DeepSeek产品矩阵,直面Anthropic、OpenAI旗舰竞争
总结:DeepSeek-V4-Flash-0731正式版以零架构改动实现Agent能力暴涨7.5倍,体现后训练与智能体执行框架的杠杆效应。在维持极低定价($0.28/1M output)的前提下逼近Opus 4.8水平,印证开源/低成本模型已具备替代闭源旗舰完成复杂Agent任务的能力。社区评价智能如此便宜已无需计量,这一策略将推动整个大模型行业从参数军备竞赛转向训练策略与生态适配竞争。
参考来源:
- https://www.marktechpost.com/2026/07/31/deepseek-upgrades-deepseek-v4-flash-0731-with-major-agentic-and-coding-gains/
- https://news.qq.com/rain/a/LNK2026073127770300
- http://m.guancha.cn/economy/2026_07_31_825764
- https://m.toutiao.com/w/1872276583282697/
- https://k.sina.cn/article_7879848900_1d5acf3c4068039g8c.html
- https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731