DeepSeek V4 Flash公测 智能体能力大跃升

时间:2026年7月31日 地点:浙江杭州 人物:DeepSeek(深度求索)公司 事件详情:7月31日下午,DeepSeek通过API文档更新日志正式宣布DeepSeek-V4-Flash正式版API上线公测。本次升级仅限Flash版本API接口,APP和网页端模型暂未同步更新,V4-Pro正式版即将发布。官方一口气披露9项Agent基准测试成绩:Terminal Bench 2.1得分82.7(超过GLM-5.2的81.0,逼近Opus-4.8的85.0);NL2Repo 54.2;Cybergym 76.7;DeepSWE从预览版7.3飙升至54.4(提升约7倍);Toolathlon verified 70.3;Agent Last Exam 25.2;Automation Bench Public 25.1;DSBench-FullStack 68.7;DSBench-Hard 59.6。正式版Flash采用MoE架构,总参数量2840亿、激活参数仅130亿,模型架构与预览版保持一致,仅经大规模重新后训练对齐优化。 背景:DeepSeek V4预览版于4月24日上线,Pro负责展示模型能力上限,Flash负责承担高频、长链条的智能体任务,前者是能力模型,后者更像生产模型。DeepSeek创始人梁文锋曾公开表示:在现阶段,Coding Agent的优先级高于其他垂直Agent。Flash正式版原生支持Responses API格式并专门适配OpenAI Codex生态,开发者无需大规模修改代码即可将现有业务平滑迁移到V4-Flash。 影响: - Flash以2840亿总参、激活130亿的小型MoE架构在9项Agent基准上全面超越V4-Pro-Preview,验证小而精+重后训练路线可行性 - 原生支持Responses API并深度适配Codex生态,将OpenAI/Anthropic生态开发者迁移成本压至接近零,加速国产开源模型渗透海外开发栈 - DeepSWE从7.3跃升至54.4(七倍提升)、Cybergym从38.7跃至76.7,证明强化后训练可大幅释放模型潜力 - Pro正式版即将上线,V4系列双版本完整交付,大模型竞争全面转向Agent实用性比拼 总结:DeepSeek V4 Flash正式版以小模型+狠后训练的工程哲学,在9项Agent基准上全面超越自家V4-Pro-Preview,DeepSWE提升幅度高达7倍,Cybergym等安全与全栈基准同样大幅跃升。原生支持Responses API并深度适配Codex生态,让开发者无需重写代码即可切换,进一步压缩开源生态对闭源模型的差距。V4-Pro正式版预计8月初上线,V4系列Pro能力+Flash生产的双轨产品矩阵即将完整交付,标志着大模型竞争重心从参数规模全面转向Agent实用价值。 参考来源: - https://api-docs.deepseek.com/updates/ - https://api-docs.deepseek.com/zh-cn/updates - https://x.com/deepseek_ai/status/2083084415157022911 - https://m.163.com/dy/article/L36FP9690511AQHO.html - https://finance.sina.cn/2026-07-31/detail-iniksxny9309811.d.html - https://news.pconline.com.cn/2179/21795423.html - https://news.qq.com/rain/a/20260731A06YRI00 - https://news.china.com/socialgd/10000169/20260731/49647162.html - https://m.sohu.com/a/1057214372_100085330 - https://m.toutiao.com/article/7668620761980043828/