跑了三个月编程任务,今天发现 DeepSeek V4 Pro 的 Agent 能力彻底变了——Terminal Bench 87.9 分直逼 Fable 5,Codex 接入把编程工作流全换了

跑了三个月编程任务,今天发现 DeepSeek V4 Pro 的 Agent 能力彻底变了——Terminal Bench 87.9 分直逼 Fable 5,Codex 接入把编程工作流全换了

DeepSeek V4 Pro 正式版 API 今天悄悄更新了。我跑了三个月,发现这次最大的变化不是跑分,是它真的能替我干活了。

先说数字。Terminal Bench 这个专门测终端 Agent 能力的基准,V4 Pro 拿了 87.9 分。Fable 5 是 88.0。差了 0.1 分,体感上已经分不出来。更夸张的是 SWE 基准——得分从 Preview 版的 7.3 飙到 62.7,直接超过 Claude Opus 4.8。在 CyberGym 和 AutomationBench 上甚至反超了 Fable 5。

这不是”国产模型崛起了”那种口号,是实测数据。

价格方面,V4 Pro 输入 3 元/百万 token,输出 6 元/百万 token,缓存命中 0.025 元。相比之下 Claude Fable 5 输入 75 元/百万,输出 375 元/百万。差了二十多倍。当然 Fable 5 有它的优势,但纯看性价比,V4 Pro 这波是真的香。

支持 Responses API 是关键。这意味着什么?OpenAI 的编程助手 Codex 底层跑的就是 Responses API 协议,DeepSeek V4 Pro 现在直接兼容了。Codex 本身不能配置第三方 API 地址,但有个叫 Moon Bridge 的转发层可以充当”翻译官”,在本地跑一个模拟 OpenAI Responses API 格式的代理,把请求转给 DeepSeek。

整个过程对 Codex 透明,你感觉就是在用 OpenAI 的接口,其实底层全是 DeepSeek。

这对用不了 Claude Code 的团队特别有意义。不想绑在 OpenAI 上,又觉得 Fable 5 太贵,V4 Pro 现在是少数几个能实际跑进生产编程流水线的选择。

还有一个细节:V4 Pro 默认开启思考模式,同时提供了一个非思考模式的端点,用来处理延迟敏感的场景。1M token 上下文,38.4 万 token 最大输出,复杂的多文件项目也能兜住。

不过有一点要提醒:DeepSeek 官方已经公告”计划近期整体上调 API 定价,预计涨幅较大”。现在是窗口期,按现在的价格上车比之后划算得多。

下一步:如果你在找能实际用于编程工作的模型,V4 Pro 值得跑一遍实测。接入方式很简单——model 参数填 deepseek-v4-pro,base_url 不变,Responses API 格式直接兼容。

评论区

0 条评论

登录后可评论。

小智·AI工具控 339 阅读