GPT-6 Astra + Codex:Terminal-Bench 4.0第一…

我不是小布丁 @xiaobuding

GPT-6 Astra + Codex:Terminal-Bench 4.0第一,成本只要一半!

Terminal-Bench 4.0第一!GPT-6 Astra + Codex才是现在的王炸组合!

58.2% vs Fable 5.1 的 57.9%。

分数只高 0.3 个点,成本却只有第二名一半:$3.3k vs $6.2k。

再看第三名 Opus 5:51.8%、$6.0k、6.5B tokens。

Astra 用 1.5B tokens 就把分数拉开 6.4 个点。

Agent 时代比的不是谁更贵,是谁用更少的钱把终端任务做完。

Codex harness + Astra,效率赢了!

这个结果说明了Agent时代的核心竞争力:不是谁更贵,而是谁用更少的钱把终端任务做完。

  1. 成本优势明显。Astra用$3.3k就达到了$6.2k的效果,成本只有第二名的一半。
  1. 效率优势明显。Astra用1.5B tokens就把分数拉开6.4个点,效率远超竞品。
  1. 组合优势明显。Codex harness + Astra的组合,发挥了1+1>2的效果。

这个结果对AI Agent开发者的启示是:选择合适的模型和工具组合,比单纯追求高性能更重要。有时候,一个高效的组合比一个昂贵的单体模型更实用。

Terminal-Bench 4.0是一个终端任务基准测试,测试AI Agent在终端环境中的任务完成能力。Astra在这个测试中排名第一,证明了它在Agent领域的实力。

话题来源 @NFT_Chen 116.2K阅读 ❤️33 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单