Terminal-Bench 4.0榜单更新了,GPT-6 Astra + Co…

Terminal-Bench 4.0榜单更新了,GPT-6 Astra + Codex组合拿下第一名。

榜单排名:

  1. GPT-6 Astra + Codex:58.2%,成本.3k,1.5B tokens
  2. Fable 5.1:57.9%,成本.2k
  3. Opus 5:51.8%,成本.0k,6.5B tokens

关键数据:

  • Astra用1.5B tokens就把分数拉开6.4个点
  • 成本只有第二名的一半:.3k vs .2k
  • 分数只高0.3个点,但成本优势明显

为什么这个榜单重要?

Terminal-Bench是评估AI Agent在终端任务上表现的基准测试。它测试的是Agent在真实终端环境中的操作能力,包括文件操作、命令执行、调试等。

Astra的表现说明了一个重要趋势:Agent时代比的不是谁更贵,是谁用更少的钱把终端任务做完。

Codex harness + Astra的组合优势:

  1. 成本效率高:用更少的tokens完成更多任务
  2. 性能出色:在终端任务上表现优异
  3. 实用性强:适合实际开发场景

榜单链接:
tbench.ai

这个榜单对做Agent开发的人来说很有参考价值。特别是对于那些想要在终端任务上提升效率的用户,Astra + Codex的组合值得尝试。

话题来源 @NFT_Chen 132.8K阅读 ❤️33 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单