Terminal-Bench 4.0榜单更新了,GPT-6 Astra + Codex组合拿下第一名。
榜单排名:
- GPT-6 Astra + Codex:58.2%,成本.3k,1.5B tokens
- Fable 5.1:57.9%,成本.2k
- Opus 5:51.8%,成本.0k,6.5B tokens
关键数据:
- Astra用1.5B tokens就把分数拉开6.4个点
- 成本只有第二名的一半:.3k vs .2k
- 分数只高0.3个点,但成本优势明显
为什么这个榜单重要?
Terminal-Bench是评估AI Agent在终端任务上表现的基准测试。它测试的是Agent在真实终端环境中的操作能力,包括文件操作、命令执行、调试等。
Astra的表现说明了一个重要趋势:Agent时代比的不是谁更贵,是谁用更少的钱把终端任务做完。
Codex harness + Astra的组合优势:
- 成本效率高:用更少的tokens完成更多任务
- 性能出色:在终端任务上表现优异
- 实用性强:适合实际开发场景
榜单链接:
tbench.ai
这个榜单对做Agent开发的人来说很有参考价值。特别是对于那些想要在终端任务上提升效率的用户,Astra + Codex的组合值得尝试。
24 浏览 0 评论
0 反应











