最新消息:GPT-6 Astra在Terminal-Bench 4.0榜单中拿下第一名!
Terminal-Bench是一个评估AI模型在终端任务上表现的基准测试,主要测试模型在命令行环境中的编码、调试、系统管理等能力。
榜单成绩
1、GPT-6 Astra + Codex:58.2%,成本$3.3k,消耗1.5B tokens
2、Fable 5.1:57.9%,成本$6.2k
3、Opus 5:51.8%,成本$6.0k,消耗6.5B tokens
GPT-6 Astra以58.2%的成绩拿下第一,虽然只比第二名Fable 5.1高0.3个百分点,但成本只有第二名的一半。
关键优势
1、成本效率极高
Astra用1.5B tokens就完成了任务,而Opus 5需要6.5B tokens。在Agent时代,比的不是谁更贵,而是谁用更少的钱把终端任务做完。
2、Codex harness加持
GPT-6 Astra配合Codex harness使用,形成了现在的王炸组合。Codex harness提供了强大的工具调用和上下文管理能力。
3、性价比突出
Astra用一半的成本达到了与Fable 5.1相当的性能,对于需要大量终端任务的开发者来说,这是一个非常实用的选择。
实际应用
对于开发者来说,这个结果意味着:
1、日常编码任务
Astra可以高效完成日常的编码、调试、重构等任务,成本可控。
2、系统管理
在服务器管理、部署、监控等场景下,Astra能够快速定位问题并提供解决方案。
3、自动化脚本
编写和调试自动化脚本时,Astra的表现稳定可靠。
总结
GPT-6 Astra在Terminal-Bench 4.0中的表现证明了它在终端任务上的强大能力。配合Codex harness使用,以更低的成本达到了与顶级模型相当的性能。
对于需要频繁使用终端的开发者来说,Astra是一个值得考虑的选择。
榜单地址:tbench.ai











