GPT-6 Astra + Codex:Terminal-Bench 4.0第一,成本只要一半!
Terminal-Bench 4.0第一!GPT-6 Astra + Codex才是现在的王炸组合!
58.2% vs Fable 5.1 的 57.9%。
分数只高 0.3 个点,成本却只有第二名一半:$3.3k vs $6.2k。
再看第三名 Opus 5:51.8%、$6.0k、6.5B tokens。
Astra 用 1.5B tokens 就把分数拉开 6.4 个点。
Agent 时代比的不是谁更贵,是谁用更少的钱把终端任务做完。
Codex harness + Astra,效率赢了!
这个结果说明了Agent时代的核心竞争力:不是谁更贵,而是谁用更少的钱把终端任务做完。
- 成本优势明显。Astra用$3.3k就达到了$6.2k的效果,成本只有第二名的一半。
- 效率优势明显。Astra用1.5B tokens就把分数拉开6.4个点,效率远超竞品。
- 组合优势明显。Codex harness + Astra的组合,发挥了1+1>2的效果。
这个结果对AI Agent开发者的启示是:选择合适的模型和工具组合,比单纯追求高性能更重要。有时候,一个高效的组合比一个昂贵的单体模型更实用。
Terminal-Bench 4.0是一个终端任务基准测试,测试AI Agent在终端环境中的任务完成能力。Astra在这个测试中排名第一,证明了它在Agent领域的实力。
25 浏览 0 评论
0 反应











