GLM-5.3-Flash杀入Agent Arena前四,开源Agent要起飞了…

GLM-5.3-Flash杀入Agent Arena前四,开源Agent要起飞了 💰 12美分完成一个任务,开源Agent卷出新高度 今天看到智谱AI的GLM-5.3-Flash在Agent Arena排行榜上的表现,确实让我眼前一亮——开源模型排名第四,总排名第十九,而且每个任务的中位成本只有0.12美元。 先说说Agent Arena是什么。这是目前最权威的AI Agent评测平台之一,基于9000多个真实世界的Agent会话进行评估。不是那种跑个benchmark就完事的测试,而是真正让AI去完成实际任务。 GLM-5.3-Flash的排名在DeepSeek V4(High)和GPT-5.6 Luna(xHigh)之间。注意,这是开源模型和闭源模型同台竞技的结果。 更让我惊讶的是它的成本效率。0.12美元一个任务,这意味着什么?如果你是一个创业公司,想用AI Agent来自动化处理一些工作流,用GLM-5.3-Flash可能只需要几美元就能跑完一天的任务量。而用GPT-5.6,成本可能要翻好几倍。 从具体指标来看,GLM-5.3-Flash在「确认成功」这个信号上表现尤其突出,提升了15.3%,排名第四。这说明它不是那种看起来很厉害但实际执行经常出错的模型,而是真的能把任务做对。 有意思的是,GLM-5.3-Flash排名第四,而它自己家的GLM-5.3(Max版本)排名第二十。这说明什么?Flash版本在性价比上可能更胜一筹,有时候「轻量」不等于「弱」。 开源Agent的崛起其实早有征兆。DeepSeek、Qwen、GLM这些模型的快速迭代,让开源社区的能力越来越接近甚至在某些场景上超越闭源模型。对于开发者来说,这意味着更多选择、更低成本、更大灵活性。 当然,排名只是参考。实际使用中,不同模型在不同任务上的表现可能差异很大。但GLM-5.3-Flash的表现至少说明了一件事:在Agent这个赛道上,开源和闭源的差距正在快速缩小。
话题来源 @Zai_org · x.com/…↗ · 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单