上周在搭建一个Agent框架时,顺手拿GLM-5.3-Flash和DeepSeek-V4.1-Flash跑了三个任务,结果挺有意思的。
第一个任务是代码审查。GLM用了27分钟,读了35个文件,做了27次搜索;DeepSeek花了45分钟,跑了55条shell命令。DeepSeek报了23个问题,GLM报了10个。两个模型的准确率都在60%左右,但GLM最大的发现是对的,DeepSeek最大的发现是错的。这个差异挺关键的,Agent场景下错误的高置信度输出比漏报更麻烦。
第二个任务是移动端UI审查。这个DeepSeek赢了,它发现了一个消息队列导致的可用性bug。GLM明明看到了那个组件,但问了个错误的问题就跳过了。不过有个细节:我的提示词明确要求关注视觉体验,GLM看了14张截图,DeepSeek一张都没看。
第三个任务是改进计划生成。GLM给出了33条改进建议,每条都标注了优先级和工作量;DeepSeek只给了14条,虽然在某些点上更深入,但对UI和性能几乎没提。GLM更擅长发现那些半成品功能,DeepSeek则更倾向于先建立度量体系再行动。
综合来看,GLM-5.3-Flash在Agent场景下表现更稳定,速度快1.3-1.7倍,而且能识别出自己工具链的问题。DeepSeek V4.1 Flash感觉更"锐利",但也更容易在自己刚测量过的事情上自信地犯错。
如果你也在搭Agent框架,可以参考这个对比。日常使用的话,GLM-5.3-Flash目前是我的首选。
话题来源 @MiaAI_lab
35.1K阅读 ❤️520 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论
0 反应













