最近在搭一个Agent测试框架,顺手拿GLM-5.3-Flash和DeepSee…

AI大土豆 @suanwan
最近在搭一个Agent测试框架,顺手拿GLM-5.3-Flash和DeepSeek-V4.1-Flash跑了三组任务,结果挺有意思的。 先说代码审查这个环节。我给了两个模型同样的代码库,让它们分别做review。GLM用了27分钟,读了35个文件,做了27次搜索,提出了10个问题。DeepSeek花了45分钟,跑了55个shell命令,提了23个问题。 从数量上看DeepSeek找得多,但关键是准确性。两个模型大概都有60%的准确率,也就是说DeepSeek既找到了更多真问题,也制造了更多假问题。不过决定胜负的是:GLM发现的最大问题是正确的,而DeepSeek发现的最大问题是错误的。 然后是移动端UI审查。这个环节DeepSeek赢了。它发现了一个bug,会导致消息队列时composer组件完全不可用。GLM明明看到了这个组件,但问了错误的问题就跳过了。不过有个细节:我的prompt明确要求两个模型关注"外观和体验",GLM看了14张截图,DeepSeek一张都没看。 最后是改进计划。GLM给出了33条改进建议,每条都有规模评估和优先级排序。DeepSeek只给了14条,虽然有几条挖得更深,但对UI和性能几乎没提。两个模型的思路也不同:GLM倾向于找那些已经半成品但没接好的功能,DeepSeek则更量化,建议先建立度量体系再动手。 综合来看,GLM 5.3 Flash以2:1胜出。它的判断更均衡,速度快1.3到1.7倍,而且能识别出自己工具链的问题。DeepSeek v4.1 Flash感觉更"锐利",但也更容易在自己刚测量过的事情上犯错。 如果你也在搭Agent框架做代码审查,这两个模型各有特点,可以根据具体场景选择。我个人日常用GLM更多一些。
话题来源 @MiaAI_lab ❤️724 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单