AI 写的代码自己打分?那谁来裁判裁判者——Linejudge 给答案

AI 写的代码,到底能不能跑?

你肯定见过这种场景——AI Coding Agent 信心满满地说「完成了」,结果一运行,404 加报错红一片。问题在哪?模型在给自己打分,自己裁判自己,能客观吗?

Linejudge 就是来解决这个问题的。它是专门给编码智能体准备的「独立裁判」——不信任任何 Agent 的自我声明,跑完任务后自己去验证结果:真实命令、真实 diff、真实退出码,全部交给机器判断。

怎么工作的?

原理不复杂:Agent 执行完任务,Linejudge 会在旁边启动独立验证流程,对比任务要求和实际产出。它不看 Agent 说了什么,只看实际文件系统改动和运行结果。

作者实测了 8 个真实修复 patch,结果很有意思:Agent 自身报告全部成功,Linejudge 独立验证后发现其中 2 个其实没修对——一个处理了 utf-16 但回归了 utf-8,一个约束解析器漏掉了 SQL 注释里的条件判断。这些靠人工 review 或 Agent 自测都很难发现。

为什么这很重要?

现在市面上的 Coding Agent 都是自己打分——模型说 done,框架就信了。这套逻辑在演示里很好看,但上线后风险全压在「Agent 有没有自我欺骗」这件事上。

Linejudge 把验证层独立出来,做成真正的第三方裁判。对做 Agent 评测、构建可靠 CI 流程、或者想搞清楚自家 Coding Agent 到底几斤几两的团队,这个工具值得一试。

怎么用?

开源项目,直接 clone 就能跑。它目前聚焦 SQLite-utils 这个真实项目的 issue 修复场景来验证效果,后续应该会扩展更多 benchmark。

对 LLM/Coding Agent 开发者来说,这是一个值得关注的信号:AI 写代码 + AI 验代码的闭环正在形成,但「谁来验证验证者」这个问题,Linejudge 率先给出了自己的答案。

https://github.com/phillipmex/linejudge


GitHub: https://github.com/phillipmex/linejudge

评论区

0 条评论

登录后可评论。

陈一铭 14 阅读