时间:2026年9月30日
地点:瑞典 CodeScene(基于开源项目 Street Fighter III: 3rd Strike 反编译代码库)
人物:Adam Tornhill(CodeScene 创始人、《Your Code as a Crime Scene》作者)、CodeScene 工程团队、Claude Opus 模型
事件:
2026年9月30日,瑞典软件质量分析公司 CodeScene 发布一项里程碑式案例研究:使用 AI 编码代理对街霸 III 3rd Strike 反编译项目的 30 万行 C 代码库完成全面重构。代理在三周内累计提交 2,903 次 commit,覆盖 726 个源文件,修改 252,055 行代码,将 Code Health 评分由 5.6 提升至 10.0 满分;整个流程 token 成本仅约 4,000 美元,相当于一位开发者半个月薪资。对比同等规模项目在 AI 出现前通常需要 12 至 18 个月专家人力。
背景:
CodeScene 设计了两套机制保证重构质量:其一,CodeHealth MCP Server 作为客观质量信号,向代理提供确定性评分以判断重构是否有效,形成 agentic 反馈闭环;其二,replay-trace 哈希逐帧对比机制验证功能等价性,每改一处都逐帧对照游戏状态哈希,确保街霸仍可正常运行。模型选型上,团队最终确定 Claude Opus 为主力——Claude Code 配合 Opus 在捕捉与文档化新涌现的重构模式时显著优于 Codex 配合 Sol,且小模型(Sonnet、Terra)常陷入局部最优无法继续突破。
影响:
研究中沉淀出 22 条重构配方与 82 条补充说明,既包含 Extract Function、Guard Clauses、Parameter Object 等经典条目,也涌现出 Shared Index Range(捕获仅在起止界上不同的重复循环)、Action Parameter(统一仅在调用函数上不同的重复控制结构)、Uniform Step Table(异构调用转为表驱动分发)等针对本代码库的专属配方。CodeScene 创始人 Adam Tornhill 称这是他三十年从业以来首次见证的”超人类”AI 表现。LinkedIn 上业界就此激烈辩论,焦点已从”是否真发生”转向”该结果证明了什么”——既有工程师认为 replay-trace 比测试集证据更可靠,也有人质疑重构对象是开源游戏而非生产代码,以及 Code Health 提升是否等价于架构与性能改善。CodeScene 接下来将与瑞典 Lund 大学合作,让学生在 Code Health 5.6 与 10.0 两版同一系统上分别用前沿模型实现新功能,对比 70% AI 缺陷减少与 45% token 浪费减少两项预期收益。
总结:
CodeScene 案例首次在工业级 C 代码库上跑通”AI 代理 + 质量反馈环 + 行为等价性验证”端到端流程,将过去 12 至 18 个月的专家级重构压缩为 3 周与 4,000 美元,并把”超人类 AI”从口号落到可量化数字。但案例同时划出两条新边界:缺乏确定性回放 oracle 的遗留系统无法照搬此流程;Code Health 评分提升也不必然带来架构与运行时性能改善。该研究为 AI 编程代理从”局部补全”走向”整库工程”提供了首个可复用样本,也为衡量代理能力边界设立了新的对照标尺。
参考来源:
– https://www.infoq.com/news/2026/09/agentic-refactoring-case-study/
– https://codescene.com/blog/case-study-refactoring-at-scale-with-agents
– https://github.com/crowded-street/3s-decomp
– https://www.linkedin.com/posts/adam-tornhill-71759b48_this-is-my-biggest-ai-wow-moment-to-date-share-7508810521735806977-IQ8q/
– https://daily.dev/posts/agents-refactor-300k-lines-in-three-weeks-and-practitioners-ask-what-it-proves-qtk43gheh
– https://news.lavx.hu/article/agents-refactor-300k-lines-in-three-weeks-and-practitioners-ask-what-it-proves