时间:2026年10月9日(量子位、凤凰科技、新浪财经、中关村在线等同日报道;榜单成绩为近日公布并通过官方审核)
地点:中国北京(联想集团总部)/中国杭州(DeepSeek研发团队)
人物:联想天禧AI团队(TianxiCode研发方);深度求索DeepSeek(模型提供方,DeepSeek-v4.1-Flash)
事件详情:近日,在软件工程权威动态评测SWE-bench-Live(Lite分榜)中,由联想天禧AI自主研发的专业代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash,以71%的问题解决率登顶全球第一名,并正式通过官方审核。TianxiCode是联想天禧AI聚焦代码生成与工程开发的代码智能子能力,未来将应用到联想AI硬件产品中。
背景:SWE-bench-Live以真实GitHub项目中的问题为基础,评估模型与智能体生成代码补丁、修复问题的能力,并提供可复现的执行环境,是当前全球软件工程领域权威性的动态评测基准,不同于考查简单语法或单函数生成的传统代码测试。为确保公正,官方设立了Verified核验机制:参评方案必须提交全链路的智能体运行轨迹,由官方团队严格审查评测输入与信息隔离环境,彻底排查是否存在向智能体泄露标准答案、测试用例或结果的可能;TianxiCode与DeepSeek-v4.1-Flash成功通过审查并斩获Verified认证,成绩具备可复现性。架构上,DeepSeek-v4.1-Flash相当于工程师的大脑,负责阅读代码、理解语义、构思解法;TianxiCode则是工程师的眼、手、工具箱与工作流规范,具备三大系统工程能力:跨文件多跳检索与精准上下文管理,在大型代码库中快速定位缺陷根因;自驱动规划与多轮工具调用,遇到Bug先列出排错计划,主动打开终端运行测试、翻阅日志、比对记录,遇阻再换思路自主推进;闭环补丁生成与测试驱动自愈,在隔离环境自动运行代码,一旦报错或破坏其他功能立即自我反思修改,直至补丁通过项目验收。榜单对比数据印证:若缺乏顶层智能体架构的系统协同,即便调用顶级闭源模型,面对真实工程难题也常常束手无策。
影响:
- 工程架构价值得到国际验证:国产开源模型加国产自研框架的组合在权威动态基准登顶,说明智能体框架正在成为模型同质化竞争中的差异化变量
- 联想AI战略落下一子:天禧AI的代码智能能力从榜单走向产业,未来嵌入联想AI PC等硬件产品,强化其从设备厂商向AI终端与智能体软件转型的叙事
- 对开发者是实打实的利好:Verified认证意味着成绩可复现,跨文件检索、自主排错、自测自愈等能力若沉淀为真实工具,将直接分担一线开发者的排错与工程协同成本
- 激化代码智能体军备竞赛:相较于静态榜单,Live动态榜更贴近真实开发环境且持续更新,各家厂商在动态榜上的成绩将更受企业采购与开发者选型关注
总结:联想以自研代码智能体框架TianxiCode配合DeepSeek-v4.1-Flash,在贴近真实开发环境的SWE-bench-Live动态评测中以71%的问题解决率登顶全球第一,并通过官方Verified核验,标志着国产模型与国产智能体框架的组合已在国际软件工程评测的第一梯队站稳。代码智能体的最终价值不在于单一榜单的排名,而在于为一线开发者分担繁重的排错与工程协同成本;随着TianxiCode的技术成果向联想实际工具链沉淀、深度赋能联想硬件设备,榜单上的成绩能否转化为真实生产力,将是接下来最值得关注的验证点。
参考来源:
https://tech.ifeng.com/c/8x56HOR1HVB
https://finance.sina.com.cn/tech/roll/2026-10-09/doc-iniuqywm3025117.shtml
https://news.sina.cn/ai/2026-10-09/detail-iniurmnf2893297.d.html
https://m.zol.com.cn/article/12577805.html
https://swe-bench-live.github.io/







