时间:2026年7月23日
地点:深圳/中国(论文发布于arXiv开放平台)
人物:腾讯优图实验室、科恩安全实验室、Workbuddy团队与云鼎安全实验室
事件详情:2026年7月23日,腾讯在arXiv发布名为WorkBuddy Bench的多领域编码智能体评测套件论文,由腾讯优图实验室、科恩安全实验室、Workbuddy团队与云鼎安全实验室联合完成。该基准覆盖代码、网页、办公、安全四大领域共260个任务,是目前少有的全开放、全流程可审计的多领域编码智能体基准之一。WorkBuddy Bench最大的特色在于逆向工程任务构造:每道题都从真实代码提交、PR或业务场景拆解改写而来,配以角色扮演式口语化提示,从根源上防止模型通过在线搜索背题。四个子集分别采用隐藏测试、规则加LLM/VLM评判、确定性规则及五层反作弊机制运行,安全子集锚定binutils、curl、nginx等真实CVE。基准排行榜显示Claude Opus 4.8横扫多个细分排名第一,GLM-5.2与GPT-5.5分别在安全与办公子集登顶。
背景:当前AI编码智能体评测面临两大长期痛点,一是SWE-bench、Design2Code等基准各管一摊,无法反映真实工作流;二是公开题目被模型大批量爬取记忆,导致排行榜失真,业界亟需可审计、抗污染的统一基准。腾讯此次推出WorkBuddy Bench,把代码、网页、办公、安全四块拼到同一套任务目录里,配套完整的评测工具链与公开参考方案,是国内大厂在编码智能体基准领域少见的系统化尝试。其论文已挂在arXiv上对外开放。
影响:
- 推动行业从单点评测迈向多领域端到端综合评估,让编码智能体代码加前端加办公加安全能力可被同台比较
- 任务逆向工程加角色化提示机制为反数据污染提供可复现工程范式,倒逼其他基准厂商重新设计防作弊方案
- 安全子集锚定真实CVE并设五层防作弊,将为企业采购自动化编码工具提供量化安全基线
- 排行榜结果让Claude Opus 4.8、GLM-5.2、GPT-5.5等头部模型在多领域真实工作场景中的能力水位更清晰可读
- 项目由腾讯多家安全加AI实验室联合出品,进一步巩固腾讯在AI评测加安全双轮战略上的存在感
总结:腾讯WorkBuddy Bench用260道任务、四领域覆盖与五层反作弊,首次在国内给出了面向编码智能体的开放、抗污染、统一基线。它直接回应了SWE-bench等公开榜被爬被背题的顽疾,也把前端加办公加安全这些工程界最关心却最难量化的能力摆进同一张榜单。随着榜单持续校准、跨语言与OCR及GUI扩展,未来有望与SWE-bench并列成为全球编码智能体新基准,进一步重塑大模型编码能力评测的话语权。
参考来源:
- https://arxiv.org/abs/2607.20911
- https://arxiv.org/html/2607.20911v1
- https://tech.ifeng.com/c/8uVTcaBpxJw
- https://www.163.com/dy/article/L2K9GKV905445SO5.html
- https://baijiahao.baidu.com/s?id=1871576093772841021
- https://mp.guancha.cn/internation/2026_07_24_824985.shtml









