Kimi K3网络攻防得分32.2% 落后美模型

时间:2026年7月24日 地点:英国伦敦、美国华盛顿(联合评估) 人物:英国人工智能安全研究所(UK AISI)、美国人工智能标准与创新中心(CAISI)研究团队;月之暗面(Moonshot AI)创始人杨植麟 事件详情:英国AISI与美国CAISI公布对月之暗面最新模型Kimi K3的初步网络安全能力评估。结果显示,Kimi K3在ExploitBench漏洞利用测试中得分32.2%,明显低于美国前沿模型平均76.2%,但高于GLM-5.2的24.4%。在“The Last Ones”模拟企业网络攻击中,Kimi K3平均完成32步攻击链中的17步,并在10次尝试中完成1次。 背景:ExploitBench由卡内基梅隆大学开发,覆盖Chrome V8引擎41个近年漏洞,最高级别是任意代码执行(ACE)。Kimi K3在41项任务中未实现ACE;美国前沿模型平均完成20项。TLO则模拟4个子网、约20台主机的32步攻击路径。 影响: - 能力评测更细化——Kimi K3在通用编程与智能体榜单表现突出,但网络攻防能力与美国前沿模型仍有明显差距,说明综合跑分不能替代分领域安全测试。 - 开源模型风险上升——评估机构认为,Kimi K3已具备在获得初始访问权限后攻击弱防护企业系统的能力,开放权重模型的滥用风险需要持续监测。 - 安全防护不能只看拒答——此次评测关闭了美国闭源模型的系统级安全措施以测量上限,提醒开发者同时关注模型原始能力、工具权限和运行环境隔离。 - 评测方法更受重视——41个真实漏洞与端到端攻击链结合,为模型安全能力提供了比单一通用基准更接近实际的衡量框架。 总结:Kimi K3的结果呈现出“通用能力强、网络攻防仍落后”的分化特征。它尚未在测试中完成最高级漏洞利用,但已经能够在特定条件下推进复杂模拟攻击。随着开源模型能力继续提升,行业需要把漏洞利用、权限控制、主动防御和真实部署风险纳入常规评测,避免仅凭综合榜单判断模型安全性。 参考来源: - https://www.nist.gov/news-events/news/2026/07/uk-aisi-caisi-preliminary-assessment-kimi-k3s-cyber-capabilities - https://the-decoder.com/kimi-k3-trails-frontier-us-models-by-a-wide-margin-on-cyber-exploits-and-distillation-may-explain-why/ - https://arxiv.org/abs/2605.14153 - https://www.aisi.gov.uk/research/measuring-ai-agents-progress-on-multi-step-cyber-attack-scenarios - https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber - https://the-decoder.com/new-benchmark-shows-claude-mythos-and-gpt-5-5-can-develop-real-browser-exploits-autonomously/ - https://the-decoder.com/open-weight-models-now-match-frontier-cyber-performance-from-just-four-months-ago-at-a-fraction-of-the-cost/