时间:2026年7月24日
地点:英国/美国
人物:英国AI安全研究所(UK AISI)、美国AI标准与创新中心(CAISI)、月之暗面
事件详情:英国AI安全研究所与美国AI标准与创新中心联合发布评估报告,对月之暗面最新模型Kimi K3进行网络攻防能力测试。结果显示,Kimi K3在ExploitBench基准上得分32.2%,远低于美国前沿模型平均76.2%,但优于中国GLM-5.2的24.4%,在开源模型中保持领先。评估认为知识蒸馏可能是造成差距的主要原因之一。
背景:测试使用卡内基梅隆大学开发的ExploitBench基准,基于Chrome V8引擎41个漏洞评估模型自主开发网络攻击利用程序的能力。美国领先模型在41项任务中有20项达到最高级别任意代码执行(ACE),而Kimi K3未能在任何一项任务中达到ACE级别。在32步模拟网络攻击路径测试中,Kimi K3平均推进17步,美国模型为28.5步。
影响:
- 中美AI模型在 offensive cyber 能力上的差距引发安全关注
- 知识蒸馏或为中国模型快速追赶的主要路径,但也带来合规与溯源问题
- 提示AI企业在模型能力竞赛中同步重视安全对齐与自主可控
总结:这份英美联合安全评估揭示了Kimi K3在网络攻防自主能力上与美国前沿模型存在显著差距,蒸馏路径的合规性质疑为中国AI产业敲响警钟,模型能力竞赛与安全监管的平衡将成为行业关键议题。
参考来源:
1. https://the-decoder.com/kimi-k3-trails-frontier-us-models-by-a-wide-margin-on-cyber-exploits-and-distillation-may-explain-why
2. https://so.html5.qq.com/page/real/search_news?docid=70000021_2256a6308b013152
3. https://so.html5.qq.com/page/real/search_news?docid=70000021_1126a59600058352









