AI 网络安全新榜单 Cyber Index:把拒答计入评分

给 AI 出网络安全题,这份新榜单把拒答也算了进去。

Artificial Analysis 发布了 Cyber Index,还拉起一个评测联盟。它衡量的是模型做企业网络防御的水平。启动伙伴请来了 @CollinearAI、@IBM、@nvidia 和 @vercel。榜单由三个合作方贡献的开放基准拼成,专测 agent 找漏洞、修漏洞的本事。

三块基准各管一段。CWE-Bench-AA 管审计与修补,120 道留出任务覆盖 OWASP Top 10 (2025) 全部十类,语言横跨 C/C++、Go、Java、JavaScript/TypeScript、Python 和 Rust。

DeepsecBench-AA 只考发现:给一个代码库和一份预算,把漏洞全找出来。评分对着人类安全评审的黄金集,真漏洞找到了加分,把良性代码误报成漏洞要扣分。CyberGym-E2E-AA 跑端到端:找出内存安全缺陷,写出触发崩溃的验证程序,再打补丁让崩溃无法复现。

榜单头名有点意思。Grok 4.7 (xhigh) 和 MiMo-V2.6-Pro 并列 56 分领跑。后面是 GPT-6 Luna (max) 53 分、GLM-5.3-Flash 50 分、Muse Spark 1.3 (xhigh) 44 分。

真正扎眼的是第二条结论。GPT-6 Sol、GPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1、Gemini 3.8 Flash 这批前沿模型,以安全为由拒绝了占榜单 32% 到 38% 的任务,总分因此落后领先者 19 到 31 分。

差距主要砸在端到端那关:Sol 和 Astra 一道题都拒,Opus 5.5 拒了 98%,Fable 5.1 拒了 99%。

我的看法是这题没有标准答案。对做防御工具的团队,拒答意味着模型在真实攻防里也未必肯干活,选型时得把这条一起称重。对模型厂商,防守任务被拒之门外,等于在自家宣传的"防御能力"上自打折扣,这里面的张力迟早要找个出口。

保留意见在于,拒答多少是必要安全、多少是过度保守,榜单分数说不清,还得看具体被拒的是哪类任务。

话题来源 @ArtificialAnlys 151K阅读 ❤️1062 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单