安全新榜:找漏洞最好的模型也只及格四成

Artificial Analysis 新开的 Cyber Index 把各家模型放进了同一间安全考场:Grok 4.7 与小米 MiMo-V2.6-Pro 以 56 分并列榜首,GPT-6 Luna 以 53 分紧随——而这已经是全场最好成绩。 三份等权测试(CWE-Bench-AA、DeepsecBench-AA、CyberGym-E2E-AA)考的是找漏洞并修补的真实能力,结果给整个行业泼了盆冷水。 GPT-6 Astra、GPT-6 Sol、Claude Opus 5.5 和 Fable 5.1 在 32% 到 38% 的任务上直接拒答、按零分计;即便榜首,也只找到全部经专家核实漏洞的 41%。 这份榜单的价值在于揭穿了两个错觉。其一,通用能力榜上的座次在这里并不平移——四款旗舰在代码与写作上的光环,到了攻防语境里被拒答率拖回原点。 其二,56 分这个"第一"本身提醒所有人:这不是成熟赛道的冠军之争,而是所有选手都还没及格的补考现场,41% 的天花板意味着自动漏洞挖掘离无人化还很远。 安全从业者该有的预期也随之校准:现阶段模型是放大器而非替代者——让它们先跑初筛和 PoC 草稿,把专家时间留给那 59% 找不到的漏洞;反过来,把模型接进安全流水线前,先测它在敏感任务上的拒答模式,那 32% 到 38% 的零分区,正是需要人工兜底的岗位清单。 榜单把"AI 能否接管攻防"这个问题推迟了几年——在下一个榜首真正及格之前,专家仍坐在判断席的正中间,你的安全流程是不是也还这么排?
话题来源 @RoundtableSpace 38.8K阅读 ❤️25 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单