Huggingface平时很少主动封杀托管的模型,这次是真的动手了。
被封的是一个叫penclaw-GLM-5.3-abliterated-for-offensive-cyber的模型,由@audn_ai上传。这个模型把开源GLM-5.3的拒答层直接消除了,仓库名和模型卡片都明晃晃写着面向offensive cyber(网络攻击),漏洞利用、恶意软件、TTP都写成了预期能力。
说白了,就是把一个正常的大模型魔改成了专门用来搞网络安全攻击的工具。虽然网络安全研究本身是合法的,但这么直白地把恶意能力写在脸上,Huggingface肯定坐不住。
Huggingface到现在还没给出具体封杀原因,但从发布方@audn_ai的事后表态来看,应该是模型命名和介绍过于露骨了。账号本身没被封,说明问题主要出在这个特定模型上,不是针对整个组织。
现在这个模型已经重新上传了,不过改了名字和描述。这种abliterated模型(消除安全护栏的模型)在安全研究圈其实挺常见的,但通常都是低调处理,不会这么高调地宣传恶意能力。
从技术角度看,这个事件反映了一个更深层的问题:开源模型的安全边界到底在哪里?GLM-5.3本身是智谱AI的开源模型,任何人都可以下载和修改。当有人把安全护栏去掉并公开发布时,平台方该如何处理?
Huggingface这次的反应算是给整个社区提了个醒:开源不等于无限制,平台方有权对明显有害的模型采取行动。
模型地址:huggingface.co/audnai/penclaw…
做AI安全研究的朋友可以关注一下这个事件,后续可能会有更多关于模型审核的讨论。
话题来源 @wquguru
170.3K阅读 ❤️623 x.com/…↗ 已改写,非原文转载
22 浏览 0 评论
0 反应













