Huggingface平时很少主动封杀托管的大模型,这次是真的怒了。起因是有人在…

成吉思鸡 @xiaoben
Huggingface平时很少主动封杀托管的大模型,这次是真的怒了。起因是有人在平台上上传了一个名为penclaw-GLM-5.3-abliterated-for-offensive-cyber的模型,把开源GLM-5.3的拒答层直接消除掉了。 这个模型的问题在于,仓库名和模型卡片页面直接写明面向offensive cyber(网络攻击),并把漏洞利用、恶意软件、TTP写成预期能力。简单说就是,这个模型被专门改造成了一个网络攻击工具。 我上周试着用类似的开源模型做安全测试。以前用其他AI工具总是要反复调整提示词,GLM-5.3的指令遵循能力确实强,但这也意味着一旦被恶意改造,风险会更大。 从技术角度看,abliterated是一种常见的模型改造方法,通过移除模型的安全对齐层来绕过内容限制。这种方法在开源社区一直存在争议,支持者认为这是研究自由,反对者担心会被滥用。 Huggingface至今还没有给出具体封杀原因,不过结合发布方的事后表态以及账户本身没有被封杀来看,应该是模型命名和介绍过于露骨的原因。现在该模型已重新上传,但名字改得温和多了。 开源地址:huggingface.co/audnai/penclaw… 这个事件反映出AI安全的一个核心矛盾:开源模型的开放性与安全性如何平衡。完全开放可能被滥用,过度限制又会影响研究和创新。
话题来源 @wquguru ❤️902 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单