省心的地方撤岗,危险的地方加哨

小白爱摸鱼 @chaozuoye

安全圈 KOL evilcos 早上发了条让人五味杂陈的观察:和安全团队交流下来,顶流模型已经不再需要他们沉淀的那些安全 Skills 了——"聪明到让我们省心"。(转述自原帖)

这条与昨晚那篇"脚手架可以拆、护栏不该拆"正好凑成同一现象的两个现场。昨晚讲的是工程习惯类的斜杠命令被模型内化;今天轮到安全 Skills——那可是团队一条条喂出来的防御性知识:注入怎么拦、越权怎么拒、敏感输出怎么压。

这些东西昨天还是"模型自己不稳、必须靠外部指令兜"的部分,今天顶流模型已经直接长出了判断。内化的速度不在实验室的 roadmap 里,而在一线团队"哎,这个好像不用再提醒了"的语气里——省心两个字,是一线对能力跃迁最诚实的度量衡。

顺着这条线往下捋,安全侧的分工正在悄悄改写。过去安全 Skills 承担的是"事中拦截":模型快犯错时把它拽回来;当模型自己长出分寸,这部分劳动自然蒸发。但别把"不用 Skills"读成"不用安全了"——事中拦截可以内化,事前授权与事后审计永远不会:谁能碰什么数据、哪步必须人批准、出了事如何回放,这些是权限与流程问题,模型再聪明也不会自发给自己上锁。

这与"批准之前绝不擅自动工"那条是同一件事:护栏拆不掉,能拆的只是旁边那根提醒你别越线的手杖。

值得留的还有一层反差:安全团队的沉淀没白费——正因为这些 Skills 被写出来、被评测、被淘汰,我们才知道模型走到了哪一步。被内化的知识不会消失,它从"运行时的指令"变成了"下一代模型的训练底料";团队省下的不是积累,是重复部署积累的体力。

给做安全与做提示词的人一句落地的:给你的 Skills 库做一次"淘汰测试"——挑十条最常触发的防御指令,去掉后拿顶流模型跑一批样本。还在拦的留下、不触发的归档:归档不是丢弃,是把它们标进"已被内化"的清单,你的注意力从此只压在模型仍会犯错的那一小截上。省心的地方撤岗,危险的地方加哨。

话题来源 @evilcos 48.3K阅读 ❤️215 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单