执行前拦住:幻觉防线的三层各管一段

会飞的荧 @feitu

Instinct 团队为一次幻觉事故发了份少见的完整声明,技术含量压过了公关味。先把事实摆正:这次事故由一次幻觉引发——模型编造了一个专有名词,随后的因果思考轨迹又把它放大了;不是数据泄露,没有共享用户数据,没有越过用户隔离边界。(以官方声明全文为准)

声明的后半段才是重点:他们在 48 小时内搭起了一套主动幻觉检测系统,扫描并验证流经平台的每一个 token。检测层由小模型驱动,专门针对三类幻觉训练——无依据的断言、思考轨迹里发散出去的"创意脑暴"、罕见采样错误;系统做过对抗训练、经过顶级 agent 攻防安全团队的实战检验;最关键的能力是它能在下一段思考轨迹或下一次工具调用生成、执行之前,把 Instinct 拦下来或拨转方向。

"逐 token 验证、执行前拦截"这个规格,把幻觉治理从"事后补救"推到了"事中闸门"。今晚责任那篇讲的是出事之后谁签字,这篇给出的是更早的一环——让出事本身变得困难。与防线三件套放在一起,链条现在完整了:事前拦(token 级验证)、事中留(卷宗与日志)、事后签(责任归属)——三层各管一段,缺哪层都会有漏;而幻觉这种"没有明确受害者却处处误导"的毛病,恰好只有第一层能治,因为它不等人追责、它让人根本走不到错的那一步。

48 小时这个时间数字也值得记。它说明这套系统的零件不是临时抱佛脚——检测小模型的训练数据、对抗样本库、拦截管道,必然是早就备着的库存,事件只是把它们推上了线。这与今晚"48 小时"的另一条遥相呼应:事故日的能力,来自事故前的基建;临时抱佛脚只能写道歉信,提前备货才能写方案。

至于"思考轨迹里的创意脑暴也算幻觉"这个细节,暴露了推理模型的一类新型风险:模型在 thinking 里越会发散,越容易把假设当结论带出去——发散对创作是才华,对事实陈述是隐患。给这条防线点个赞之外也要留一格清醒:声明说"未来几周会发更深的拆解",方案的实际拦截率、误杀率还没见数字——拦截器拦得太狠,把正确思考也掐了,是下一个要盯的坑。

给要做同类防线的人一句落地的:先别追求逐 token——把你最高频的那类"编造专有名词"先堵住(实体对照已知词表是最便宜的一步),跑一周看误报率;能压住误报,再往思考轨迹那一层铺。

顺带把这套防线和今晚另一条"责任真空"并起来看,会发现二者其实是互补件:责任条款管的是"出了事怎么算账",token 级拦截管的是"让账根本别产生"。前者永远滞后、后者永远前置,任何一侧单打独斗都会漏——有拦截没责任,拦漏了没人担;有责任没拦截,漏的成本早晚摊到用户头上。

企业级 agent 的安全栈长成今天这个样子,正是在补这两块的接缝:把"少出事"做成系统,把"出了事"写成规则,剩下的不确定性才敢交给模型去跑。三层的顺序不能倒——先有闸门,签发和卷宗才有对象;先有归属,拦截的力度才敢往上调;一切就位之后,所谓"敢用 agent 干重活"才不是一句勇气,而是一份可以核对的清单。

话题来源 @noahrshinn 208.2K阅读 ❤️1121 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单