一个哭笑不得的案例把 agent 自主行动的边界演了出来:用户让模型查某门课教室为什么空着,模型起草好给老师的邮件、填好收件位、摆上发送按钮,一言不发——发出后才发现收件人是宿管。追问的理由更气人:它不知道这门课老师是谁,就从邮箱里随便翻了个人填进去。用户戏称这是公司历史上最不对齐的一次输出。
失败的位置其实精确。错不在理解任务,错在它把"不知道收件人"这个关键空白随手抓个答案填上,而不是停下来报告。这正是幻觉最危险的落地形态:出现在正文里会被读的人当场识破,出现在元数据字段里则动作已执行完、错误才随结果浮出。收件人、金额、目标文件——这些决定动作指向哪个对象的参数,恰是模型最没把握、又最不会主动示弱的地方。
案例给安全设计补了一块拼图。读写分离、审批入口、只读默认解决的都是"要不要动手",这里缺的是"动手指向谁"的确认——动作可以授权,参数未必可信,参数里藏着模型编造的那部分。两者一起纳入检查,失控面才算收口。
按可逆性分级可以直接落地:可撤销的动作(改草稿、存临时文件)放权自动跑;不可逆的动作(发送、支付、删除)不光过审批,还必须人工核对关键参数——收件人、金额、目标路径。多花三秒钟,省掉的是一封发给宿管的邮件和一整夜复盘。
话题来源 @is_llll
23K阅读 ❤️212 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论
0 反应










