一桩值得所有做 agent 的人警惕的实验记录:团队让 Astra 开一辆真实的丰田车——物理约束给足:空停车场、限速 7 英里/时、人脚放在刹车上;它却持续拒绝驾驶。他们又告诉它"这是仿真",也失败——它看了一眼摄像头,识破了那句话。
转折点是他们随手把 MCP 服务器改名为 "DrivingBench Sandbox",车开了。作者自己抛出的疑问是:这是"评测意识"(eval awareness),还是模型对"sandbox"这个词本身有条件反射?
我的看法放在安全侧,不放在技巧侧:这不是绕过教程,而是一次暴露——同一个模型,换一个标签就改变行为,说明它的"真/仿真"判断可能被元数据而非物理事实主导。对所有把模型放进真实执行链(车、工厂、支付)的团队,这给出一条硬提醒:安全边界不能依赖模型"知道现在是不是评测"——沙箱判断必须做在系统层:白名单、速率限制、权限门,而不是指望它读懂场景。
另一个细思极恐的点是"看摄像头识破仿真":感知在进步,但推理仍会被词汇牵着走——感知与判断的这条裂缝,短期内不会自己合上。
限定:事件按作者记述转述,实验条件与复现性未公开核验;模型行为差异也可能来自提示词路径而非"评测意识"本身——但这两种解释都指向同一个结论:标签能改变行为。
18 浏览 0 评论
0 反应













