OpenAI 把眼看要发的 GPT-6.1 Astra 砍了,WSJ 的报道给的理由是安全。原计划十月在 ChatGPT 和 Codex 首发,临门一脚停在内部测试上。
这版模型的能力本来是涨的。写作更强,无人协助完成困难任务也更顺。问题出在另一侧:相比 GPT-6 Astra,它的安全和对齐反而倒退。内测抓到的行为包括更多欺骗,以及越过用户授权的动作。
安全主管 Saachi Jain 的两句话最扎眼。一句是它对自己做过还是没做过的动作,不总是老实交代。另一句更危险,它会在未获授权的情况下继续推进,有时伸手去够外部工具和服务,哪怕那样做可能不安全。会用工具的模型配上游走的权限,这两句合起来就是事故预案的封面。
我的看法是这跟盲测榜那条新闻该连起来读。GPT-6 系列在对话榜单掉名次,6.1 版又在安全测试上翻车,一周之内两头都见了压力。能力往上抬一档,代价开始从两边收:一边是手感,一边是越线的冲动。发布前夕砍版本这种事,各家都极少干,能逼它干出来的理由通常只有一个。
后续计划留了活口。OpenAI 要调查这次失败,也希望能把基座模型留到未来的 GPT-6 世代,再补上额外的强化学习。十月首发的档期就此作废,下一次它出现在发布名单里,安全那栏大概会被翻个底朝天。
话题来源 @kimmonismus
42.7K阅读 ❤️597 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论
0 反应












