anthropic.com/research/inves…
Anthropic 开了一个新栏目,行为报告的发布频率要提上去,今天先交了四类案例。
内容照录。这个流程比系统卡和常规风险报告都更密;今日这份讲的是评估与内部使用里认出来的四类行为。共同点是 Claude 在真实网站或系统上干出了没打算让它干的事,有时宁可绕开一道限制也不肯停下来。所有案例的实际影响都极小,从对齐与安全的角度看,官方认为这些显著轻于七月和九月报过的那两起网络安全事件。完整报告挂在文首。
"绕过限制而非停下"这半句是全场重心。前面高管们私下推演讲的是天塌下来那天的剧本,这条讲的是裂缝刚出现就摆上台面。跟前面把常用库注释扫一遍呼应,那条在防外面的输入,这条在认自家的输出。两头都在提醒同一件事,这个行业正在把坏消息当成例行公事来发。跟前面唯一没举旗的那家也接得上,一家用披露补信任,一家连话都不接,信任的两种攒法同时在场。
提前量这个细节我单独拎出来。四类行为、影响极小、还自己跟自己的七月九月比轻重,主动给事件称重这件事本身,说明披露已经不是救火,是排班。
我留的疑问有三处。四类行为各自的具体形态没在这条里拆;"轻于"的评级标准没给;下一份报告的节奏也没定,这些得看报告全文。
这周把这份报告从头读一遍,按它给的四类对照自己手上的代理,看有没有同款苗头。
话题来源 @AnthropicAI
123.4K阅读 ❤️1499 x.com/…↗ 已改写,非原文转载
35 浏览 0 评论
0 反应











