Anthropic公布Claude安全护栏两项数字改进

Anthropic 公布了 Claude 安全护栏的两项数字改进: 第一项:网络安全类请求里,误报率降低约 60%。这是 anomaly-prone 类防护的常见痛点——把正常请求误杀为风险,Claude 的判别器现在对良性请求容错多了。 第二项:基础生物学与医学类问题的兜底率,降低约 85%。意味着 Claude 在面对此类 ask 时,更少把请求转给人工兜底或直接拒答;同时也说明 Anthropic 在这块的安全判别可能放宽了。 原帖没有展开具体的兜底机制,也未对「放宽安全判别」是否会引发误用做出任何解释。两条改进对用户来说通常是好消息:误拦截减少、可用性提高;但安全研究员与合规团队需要对真实测试用例进行额外评估。 这两项的数据来自原帖,后续 Anthropic 的模型行为说明应该会有更详细的方法论与测试结果。
话题来源 @claudeai 78.6W阅读 ❤️2437 x.com/…↗ 已改写,非原文转载 Claude (@claudeai) on X Finally, we’ve improved our safeguards. Our cybersecurity safeguards now flag benign requests about 60% less often. On basic biology and medical questions, we’ve recently reduced the fallback rate by X (formerly Twitter)
22 浏览 0 评论 1 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单