时间:2026年9月9日
地点:美国旧金山
人物:Anthropic对齐科学团队负责人Evan Hubinger、Anthropic前研究员Jacob Coxon(已辞职)、Anthropic可扩展监督负责人Samuel Marks
事件详情:Anthropic对齐科学负责人Evan Hubinger于9月8日通过X平台发帖,公开回应辞职同事Jacob Coxon的警告。Hubinger直言"我们真的相信AI有可能杀死全人类",并给出明确数字:"我个人认为这一概率超过10%。"他同时承认Anthropic尚未找到解决超级智能对齐问题的方案,也"没有明确走上正轨"。Coxon于9月8日辞职时指控OpenAI和Anthropic"正不顾一切冲向具备自我改进能力的超级智能,拿我们的生命下注",并称"投身AI研发的从业者内心都真切相信,到这个十年结束,AI有可能毁灭人类"。
背景:Coxon过去三年先后在OpenAI和Anthropic从事AI预训练研究;Hubinger领导的Anthropic Alignment Science团队长期负责研究"递归自我改进"(RSI)风险。这一表态发生在OpenAI首席科学家Jakub Pachocki于9月6日发表"An Alien Mind"文章之后,凸显AI顶尖实验室内部对失控风险的认知日趋一致。
影响:这是首次有顶级AI实验室对齐负责人给出具体的灭绝概率数字(10%),引发科技界、AI安全社区和监管机构激烈讨论。Coxon警告需要国际协调甚至临时禁止能力提升,呼应联合国人权高专办此前"AI或对人类构成存续威胁"的声明。英国AISI表示已对GPT-6 Astra完成测试,并正密切关注。
总结:Anthropic内部分歧公开化,AI对齐成为实验室内部最敏感议题,可能加速全球AI安全监管协调。
参考来源:
1. https://the-decoder.com/anthropic-scientist-puts-the-odds-of-ai-destroying-humanity-above-ten-percent-this-decade/
2. https://www.rt.com/news/645350-ai-kill-humanity-decade/
3. https://www.cbsnews.com/atlanta/news/ai-kill-humans-anthropic-researcher-more-than-ten-percent-chance/
4. https://indianexpress.com/article/explained/explained-ai/ai-extinction-risk-anthropic-researcher-10-percent-10869708/
5. https://windowsreport.com/anthropic-insiders-issue-chilling-warning-ai-has-over-10-chance-of-killing-all-humans
6. https://www.163.com/dy/article/L6DBF80L05568W0A.html
7. https://k.sina.com.cn/article_1686546714_6486a91a01904xooq.html







