时间:2026年8月28日(北京时间周五深夜,论文同步在Anthropic官网发布)
地点:美国旧金山Anthropic总部;研究由Anthropic Fellows项目主导,UC Berkeley参与合作
人物:Anthropic Fellow研究员陈岳涵(Chen Yueh-Han)、加州大学伯克利分校温嘉欣(Jiaxin Wen)、Anthropic研究员Jan Hendrik Kirchner;对照实验由28位平均2.5年AI安全从业经验的人类专家完成
事件:Anthropic于2026年8月28日正式发布论文《Automated Researchers Can Reliably Mitigate Alignment Failures》。该论文披露,由Claude Opus 4.8驱动的自动化对齐研究员(Automated Alignment Researcher,简称AAR)在10类公开对齐基准上全部取得改进,平均每类关闭85%的安全差距。其中在"欺骗性"任务上,AAR累计提交超150种训练方法,最优方案关闭82%的安全差距;同等条件下,6位资深人类安全研究员仅能闭合20%。对照实验中,28位人类专家被允许在8小时内提出方案,AAR在所有7项有可比性的人类提议任务上均优于人类最优方案。AAR每小时运行成本约4美元(API推理),相比Anthropic为人类研究员支付的150美元/小时下降约97%。
背景:论文涵盖的10类对齐失败包括谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私违规、奖励作弊与隐藏不确定性,每类对应3-5个公开基准。目标模型选用Gemma-2-2B、Qwen3.5-2B、Llama-3.2-3B、Phi-4-mini与Olmo-3-7B等开源2-7B参数模型。AAR每次运行配备1块H200 GPU、训练30分钟,5个AAR并行工作并通过共享排行榜交流。AAR提出的最优方法在训练过程中未见过的基准、Anthropic开源的多轮对抗审计工具Petri、以及比训练对象大4.7倍的模型上均有效,表明自动化对齐研究具备跨规模泛化能力。Anthropic同步开源了自动化对齐研究框架,供外部研究者复现与扩展。该研究是Anthropic继2024年发布初代"Automated Alignment Researchers"之后向递归自我改进(recursive self-improvement,RSI)迈进的最新一步,论文标题中明确将AAR与"人类对齐研究员"直接比较。
影响:AAR以4美元/小时的成本击败150美元/小时的人类专家,意味着AI对齐研究正进入"AI训AI"的工业化阶段。若该范式被扩展到预训练、推理优化与能力研究环节,OpenAI、Google DeepMind、Anthropic等前沿实验室可能在未来数月内同时拥有自动化研究与大规模算力,研发节奏将出现指数级提升。但论文也指出三大局限:自动化系统依赖基准的有效性、文献库需要持续维护、以及AAR目前仅适用于对齐领域,无法自动定义新的安全目标。在Anthropic Fellow陈岳涵主持下,AAR论文标志着RSI从概念走向可量产的工程实践,同时也让"AI何时取代人类研究员"这一问题从科幻层面下沉到产品节奏层面。
总结:Anthropic通过AAR论文首次系统证明,AI Agent可以在对齐研究这一最依赖人类判断的领域,用6小时、成本4美元/小时击败28位资深人类专家,并保持对更大模型的泛化能力。该结果既是AI安全研究的自动化里程碑,也是递归自我改进(RSI)迈向工程化的关键证据,预示"AI研究AI"将在OpenAI、Google DeepMind等竞速对手间快速扩散。
参考来源:
- https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures
- https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/
- https://www.unite.ai/anthropic-reports-claude-agents-mitigated-ten-alignment-failures/
- https://www.anthropic.com/institute/recursive-self-improvement
- https://www.anthropic.com/research/automated-alignment-researchers
- https://www.anthropic.com/research/petri-open-source-auditing
- https://arxiv.org/abs/2310.17884
- https://arxiv.org/abs/2502.17041









