验证清晰的任务,按新节奏出成果

Anthropic 科学博客发了篇硬核的:是的,Claude 能做九圈。背景先铺一下——理论物理学家用"散射振幅"这套公式预测粒子行为,这类计算出了名地难,于是研究者用一层层越来越精细的"圈"(loop)做逐级修正:每加一圈答案更精确,计算量指数级上涨;多数计算停在两三圈,而简化测试模型(平面 N=4 超对称杨-米尔斯)上的此前纪录是八圈——由 SLAC 的 Lance Dixon 团队创下。

上个月,物理学家兼科普人 4gravitons 发起挑战:AI 能不能在这个模型里突破八圈?(结果细节以官方文章为准:anthropic.com/research/yes-c…

从"两三圈的常态"到"八圈的极限"再到"九圈的新纪录",这条线的价值不在圈数本身,在它是一类问题的样板:答案的正确性可以被硬核验(每加一圈、结果的收敛性可算),所以特别适合交给 AI 深挖——人定义目标与验证方式,模型去啃那指数膨胀的中间步骤。

这与今晚 AutoTuring 是一张桌子的两面:那边测"它懂不懂硬件",这边直接让它交付一个可验证的科学结果;两篇合起来给"AI 做科研"这个大词换了个更实的注脚——不是替代科学家,是在能被严格判定的子任务上,把人类推过此前的纪录线。

"每个 loop 让答案更精确、但计算量指数增长"这个结构,也顺手解释了为什么 AI 在这类任务上特别值钱:它不怕单调的深挖,只要验证信号清晰,多跑几十圈的成本对模型来说只是时间,对人类团队却是数年。

AI 拉长的不是聪明,是耐心——今晚从规则检查、数据标注到九圈计算,反复出现的都是同一个模式:把人类从"耗时间的精确劳动"里换出来,让人守住定义与验收两头。

一个必要的克制:九圈是在物理学家自用的简化测试模型里——真实散射问题的复杂度远不止于此,论文式的复现与方法细节要看原文;但方向上的证据与今晚所有硬核篇目同构——当结果可以被机器验证,推进它的速度就开始按机器的节奏走。

给关注这条线的人一句落地的:别只当新闻看——挑一个你所在领域"答案可硬核验、过程可枚举"的子问题(收敛性、一致性、边界情形),把它整理成 AI 能反复自我检查的格式,然后让它跑一夜。九圈的真正启示不是 Claude 多强,是验证信号清晰的任务,已经开始按新节奏出成果。

话题来源 @AnthropicAI 734.9K阅读 ❤️4233 x.com/…↗ 已改写,非原文转载
26 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单