时间:2026 年 9 月 5 日(北京时间)
地点:英国曼彻斯特 / 美国旧金山 OpenAI
人物:Epoch AI 基准工程团队 Tom Adamczewski、曼彻斯特大学数学家、OpenAI GPT-6 Astra 团队、极值图论与组合数学领域研究者
事件详情:Epoch AI 与曼彻斯特大学联合发布 FrontierMath Erdős(FME)基准测试论文,GPT-6 Astra 在包含 68 道人类至今悬而未决的 Erdős 数学难题的测试中成为全场唯一交出有效答卷的大模型,累计攻克 5 道长期未解猜想,其余 GPT-5.6、Claude Fable 5.1 等四款主流 AI 全部得 0 分。标准测试中,模型用反例推翻第 74 号问题(218 美元、15 小时)并证明第 126 号问题(247 美元、16 小时);放宽算力与智能体配置后,又多解出第 1、548、571 号问题。5 道解中包括 Erdős 18 岁时提出的 1931 年解离集猜想(被反例推翻)以及极值图论久负盛名的 Erdős–Sós猜想。
背景:FME 题目全部来自 erdosproblems.com 上 652 道公开问题,由 Bloom 等人按"任何一道若被人类解出都足以在高水平期刊发表"的标准筛选;测试要求模型以 Lean 形式化证明输出并由内核自动核验,每轮统一预算 300 美元、限时 72 小时,杜绝"背答案"和外部干预。Epoch AI 强调 5 道解中有 3 道来自"非标准"实验,并不计入正式分数,但作为数学发现仍具价值。
影响:Epoch AI 按 300 美元单次、3% 成功率折算,每解开一道重要开放难题的期望成本约 1 万美元;GPT-6 Astra 为拿到 5 个解累计消耗 22 万美元算力,而正式测评本身只花约 2 万美元。5 道解中既有反例推翻旧猜想,也有完整形式化证明新命题,刷新了 AI 自主解题的天花板,但同时 68 道题中仍有 63 道未被触及,再次印证前沿数学的"已解 3% 与未解 97%"现实。
总结:当"AGI 时代"叙事仍在空中飘荡时,GPT-6 Astra 在 Erdős 未解难题上拿到的 5 张"Lean 通行证",第一次把"AI 做数学"从可解释的演示推到了同行可核验的硬证据。但 3% 与 1 万美元/题的代价,也提醒着任何把今天当拐点的判断者:真正的突破,发生在剩下那 63 道没被解开的题里。
参考来源:
- https://epoch.ai/latest/announcing-frontiermath-erdos
- https://news.mydrivers.com/1/1148/1148874.htm
- https://ai.zol.com.cn/1242/12427839.html
- https://www.sohu.com/a/1072179337_362225
- https://www.toutiao.com/article/7681727483825209882/
- https://view.inews.qq.com/a/20260905A06M6Y00









