时间:2026-09-12
地点:线上 / 美国旧金山 OpenAI 总部
人物:OpenAI、Epoch AI、数学家社群
事件详情:
Epoch AI 于 9 月 11 日通过官方 X 账号宣布,FrontierMath Tier 4 全部题目已被 AI 成功解答,其中最后一道未解难题由 GPT-6 Astra 攻破。OpenAI 同步披露,GPT-6 Astra 在 FrontierMath Tier 4 v2 基准上取得 97.6% 得分,正式将这道被称为「AI 数学最后一道高墙」的测试推进到饱和状态。FrontierMath Tier 4 由 48 道顶级研究级数学难题组成,其中 OpenAI 拥有 28 题及解答的独家访问权,Epoch AI 持有剩余 20 题用于独立评分;GPT-6 Astra 是首个在这 20 道保留题上同时跑出成绩的模型,让 Tier 4 在公开榜单上不再保留空白。
背景:
FrontierMath 由 Epoch AI 于 2024 年推出,最初设计目标就是「让所有现有 AI 模型都拿 0 分」——Tier 4 推出时榜首最高成绩仅约 5%。上一代 GPT-5.6 Sol 在 Tier 4 v2 仅取得 7.8%,而 GPT-6 Astra 一举冲到 97.6%,相当于在最难数学基准上完成了「从 0 到饱和」的代际跨越。Astra 还同步在 ARC-AGI-3 验证测试取得 99.9%、ExploitBench 拿下 100%、OSWorld 2.0 用一半时间跑到 72.6%,被 OpenAI 称为「AGI 时代的开端」。
影响:
Tier 4 饱和意味着「以 AI 攻破顶级研究数学」从偶发事件变为可重复产出,未来新模型必须在「数学家原创未解猜想」等更难任务上同台竞技。Epoch AI 联合创始人 Tamay Besiroglu 表示,原本用来给人类数学家出题的 Tier 4 已经失去对前沿模型的区分度;这同时给正在研究「AI 是否能推动原创数学」的学界提出了新焦虑——例如陶哲轩、邓煜等菲尔兹奖得主近期公开质疑 GPT-6 Astra 的素数间隔证明过程存在「截胡算力」嫌疑。商业层面,FrontierMath 一直被用于模型估值锚点,Tier 4 饱和后估值机构需换基准,对 AI 公司融资节奏可能产生短期扰动。
总结:
GPT-6 Astra 在 Epoch AI 公布后立刻成为数学 AI 评测的新天花板,Tier 4 饱和意味着 AI 在「研究级数学」上的可用性已经跨过临界点,下一步将进入「提出新猜想」与「验证真原创」的更高维度。
参考来源:
[1] Epoch AI 官方 X(@EpochAIResearch) — https://x.com/EpochAIResearch/status/2098103831502708864
[2] 量子位《AI 数学的最后一道高墙,塌了!GPT-6 Astra 刷穿 FrontierMath Tier 4》 — https://www.qbitai.com/2026/09/487701.html
[3] 36 氪《AI 数学的最后一道高墙,塌了,GPT-6 Astra 刷穿 FrontierMath Tier 4》 — https://www.36kr.com/p/3978639480617733
[4] 新浪财经《GPT-6 Astra 攻破 FrontierMath Tier 4 最后一道未被 AI 解出的难题》 — https://finance.sina.com.cn/stock/t/2026-09-12/doc-inirqfie6517634.shtml
[5] Epoch AI 官方博客《New record on FrontierMath Tier 4》 — https://epochai.substack.com/p/new-record-on-frontiermath-tier-4
[6] OpenAI 官方《GPT-6 Astra: A new generation of intelligence》 — https://openai.com/index/gpt-6-astra/
[7] BenchLM FrontierMath v2 Tier 4 Leaderboard — https://benchlm.ai/benchmarks/frontiermathv2tier4
[8] MindStudio《GPT-6 Astra Benchmarks Explained》 — https://www.mindstudio.ai/blog/gpt-6-astra-benchmarks-explained







