时间:2026 年 9 月 5 日(北京时间)
地点:美国旧金山 OpenAI 总部 / 全网
人物:OpenAI 公关与发布团队、Fortune 资深撰稿人 Emily Forlini、斯坦福大学 AI 评测研究人员、Anthropic Fable 5.1 对照组
事件详情:9 月 3 日 GPT-6 Astra 正式发布后,《财富》通过对 OpenAI 官方发布页的 Internet Archive 抓取快照进行比对,发现多条关键评测数据在 48 小时内被反复修改:Astra 的内部"幻觉率"先从 4.2% 下调至 2%,后又被改回 4.2%;前代 GPT-5.6 Sol 的 ExploitBench 对照分数经历 5.5% → 11.5% → 5.5% 的来回;Astra 自身 ARC-AGI-3 头条分数在草稿阶段为 98.6%,正式上线后被调整为 99.99%,而当日统一测试环境下的第三方复现分数仅为 62.7%。竞争对手 Anthropic 的 Claude Fable 5.1 在 FrontierMath Tier 4 评测中的得分则经历了 87.8% → 78% → 83% 的下修再回补过程。
背景:这次数据调整发生在 OpenAI 历史上最混乱的旗舰发布之一中——原定美东时间下午 2 点上线的发布博客因不明原因被撤回近两小时,多位读者和《财富》记者都收到了相同的错误页面,直到下午 4 点前后才正常显示,最终内容与首版存在多处数字差异。事件另一背景是 OpenAI 此举发生在 Astra 仍未登陆 LMArena、SWE-bench Verified、Aider、LiveBench 等第三方平台的时间窗口内,OpenAI 自家发布页几乎成为 Astra 能力的"独家标尺"。
影响:消息在中文、英文 AI 圈同步引发对"Benchmaxxing"(刷榜调优)现象的集中讨论,斯坦福研究人员公开指出频繁重跑评测存在通过调整测试条件、推理等级和工具配置来最大化基准成绩的嫌疑;行业评测透明度、可复现性以及跨厂商对比表的可信度被推上风口浪尖,也使 OpenAI 与 Anthropic 在"最强模型"叙事上的争夺进一步升级。
总结:Astra 发布后 48 小时内的数据反复修改,让 OpenAI 一手操作的发布页首次遭遇"自己 vs 自己"的诚信拷问。在第三方平台尚未对 Astra 形成稳定测量的真空期内,这份"独家评测表"既是营销主战场,也是反噬源头——如何让基准跑分回到"被信任的状态",正成为这一代前沿模型竞争里最难解的次级难题。
参考来源:
- https://fortune.com/2026/09/04/openai-quietly-boosts-some-of-astras-evaluation-metrics-amid-rare-delay-in-publication-of-the-modeblog-post-announcement
- https://www.panewslab.com/zh/articles/01a06f97-eae3-73a1-bf9a-3e37af71a59e
- https://news.qq.com/rain/a/20260905A05DQU00
- https://www.theblockbeats.info/flash/365467
- https://geotoolbox.ai/blog/gpt-6-astra
- http://www.aihqyc.com/flash/2720639









