时间:2026年9月5日(Intelligence Index v4.2于9月4日正式发布,媒体集中报道为9月5日)
地点:全球(Artificial Analysis评测机构,独立AI基准提供商,面向全球模型厂商发布榜单)
人物:Artificial Analysis评测机构(Intelligence Index维护方);OpenAI(GPT-6 Astra模型开发方);Anthropic(Claude Fable 5.1开发方);Meta(第三名模型厂商);Z.AI(智谱)、Moonshot/Kimi、SpaceXAI、Google(其余上榜模型厂商)
事件详情:Artificial Analysis于9月4日正式发布Intelligence Index v4.2版本,针对此前GPT-6 Astra评分过低、与OpenAI自身及多家独立评测结论严重分歧的争议进行修订。新版加入AA-Briefcase(基于真实多周知识工作、私有测试集的智能体评测)和Surge AI开发的GDP.pdf(覆盖100份PDF、4592页、10个专业领域的长文档推理基准),移除已被前沿模型饱和的GPQA-Diamond。私有held-out测试集权重从v4.1的20%翻倍至40%,并修正了多个基准的评分错误,调整了AA-LCR、GDPval-AA、SciCode等评分基础设施以提高稳定性。
背景:v4版本对GPT-6 Astra评分与上一代Sol几乎持平,与Epoch AI(267个模型中Astra以169分居首)、ARC-AGI-3(巨大到非常大的跳跃)、OpenAI自家评测等多方结论严重不符,引发业内对AA指数方法论可信度的质疑。AA承认此前的测试组合未能捕捉Astra在智能体工作流、文档推理、token效率上的真实进步。
影响:修订后Claude Fable 5.1以57分重回榜首,GPT-6 Astra以55分居第二(较Sol提升4分),Meta排第三;在AA-Briefcase项目上Fable 5.1和Opus 5并列领先,GPT-6 Astra较Sol提升约85Elo点;在GDP.pdf文档推理上Astra以33.2%完胜Fable 5.1的26.2%。GPT-6 Astra在输出token效率上领跑前沿模型,每任务用token少于其他任何上榜模型。Anthropic、OpenAI、Meta和Z.AI四家共享每任务成本Pareto前沿,打破单家垄断。AA表示v5版本已开发8个月,将分阶段推出,私有测试集权重还将进一步提高。
总结:AA此次紧急改版反映第三方基准评测正面临方法论困境——公开基准易被刷榜或过拟合,权重与测试组合的微小调整即可颠覆厂商相对位次。对企业选型而言,单一指数的排名已不可全信,应跨多家评测交叉印证。GPT-6 Astra虽未登顶,但在文档推理和token效率两项生产部署最关键指标上确实领先,Fable 5.1则在智能体知识工作和性价比上略胜一筹。
参考来源:
- https://the-decoder.com/artificial-analysis-overhauls-its-intelligence-index-after-gpt-6-astra-scoring-drew-skepticism/
- https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2
- https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index
- https://artificialanalysis.ai/zh/changelog
- https://aipulselab.tech/news/artificial-analysis-overhauls-its-intelligence-index-after-gpt-6-astra-scoring-drew-skepticism-301f90
- https://www.frontiernews.ai/news/article/claude-fable-51-tops-new-ai-benchmark-as-anthropic-30ac116d
- https://tpsreport.news/news/artificial-analysis-intelligence-index-4-2-gpt-6-astra
- https://hellomarvisaitoday.com/articles/fbc63eae-5cc4-461e-a809-847e64ff5691








