时间:2026 年 9 月 5 日
地点:旧金山(Artificial Analysis 总部所在地)
人物:Artificial Analysis 评测团队、Anthropic、OpenAI、Meta、SpaceXAI、Moonshot/Kimi、Z.AI、Google 等实验室
事件详情:独立 AI 评测机构 Artificial Analysis 于 9 月 5 日正式发布 Intelligence Index v4.2,作为原计划于 v5 才上线的核心要素的中间更新。更新重点包括新增 AA-Briefcase 智能体知识工作评测(私有测试集)与 Surge AI 的 GDP.pdf 长文档推理基准(跨 4592 页 PDF、1275 条专家原子判据),同时移除已被刷满的 GPQA Diamond。指数私有测试集权重从 v4.1 的 20% 翻倍至 40%,以降低针对公开榜单刷分的可能性;评分基础设施也同步升级,包括 AA-LCR v1.1 提示词修正、GDPval-AA v2 与 AA-Briefcase 的 Elo 锚定重校,以及 SciCode 评分沙箱的鲁棒性强化。
背景:Artificial Analysis 自今年 1 月发布 v4 后,已 8 个月未做大版本迭代,期间为配合多家前沿模型集中发布保持指数稳定。此次 v4.2 被定位为对前沿模型快速迭代的紧急中间更新,团队同步在推进 v5。
影响:v4.2 榜单上,Anthropic 的 Claude Fable 5.1(Adaptive Reasoning、Max Effort、Default Fallback)以 57 分居首;OpenAI 的 GPT-6 Astra(max)以 55 分紧随其后,GPT-6 Astra(xhigh)54 分位列第三,Claude Opus 5(max)紧随其后。Meta 排名第三梯队,SpaceXAI、Moonshot/Kimi、Z.AI 与 Google 依次进入前列。Cost per Task 帕累托前沿由 Anthropic、OpenAI、Meta、Z.AI 四家共享;GPT-6 Astra 则在输出 Token 效率维度上几乎横扫同档前沿模型,是榜单内性价比与 Token 经济性最突出的选项。子榜方面,AA-Briefcase 由 Claude Fable 5.1 与 Opus 5 领跑,GPT-6 Astra 较 GPT-5.6 Sol 高出约 85 Elo;GDP.pdf 长文档推理中 GPT-6 Astra 以 33.2% All-pass 居首,GPT-5.6 Sol 28.2%、Claude Fable 5.1 26.2%。
总结:Intelligence Index v4.2 通过 AA-Briefcase、GDP.pdf 与 40% 私有测试集权重,把「防刷榜」与「真实业务场景」同时拉进评估重心。榜单显示 Anthropic 与 OpenAI 已拉开身位,Anthropic 在智能体知识工作、OpenAI 在长文档与 Token 效率上各自占优;Meta、SpaceXAI、Moonshot/Kimi、Z.AI、Google 进入第二梯队。下一阶段 Artificial Analysis 将推进 v5,进一步上调私有权重并新增任务类型。
参考来源:
- https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2
- https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index
- https://agihunt.info/en/e/1a06e8fb0f1535bb81205f509f6
- https://headlinesbriefing.com/dev/hacker-news/artificial-analysis-intelligence-index-v42-released-8c41364d
- https://pressreleasecloud.io/ai-technology-trends/introducing-the-artificial-analysis-intelligence-index-v4-2









