Artificial Analysis Intelligence Index v4.2

独立 AI 模型评测榜单,新增 AA-Briefcase 与 GDP.pdf 评测集,Claude Fable 5.1

LLM大模型 部分免费

产品简介

Artificial Analysis Intelligence Index 是由独立 AI 评测机构 Artificial Analysis 发布的模型评测榜单,通过在专用硬件上独立运行测试,对全球主流 AI 模型进行全面客观的评测,帮助用户了解 AI 格局并选择最适合自身用例的模型和提供商。2026年9月5日,平台发布 v4.2 中途更新,新增 AA-Briefcase 智能体工作评测和 GDP.pdf 长文档推理评测,并将私有测试集权重提升至40%。

核心功能

  1. Intelligence Index 智能指数:综合评测模型在编程、推理、多学科推理等多种任务上的表现,以智能分数形式呈现排名
  2. Speed 速度评测:衡量各模型的输出 token 每秒速度,评估推理效率
  3. Cost per Task 任务成本:分析不同模型的单任务平均成本
  4. AA-Briefcase 智能体工作评测:私有测试集,评估模型处理复杂多步骤智能体任务的能力
  5. GDP.pdf 长文档推理评测:跨 4592 页 PDF、1275 条专家原子判据的评测集,评估模型对超长文档的理解能力
  6. AA-LCR v1.1 提示词修正:升级后的提示词修正评测体系
  7. SciCode 编程评测沙盒:强化鲁棒性评分的编程评测模块

特色优势

  • 完全独立评测:在专用硬件上独立运行,不依赖模型厂商自报数据,保证客观公正
  • 私有测试集权重翻倍:v4.2 将私有测试集权重从 20% 提升至 40%,有效降低刷分可能性
  • 真实业务场景:GDP.pdf 基于真实长文档场景而非人工构造题目
  • 中文模型覆盖:Kimi K3、GLM-5.3 等国产模型同步纳入评测
  • 成本透明:提供清晰的单任务成本数据,助力企业控制 AI 使用成本

应用场景

  1. AI 应用开发团队的模型选型决策
  2. 企业 AI 成本效益分析与预算控制
  3. 超长文档处理场景(如4592页 PDF)的模型能力评估
  4. 复杂多步骤智能体任务的能力评测
  5. 编程辅助工具的模型能力对比
  6. 搜索 API 提供商的质量、成本与速度对比(通过 Search Index)

适用人群

  • AI 应用开发者与技术团队
  • 企业 AI 选型决策者与采购负责人
  • AI 研究人员和学者
  • 对模型性能关注的技术爱好者
  • 使用 AI 辅助编程的开发者

出品方

  • 机构:Artificial Analysis
  • 总部:美国旧金山
  • 性质:独立第三方 AI 模型评测机构
  • 评测方法:在专用硬件上独立运行测试,不依赖厂商自报数据

更新动态

  • v4.2(2026年9月5日):新增 AA-Briefcase 与 GDP.pdf 评测集,私有测试集权重提升至 40%,移除已被刷满的 GPQA Diamond,升级 AA-LCR 至 v1.1
  • 未来规划:v5 将进一步扩大私有权限并新增任务类型

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论