Artificial Analysis Intelligence Index v4.2
独立 AI 模型评测榜单,新增 AA-Briefcase 与 GDP.pdf 评测集,Claude Fable 5.1
产品简介
Artificial Analysis Intelligence Index 是由独立 AI 评测机构 Artificial Analysis 发布的模型评测榜单,通过在专用硬件上独立运行测试,对全球主流 AI 模型进行全面客观的评测,帮助用户了解 AI 格局并选择最适合自身用例的模型和提供商。2026年9月5日,平台发布 v4.2 中途更新,新增 AA-Briefcase 智能体工作评测和 GDP.pdf 长文档推理评测,并将私有测试集权重提升至40%。
核心功能
- Intelligence Index 智能指数:综合评测模型在编程、推理、多学科推理等多种任务上的表现,以智能分数形式呈现排名
- Speed 速度评测:衡量各模型的输出 token 每秒速度,评估推理效率
- Cost per Task 任务成本:分析不同模型的单任务平均成本
- AA-Briefcase 智能体工作评测:私有测试集,评估模型处理复杂多步骤智能体任务的能力
- GDP.pdf 长文档推理评测:跨 4592 页 PDF、1275 条专家原子判据的评测集,评估模型对超长文档的理解能力
- AA-LCR v1.1 提示词修正:升级后的提示词修正评测体系
- SciCode 编程评测沙盒:强化鲁棒性评分的编程评测模块
特色优势
- 完全独立评测:在专用硬件上独立运行,不依赖模型厂商自报数据,保证客观公正
- 私有测试集权重翻倍:v4.2 将私有测试集权重从 20% 提升至 40%,有效降低刷分可能性
- 真实业务场景:GDP.pdf 基于真实长文档场景而非人工构造题目
- 中文模型覆盖:Kimi K3、GLM-5.3 等国产模型同步纳入评测
- 成本透明:提供清晰的单任务成本数据,助力企业控制 AI 使用成本
应用场景
- AI 应用开发团队的模型选型决策
- 企业 AI 成本效益分析与预算控制
- 超长文档处理场景(如4592页 PDF)的模型能力评估
- 复杂多步骤智能体任务的能力评测
- 编程辅助工具的模型能力对比
- 搜索 API 提供商的质量、成本与速度对比(通过 Search Index)
适用人群
- AI 应用开发者与技术团队
- 企业 AI 选型决策者与采购负责人
- AI 研究人员和学者
- 对模型性能关注的技术爱好者
- 使用 AI 辅助编程的开发者
出品方
- 机构:Artificial Analysis
- 总部:美国旧金山
- 性质:独立第三方 AI 模型评测机构
- 评测方法:在专用硬件上独立运行测试,不依赖厂商自报数据
更新动态
- v4.2(2026年9月5日):新增 AA-Briefcase 与 GDP.pdf 评测集,私有测试集权重提升至 40%,移除已被刷满的 GPQA Diamond,升级 AA-LCR 至 v1.1
- 未来规划:v5 将进一步扩大私有权限并新增任务类型
团队信息
AI产品库
官方
由 AI 猎手自动发现
评论与建议
登录 后参与评论或提建议