时间:2026年8月6日
地点:中国杭州(阿里巴巴通义实验室)/ 美国(Artificial Analysis 评测机构)
人物:阿里通义千问 Qwen 团队;Artificial Analysis 评测团队;VentureBeat 编辑团队
事件详情:
VentureBeat 8 月 6 日报道,阿里通义千问新一代旗舰模型 Qwen3.8 Max 在 Artificial Analysis 智能体指数(Agentic Index)上跃居榜首,超过 GPT-5.6 Sol、Claude Opus 5、Gemini 3.6 等闭源顶级模型,成为首个在该榜单登顶的中国模型。OfficeChai 进一步指出,Qwen3.8 Max 在 GDPval-AA 上平均需要 64 个回合完成智能体任务,是 Anthropic 与 OpenAI 之外表现最好的模型。该模型同时在 Terminal-Bench 2.1、DeepSWE 1.1 等代码基准上排名靠前。
背景:
Artificial Analysis 智能体指数(Agentic Index)是当前最受关注的第三方 AI 评测之一,综合考察模型在多步骤工具调用、代码生成、自主规划等"代理式任务"上的能力。此前长期由 OpenAI GPT-5.6 系列、Anthropic Claude Opus 系列、Google Gemini 系列交替占据榜首。中国模型上一次接近榜首是 DeepSeek V3.x 时期,但始终未登顶。Qwen3.8 Max 此番跃居第一,被视为开源/中国模型在智能体能力上首次实现系统性领先。
影响:
- 终结"中国模型只能追平闭源"的旧叙事,让 Qwen 系列进入全球旗舰榜单第一梯队
- 给 OpenAI、Anthropic、Google 在 Agent 商业化定价上增加新一轮竞争压力
- 推动开发者社区以 Qwen3.8 Max 为开源/低成本替代品替代闭源 Agent 框架
- 提升中国 AI 监管、出海谈判中的技术筹码,可能影响欧美对华芯片与模型出口管制
总结:
阿里 Qwen3.8 Max 在 Artificial Analysis 智能体指数首次登顶,超过 GPT-5.6 Sol、Claude Opus 5、Gemini 3.6 等闭源旗舰,是中国开源模型在代理式任务上的里程碑时刻。该结果与 DeepSeek V4 Flash 的开发者口碑形成呼应,标志着中国 AI 在 2026 下半年进入"前沿 + 性价比"双线出击阶段。
参考来源:
- https://venturebeat.com/technology/qwen3-8-max-arrives-with-a-bold-claim-it-outperforms-gpt-5-6-sol-max-and-fable-5-on-agentic-computer-use
- https://artificialanalysis.ai/models/qwen3-8-max
- https://officechai.com/ai/qwen-3-8-max-scores-56-on-artificial-analysis-intelligence-index-ahead-of-all-us-companies-except-anthropic-and-openai/
- https://news.ycombinator.com/item?id=49200652
- https://benchlm.ai/models/qwen3-8-max
- https://qwen.alibaba.com/