时间:2026年8月6日
地点:杭州/全球
人物:阿里巴巴Qwen团队
事件详情:Artificial Analysis于8月6日发布最新基准,阿里巴巴Qwen3.8-Max在Intelligence Index上得56分,较前代Qwen3.7-Max的46分跃升10分,与Anthropic Claude Opus 4.8持平,并超越智谱GLM-5.2(51分)。但在GDPval-AA工作类任务基准上,Qwen3.8-Max以1739分落后于Claude Opus 5(1852分)和Kimi K3(1685分此前)。
背景:Qwen3.8-Max采用2.4万亿参数MoE架构,每次推理激活950亿参数,定位长时域复杂任务,已独立完成16天CLI工具开发、5天学术论文复现等案例。该模型将于下周开放权重下载,是Qwen-Max系列首个开源的旗舰型号,定价较Qwen3.7-Max下移:输入由2.50美元/百万tokens降至2.00美元,输出由7.50降至6.00美元,缓存命中由0.50降至0.25美元。
影响:
- 阿里成为开源大模型阵营中唯一在闭源旗舰基准上追平Anthropic前沿模型的玩家
- 价格持续下探至8美元/百万tokens区间,强化中国开源阵营的成本优势叙事
- AA-LCR与AA-Omniscience两项基准出现倒退,幻觉率由23%飙升至40%,凸显长上下文与诚实应答仍是开源MoE短板
- 与Kimi K3(57分)的差距显示参数规模未必直接转化为性价比领先
总结:阿里Qwen3.8-Max以2.4万亿参数开源模型身份追平Claude Opus 4.8,重塑中国AI阵营与美国前沿闭源模型的竞争格局;但在被Kimi K3以1分优势反超、幻觉率走高面前,参数堆叠的边际效益正在受到质疑。下周开源发布将成为开源生态半年内最受关注的模型之一。
参考来源:
- https://the-decoder.com/qwen3-8-max-catches-claude-opus-4-8-but-kimi-k3-still-scores-higher-for-25-percent-less/
- https://the-decoder.com/alibabas-open-weight-qwen3-8-max-takes-on-long-horizon-ai-tasks-with-2-4-trillion-parameters/
- https://venturebeat.com/technology/qwen3-8-max-arrives-with-a-bold-claim-it-outperforms-gpt-5-6-sol-max-and-fable-5-on-agentic-computer-use
- https://siliconangle.com/2026/08/03/alibaba-debuts-qwen3-8-max-model-2-4t-parameters/
- https://www.alibabacloud.com/blog/alibaba-unveils-qwen3-8-max-its-largest-and-most-capable-flagship-model-to-date_603420
- https://finance.yahoo.com/technology/ai/articles/qwen3-8-max-capability-war-162320284.html
- https://www.eesel.ai/blog/qwen38-max-vs-kimi-k3