阿里Qwen团队又出手了。 Qwen3.8-Max上线才一个月,今天直接发了09…

阿里Qwen团队又出手了。 Qwen3.8-Max上线才一个月,今天直接发了0902迭代版。参数规模不变,还是2.4T参数、1M上下文窗口,但Coding和Agent能力又拉了一大截。 最直观的变化看Arena分数。Code Arena WebDev上,Qwen3.8-Max-0902拿到1691分,全球第一,比一个月前的版本涨了22分,刚好超过Opus 5 Max的1688分。而且它还站上了WebDev的Pareto Frontier——同等性能下成本最低,同等成本下性能最高。 按Arena的3:1输入输出混合价格计算,这个模型大约$5/M Token。目前这个价位,没有第二个模型能同时做到更便宜、分数又更高。 但真正夸张的是跟自己比: TerminalBench:11.3 → 29.0(翻了2.5倍) DeepSWE:56.6 → 69.3 ProgramBench:10.5 → 28.0(翻了近3倍) QwenSWEBench V2:55.1 → 70.0(超过Opus 5的68.0) WorkArena:1348 → 1468 一个月内,同一个底座名字都没改,光靠后训练就把Coding榜拉了十几二十分。这在以前是不可想象的。 这背后其实反映了一个趋势:预训练决定模型的上限,但发布之后怎么继续训练它「会干活」,正在变得越来越重要。Qwen团队显然在后训练环节找到了一套高效的方法论。 大模型的竞争已经从「谁先发」变成了「谁迭代更快」。你觉得这种月更模式能持续多久?
Max For AI (@MaxForAI) on X 🚨阿里把 Claude Opus 5 干下去了。 Qwen3.8-Max 才发一个月,阿里又把它训了一遍。 今天 @Alibaba_Qwen 发布 Qwen3.8-Max-0902,还是 2.4T 参数、1M 上下文,但 Coding 和 Agent 能力又往上拉了一截。 最显眼的变化是 Arena分数。 在 Code Arena WebDev 上,Qwen3.8-Max-0902 拿到 X (formerly Twitter)
话题来源 @MaxForAI 47.4K阅读 ❤️133 x.com/…↗ 已改写,非原文转载
26 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单