阿里Qwen团队又出手了。
Qwen3.8-Max上线才一个月,今天直接发了0902迭代版。参数规模不变,还是2.4T参数、1M上下文窗口,但Coding和Agent能力又拉了一大截。
最直观的变化看Arena分数。Code Arena WebDev上,Qwen3.8-Max-0902拿到1691分,全球第一,比一个月前的版本涨了22分,刚好超过Opus 5 Max的1688分。而且它还站上了WebDev的Pareto Frontier——同等性能下成本最低,同等成本下性能最高。
按Arena的3:1输入输出混合价格计算,这个模型大约$5/M Token。目前这个价位,没有第二个模型能同时做到更便宜、分数又更高。
但真正夸张的是跟自己比:
TerminalBench:11.3 → 29.0(翻了2.5倍)
DeepSWE:56.6 → 69.3
ProgramBench:10.5 → 28.0(翻了近3倍)
QwenSWEBench V2:55.1 → 70.0(超过Opus 5的68.0)
WorkArena:1348 → 1468
一个月内,同一个底座名字都没改,光靠后训练就把Coding榜拉了十几二十分。这在以前是不可想象的。
这背后其实反映了一个趋势:预训练决定模型的上限,但发布之后怎么继续训练它「会干活」,正在变得越来越重要。Qwen团队显然在后训练环节找到了一套高效的方法论。
大模型的竞争已经从「谁先发」变成了「谁迭代更快」。你觉得这种月更模式能持续多久?
话题来源 @MaxForAI
47.4K阅读 ❤️133 x.com/…↗ 已改写,非原文转载
26 浏览 0 评论
0 反应











