2026年8月26日晚,阿里通义千问团队发布了一个让整个AI行业瞩目的开源模型:Qwen3.8-Flash。它的核心数据非常炸裂:125B总参数,每次推理只激活6B,训练成本仅为上一代的1/9。

这不是简单的参数压缩,而是阿里对下一代大模型架构的一次全面重构。

为什么这个模型值得关注?

大模型行业一直面临一个矛盾:模型越大越聪明,但训练和推理成本也越高。Qwen3.8-Flash试图打破这个困局。

它是一个多模态混合专家(MoE)模型,采用了一种全新的稀疏激活架构:虽然总参数量达到125B,但每次处理一个token时,只需要激活其中的6B参数。相当于一个拥有125B知识的超级大脑,但每次只调动极小一部分神经元工作。

四大架构创新

阿里这次在四个核心方向做了系统性升级:

  1. 混合注意力机制 GDN + QSA:用门控DeltaNet高效压缩历史信息,配合Qwen稀疏注意力在micro-block粒度筛选关键上下文。在处理1M token超长上下文时,Prefill阶段提速最高7.6倍,Decode阶段提速4.9倍
  2. 门控残差 Gated Residual:把传统Transformer的1条信息通道扩展为4条并行分支,通过动态门控控制信息读写,残差状态支持FP8存储,显存占用大幅降低
  3. N-gram嵌入层:引入51B参数的N-gram查表机制,相当于给模型配了一个大规模记忆手册,参数可卸载到系统内存,不长期占用GPU显存
  4. Muon优化器:针对新架构重新拟合了Scaling Law,收敛效率和训练吞吐大幅提升

性能表现

在6B激活参数下,Qwen3.8-Flash-Next-Base在14个基准测试中的8个取得了最优结果:

  • 代码能力:DeepSWE 1.1得分58.7,SWE-bench Pro得分62.5,LiveCodeBench v6得分91.9
  • 智能体任务:CoWorkBench得分73.9,Toolathlon Verified得分73.5
  • 多模态:MathVision(带代码解释器)得分95.7,RealWorldQA得分88.5

在编程和办公自动化场景中,新模型展现出比前代明显更强的能力,而训练成本只有前代的九分之一。

价格有多狠?

Qwen3.8-Flash上线千问AI平台的API定价为:

  • 输入:1元/百万token
  • 输出:3元/百万token

这个价格最低达到DeepSeek-V4-Flash的三分之一,在国内大模型市场中极具竞争力。

开源信息

模型权重已于北京时间8月26日23:00在以下平台全面开源:

  • Hugging Face:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
  • 魔搭ModelScope:同步开放

开源版本包含FP8量化权重,部署门槛进一步降低。

它和Qwen4是什么关系?

阿里明确表示,Qwen3.8-Flash-Next是Qwen4架构的技术预览版,扮演的角色类似于当年Qwen3-Next之于Qwen3.5。你现在看到的混合架构设计,正是下一代Qwen4系列的基础。

阿里选择提前开源这个架构预览版,目的是让全球AI社区有机会提前研究、验证和适配新架构,为完整的Qwen4发布做好准备。

总结

Qwen3.8-Flash代表了阿里在模型效率上的最新突破。125B参数只激活6B,训练成本降至1/9,API价格低至1元/百万token,这些数字正在重新定义大模型的性价比标准。

对于开发者、创业公司和预算有限的中小企业来说,这个开源模型意味着:用更少的钱,跑更强的模型。