# 阿里开源Qwen3.8-Flash 训练成本降九成
## 时间
2026年8月26日晚(北京时间)
## 地点
中国杭州 阿里巴巴通义实验室
## 人物
- 阿里通义千问团队
## 事件详情
8 月 26 日晚,阿里通义千问团队正式发布并同步开源 Qwen3.8-Flash 模型。该模型采用全新下一代(Next)架构,主模型参数 125B,叠加 51B 的 N-gram Embedding 记忆库,每个 Token 仅激活 6B 参数,性能超越 Claude Opus 4.6、接近 Opus 4.8,创下模型效率全球新基准。
得益于架构与训练的全面革新,Qwen3.8-Flash 训练成本较上一代 Qwen3.7-Plus 骤降近 90%,仅用九分之一的资源完成训练。推理成本同样大幅下降,定价每百万 Tokens 输入 1 元、输出 3 元,最低仅为 DeepSeek-V4-Flash 的三分之一。发布次日阿里云再降价,输入降至 0.8 元、输出 2.7 元。
Qwen3.8-Flash 是一个多模态混合专家(MoE)模型,原生支持 262,144 token 上下文,并可通过 YaRN 扩展至 1M token。架构层面采用四方面系统升级:
- Attention:引入 GDN(Gated DeltaNet)与 QSA(Qwen Sparse Attention)混合注意力架构,QSA 通过压缩式轻量 Indexer 在 micro-block 粒度上筛选重要上下文,高缓存命中场景下 1M token 长上下文提速 8 倍以上。
- Residual:引入自研 Gated Residual 方法,把传统 Transformer 的 1 条信息主通道拆分为 4 条,让模型动态决定读写信息。
- Embedding:引入 51B 的 N-gram Embedding 参数,提供高效查表寻址,Embedding 表可卸载到 Host Memory 并异步 Prefetch。
- Optimization:采用 Muon Optimizer,围绕正交化精度、Muon 与 AdamW 参数分工、融合参数拆分等策略进一步优化,并针对新架构重新拟合 Scaling Law。
Qwen3.8-Flash 模型权重已在 Hugging Face 与魔搭社区(ModelScope)同步开源,并提供 FP8 量化版本。Qwen3.8-Flash-Next 默认支持 1M 上下文、内置官方工具,是下一代 Qwen4 系列模型的雏形。Qwen3.8-Flash 当晚首发上线"千问办公",开发者和企业也可通过千问 AI 平台获取 API 服务。
截至目前,Qwen3.8 系列已开源 2.4T 参数量的 Qwen3.8-Max、Qwen3.8-27B 与 Qwen3.8-Flash 三大尺寸模型;Qwen 模型全球下载量突破 30 亿次,衍生模型数超过 30 万个。
## 背景
阿里通义与智谱在 8 月 26 日同日发布"高性价比"路线模型——Qwen3.8-Flash 与 GLM-5.3-Flash,两款产品均采用 MoE 架构,对外开源权重,主打高并发、低成本、原生多模态与 Agent 能力。
GLM-5.3-Flash 总参数 320B、单 Token 激活 18B,API 价格仅为 GLM-5.3 的十分之一,限时折扣阶段进一步降至二十分之一,约为 Claude Opus 4.8 的四十分之一。智谱 GLM-5.3-Flash 正式发布前以匿名模型 Ox-Alpha 在 OpenRouter、OpenCode 两大海外平台测试,迅速登顶并刷新双平台历史纪录,Token 调用量高达 62T。8 月 27 日港股收盘,智谱全日收涨 12.62%,报 1160 港元/股。
这标志着国内大模型厂商对 Flash 路线的集体落地,"参数不再是竞赛的唯一标尺,效率、成本和落地能力正在重新定义游戏规则"。
## 影响
Qwen3.8-Flash 把"千亿参数激活 6B"的稀疏化路线推向极致:训练成本降至前代九分之一、推理价格仅为 DeepSeek-V4-Flash 的三分之一。其 GD N+QSA 混合注意力、Gated Residual、N-gram Embedding 等模块化创新,也为下一代 Qwen4 奠定了架构基础。
对企业而言,1M token 长上下文与高缓存命中 8 倍提速让 Agent、长文档理解、代码助手等高 token 消耗场景成本大幅下降;对开发者而言,开源权重与 FP8 量化版本提供了本地部署的可能;对国内大模型竞争格局而言,Flash 路线让"高效率、低成本"成为新的主战场。
## 总结
Qwen3.8-Flash 是阿里通义迈向 Qwen4 的前哨站,把"更少的算力、更多的能力"做到新的基准。当训练与推理成本双双断崖式下降,"参数竞赛"开始让位于"效率落地",国内大模型竞争也随之进入新阶段。
## 参考来源
1. 中国证券报《阿里发布Qwen3.8-Flash模型并开源》https://jnzstatic.cs.com.cn/zzb/htmlInfo/131390.html
2. 今日头条《新京报:阿里开源发布Qwen3.8-Flash,训练成本骤降近90%》https://www.toutiao.com/article/7678356666886210088
3. 网易《Qwen3.8-Flash正式发布》https://www.163.com/dy/article/L5B6FH350511DDOK.html
4. 今日头条《21世纪经济报道:阿里智谱同日上新,效能与性价比重塑大模型竞争》https://www.toutiao.com/article/7678680560633479732/
5. 凤凰网汽车《网通社快报:阿里通义千问团队开源Qwen3.8-Flash多模态AI模型》https://auto.ifeng.com/c/8vudpFAYGC3









