时间
2026年8月26日23:00(北京时间)
地点
中国·杭州
人物
阿里通义千问团队
事件详情
8月26日晚,阿里通义千问团队正式发布并同步开源新一代混合专家(MoE)模型Qwen3.8-Flash。该模型主模型参数量125B,每token激活6B参数,并额外配备51B的N-gram Embedding,原生支持262,144 tokens上下文,可通过YaRN扩展至1M tokens。
模型在四大维度进行系统升级:Attention层引入GDN(Gated DeltaNet)与QSA(Qwen Sparse Attention)混合架构,长序列场景下可提速8倍以上;Residual层引入Gated Residual机制,将残差流扩展为四条并行分支;Embedding层引入51B参数N-gram Embedding,相关参数可卸载至Host Memory,通过异步Prefetch与计算重叠;Optimization层采用Muon Optimizer,并针对正交化精度等策略进行优化。
模型权重于北京时间8月26日23:00在Hugging Face与ModelScope(魔搭社区)同步开源,并发布FP8量化版本。Qwen3.8-Flash-Next默认支持1M上下文并内置官方工具,提前公开了下一代Qwen4架构的部分设计。
背景
Qwen系列已开源Qwen3.8-Max、Qwen3.8-27B及Qwen3.8-Flash三个尺寸,系列总参数量达2.4T;Qwen模型全球下载量已突破30亿次,衍生模型超过30万个。当前国内大模型行业从"参数比拼"转向"性价比与落地能力"较量,DeepSeek、Kimi等厂商也推出同类高效MoE模型。
性能与价格
相比上一代Qwen3.7-Plus,Qwen3.8-Flash训练成本下降近90%,仅使用约九分之一资源即可完成训练。在14项基准测试中的8项取得最佳结果,包括MMLU-Pro、SuperGPQA、BBH、SWEBench-Pretrain、MGSM与MMMU等。
API定价为每百万Tokens输入1元、输出3元,约为Claude Opus 4.6的3%,最低为DeepSeek-V4-Flash价格的1/3。在SWE-bench Pro智能体编程评测中领先Opus 4.6达9.1分,AndroidWorld移动端智能体评测高出22.5分,MathVision视觉数学推理高出25.1分,具身智能ERQA任务领先31.5分。
千问办公已首发上线该模型,标准模式内置Qwen3.8-Flash,可完成95%的日常办公任务;高级模式处理剩余5%重度复杂任务。
影响
1. 训练成本降至前代1/9,加速行业从"参数堆叠"转向"效率竞争";
2. API价格低至DeepSeek-V4-Flash的1/3,进一步压缩中小企业的AI调用成本;
3. QSA+GDN混合注意力架构为下一代Qwen4模型预演关键路径;
4. 同步开源Next架构权重,邀请全球社区共同验证并迭代下一代模型。
总结
阿里通过Qwen3.8-Flash的稀疏MoE架构与Agent深度协同优化,正式打破AI应用"高性能、高成本、高延迟"的不可能三角。该模型同时也是下一代Qwen4架构的技术试验田,多项新架构思路将在Qwen4旗舰产品上落地。
参考来源
1. 中国证券报《阿里发布Qwen3.8-Flash模型并开源》:https://jnzstatic.cs.com.cn/zzb/htmlInfo/131390.html
2. 果壳《Google发布Gemini Omni 1.1 Flash视频生成模型;阿里通义发布Qwen3.8-Flash》:https://www.guokr.com/article/470063/
3. 搜狐《阿里通义千问团队发布Qwen3.8-Flash并开源新架构》:https://m.sohu.com/a/1068020191_122066678
4. 今日头条《大河财立方:千问Qwen3.8-Flash发布,大模型转向效率竞争》:https://www.toutiao.com/article/7678596425587999232
5. 今日头条《阿里发布Qwen3.8-Flash:性能超Opus4.6》:https://www.toutiao.com/article/7678359104330465792/
6. 搜狐《阿里通义发布Qwen3.8-Flash模型:125B参数,训练成本仅为前代1/9》:https://www.sohu.com/a/1068006577_122066678









