时间:2026年8月26日晚(北京时间)
地点:中国杭州——阿里通义千问团队
人物:阿里通义千问团队
事件详情:阿里通义千问团队于8月26日晚正式发布并同步开源最新一代多模态大模型 Qwen3.8-Flash,同时放出 Qwen3.8-Flash-Next 的开源权重——后者被官方定位为全新一代 Qwen4 系列模型的架构雏形。Qwen3.8-Flash 是多模态混合专家(MoE)模型,主模型参数 125B,额外配备 51B 的 N-gram Embedding,每 token 仅激活 6B 参数;原生支持 262,144 tokens 上下文,可通过 YaRN 扩展至 1M tokens。
背景:模型围绕四大方向系统升级。Attention 引入 GDN(Gated DeltaNet)+ QSA(Qwen Sparse Attention)混合架构,GDN 压缩历史信息,QSA 通过轻量 Indexer 在 micro-block 粒度筛选重要上下文,使 1M token 长上下文在 Prefill 阶段提速最高 7.6 倍、Decode 阶段提速 4.9 倍。Residual 引入 Gated Residual(GR)机制,把残差流扩展为 4 条并行分支,残差状态支持 FP8 存储以大幅降低访存开销。Embedding 引入 51B N-gram Embedding,参数可卸载至 Host Memory,通过异步 Prefetch 与模型计算重叠。Optimization 采用 Muon Optimizer,并针对新架构重新拟合了 Scaling Law。
影响:相比上一代 Qwen3.7-Plus,Qwen3.8-Flash 训练成本仅约前者的九分之一(骤降近 90%),性能却超越 Claude Opus 4.6、接近 Opus 4.8。后训练后,Qwen3.8-Flash 在 SWE-bench Pro 智能体编程评测中领先 Opus 4.6 多达 9.1 分;在长程专业任务 CoWorkBench、真实工具调用 Toolathlon Verified 中超越 DeepSeek-V4-Flash;在 JobBench 智能体评测中超出 Opus 4.6 近 20 分。多模态方面,AndroidWorld 移动端智能体比 Opus 4.6 高 22.5 分、MathVision 高 25.1 分、具身智能 ERQA 任务领先 31.5 分。推理定价为每百万 tokens 输入 1 元、输出 3 元,仅为 Claude Opus 4.6 的 3%、DeepSeek-V4-Flash 闲时价的 2/3。
总结:Qwen3.8-Flash 以"千亿参数仅激活 6B"的极致效率,把训练成本打到上一代的 1/9、推理价格打到 Claude Opus 4.6 的 3%,并将 Next 架构作为 Qwen4 雏形同步开源,重塑大模型性价比"斩杀线"。模型权重已于北京时间 8 月 26 日 23:00 在 Hugging Face 与 ModelScope 平台开源,同步发布 FP8 量化版本;首发上线"千问办公",千问 AI 平台 API 服务也即将开放。
参考来源:
[1] IT之家:https://www.ithome.com/0/994/735.htm
[2] 凤凰网汽车:https://auto.ifeng.com/c/8vudpFAYGC3
[3] 和讯科技/新浪科技:https://tech.hexun.com/2026-08-26/224897067.html
[4] 今日头条(极目新闻):https://www.toutiao.com/article/7678327433016050176/
[5] 今日头条(新京报):https://www.toutiao.com/article/7678356666886210088
[6] 腾讯新闻:https://new.qq.com/rain/a/20260826A0DJUE00
[7] ITBear 科技资讯:https://www.itbear.com.cn/html/2026-08/1524176.html
[8] 网易(IT之家转载):https://www.163.com/dy/article/L59UR42V05568W0A.html
[9] 虎科技:https://www.hukeji.com/ruanjian/202608/139283.html
[10] 新浪新闻(紫牛新闻):https://k.sina.com.cn/article_7880068204_1d5b04c6c06801gjio.html









