时间:2026年8月30日
地点:中国 北京/杭州
人物:Z.ai(智谱清言)、阿里巴巴 通义千问团队
事件:智谱 GLM-5.3-Flash 与阿里 Qwen3.8-Flash-Next 同周开源发布,两套模型架构几乎完全一致。
事件详情:Z.ai 开源的 GLM-5.3-Flash 是 320B 总参数、18B 激活参数的多模态 MoE 模型,遵循 MIT 协议,定价 0.15 美元/百万输入 token、0.50 美元/百万输出 token;阿里 Qwen 团队开源的 Qwen3.8-Flash-Next 是 125B 总参数、6B 激活参数(含 51B n-gram 嵌入表),原生支持 26 万 token 上下文、可经 YaRN 拓展至 100 万 token,训练算力仅需 Qwen3.7-Plus 的 1/9。两套架构均由独立团队设计,但配置高度雷同:均采用 3:1 线性注意力/全注意力混合、均用压缩索引器把上下文压缩 4 倍并把注意力预算封顶 2048 token、均把单一残差流改为 4 路门控分支、均采用 Muon 优化器并在正交化前拆分融合参数矩阵。唯一分歧在位置编码——GLM 选用 NoPE,Qwen 仍保留 RoPE,原因是其 NoPE 变体训练后无法停机。
背景:这是中国两家头部 AI 公司在架构层首次独立收敛同一蓝图;同期 Meta、Anthropic 等海外实验室也在尝试类似线性混合注意力结构;100 万 token 长上下文已从差异化卖点变成前沿模型标配;Z.ai 此前以匿名身份把 GLM-5.3-Flash 部署在 OpenRouter 上做压力测试,期间模型名 Ox Alpha 一度成为平台当周最热门。
影响:行业标准加速向 3:1 线性混合注意力收敛,长上下文推理成本相对前代下降约九成;中小企业开发者也能以 0.15 美元/百万 token 的极低门槛跑出百万级上下文;DeepSeek 与 MiniMax 仍是异见者,仍因推理能力下降而拒绝线性注意力方案。
总结:智谱与阿里不约而同收敛同一架构蓝图,标志着中国开源大模型在架构设计层已具备与世界前沿同步的工程能力,也意味着长上下文推理的成本与门槛将被快速重写。
参考来源:
- https://www.marktechpost.com/2026/08/28/glm-5-3-flash-vs-qwen3-8-flash-next-two-chinese-ai-labs-independently-converge-on-the-same-model-architecture/
- https://korshunov.ai/en/article/21624-z-ai-and-alibaba-independently-converge-on-3-1-linear-attention-architecture-for
- https://mimile.ai/en/articles/25362-z-ai-and-alibaba-release-near-identical-moe-models-within-a-day
- https://aipulselab.tech/news/glm-53-flash-vs-qwen38-flash-next-two-chinese-ai-labs-independently-converge-on-the-same-model-architecture-7a1ba1
- https://metaailabs.com/glm-5-3-flash-vs-qwen3-8-flash-next-two-chinese-ai-labs-independently-converge-on-the-same-model-architecture
- https://huggingface.co/zai-org/GLM-5.3-Flash
- https://huggingface.co/Qwen/Qwen3.8-Flash-Next









