时间:2026年9月18日
地点:中国北京
人物:智谱AI(Z.ai)
事件详情:智谱今日正式推出 GLM-5.3-FlashX 模型,推理速度最高可达 200 tokens/s,较现有 GLM-5.3-Flash 提升 5 倍;新模型 API 已同步全面开放,输入单价 27 元/百万 tokens,缓存命中 0.57 元/百万 tokens,整体定价提升至原版本 2.5 倍。FlashX 在延续 GLM-5.3-Flash 智能水平与多模态能力的基础上,把响应速度作为新增核心维度,进一步强化产品在智能、价格与速度三维的竞争力。
背景:GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,采用 320B 总参数、18B 激活参数的 MoE 架构,2026 年 8 月 26 日由智谱正式开源并上线,曾以匿名身份 "Ox Alpha" 在海外开发者社区刷屏并收获广泛好评。支撑 FlashX 推理的是由 10 万张国产芯片组成的推理集群,该集群上线即被打满;面对持续攀升的调用量,智谱进一步扩大算力规模并加大 Infra 投入与推理优化。
影响:FlashX 的发布折射出国产推理算力在高并发商业 API 场景下的承载能力走向成熟,5 倍推理速度意味着同等算力下吞吐能力显著增强,单位 token 成本结构得到优化。对企业与开发者而言,更快响应可改善 Agent、多轮对话、代码生成等实时交互类应用的体验;从产品矩阵看,智谱把同一基座拆出"低价高吞吐"与"高价低延迟"两条产品线,标志着国产大模型 API 正式进入按速度分层的精细化竞争阶段。
总结:从 GLM-5.3-Flash 到 GLM-5.3-FlashX,智谱在国产算力底座上以"高智能 + 高速度 + 合理价格"组合策略巩固竞争力,10 万张国产卡支撑下的稳定服务能力是其敢于同步提价、提速的关键。
参考来源:
1. IT之家《智谱 GLM-5.3-FlashX 模型上线,更快、更流畅》:https://www.ithome.com/1/004/061.htm
2. 新浪财经《智谱GLM-5.3-FlashX提价上线:推理速度翻5倍,提价至2.5倍》:https://finance.sina.com.cn/roll/2026-09-18/doc-inisfprh8529608.shtml
3. 凤凰科技《智谱GLM-5.3-FlashX模型上线,更快、更流畅》:https://tech.ifeng.com/c/8wWCGvz2u33
4. AIHub《智谱上线 GLM-5.3-FlashX:最高 200 tokens/s,进一步提升推理速度》:https://www.aihub.cn/news/zhipu-glm-5-3-flashx/
5. 智谱AI官方文档《GLM-5.3-Flash/FlashX》:https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash
6. AIFUC《智谱FlashX把速度拉到200 tokens/s,大模型价格战开始分层》:https://www.aifuc.com/news/zhipu-glm-flashx-api-pricing-layering-6z2l-6aaccfc0c2db1a575d2d2bb7
7. 新浪财经《智谱AI 9月18日推出GLM-5.3-FlashX 最高200 tokens/s》:https://finance.sina.com.cn/stock/estate/integration/2026-09-18/doc-inisfprh8536035.shtml







