GLM-5.3-Flash 今日发布
智谱AI于2026年8月26日开源发布的GLM-5系列首款原生多模态大语言模型,总参数320B,激活参数仅18B
GLM-5.3-Flash是智谱AI于2026年8月26日开源发布的GLM-5系列首款原生多模态大语言模型,总参数320B,激活参数仅18B,在全球权威Artificial Analysis智能指数中取得57分,进入全球前沿模型能力区间,与Anthropic的Claude Opus 4.8得分持平。在自研Z.ai Code Bench编程评估中,其代码能力与Claude Opus 4.8相当,而API定价仅为后者的四十分之一。
GLM-5.3-Flash的核心技术创新在于其全新设计的混合注意力架构。它是首个在开源前沿模型中采用稀疏注意力与线性注意力混合(3:1比例)的模型,通过递归机制捕获局部依赖关系,借助轻量级索引器召回全局上下文,在保持精准长上下文能力的同时大幅降低注意力计算成本和KV缓存占用。与GLM-5.3相比,GLM-5.3-Flash的注意力计算量降低3.01倍,KV缓存大小降低4.44倍。同时采用流形约束超连接(Manifold-Constrained Hyper-Connections,mHC)提升模型Scaling效率,使得总参数量与GLM-4.5相当的条件下,激活参数量和层数几乎减半。
作为原生多模态模型,GLM-5.3-Flash将视觉编码能力深度整合进模型核心,支持在代码编写过程中自主进行视觉判断与测试时改进。针对前端开发、游戏开发、3D仿真等最终产物包含视觉界面的任务,模型能够在渲染、交互、试玩过程中观察自身输出并进行迭代式改进。在专业工作场景中,模型支持PPTX、PDF、DOCX、XLSX等Office文档的检查与优化,并针对金融、法律等专业领域进行了深度优化,可覆盖从金融研究、报告生成到合同审查、诉讼文书起草的完整工作流程。
GLM-5.3-Flash支持高达100万Token的超长上下文窗口,由独立团队设计但与同期阿里Qwen3.8-Flash-Next在架构层面实现了惊人的收敛,两套模型均采用3:1线性混合注意力、压缩索引器(上下文压缩4倍,注意力预算封顶2048 token)、4路门控分支和Muon优化器。该模型已开源至HuggingFace,遵循MIT协议,同时通过Z.ai API平台、BigModel开放平台和智谱清言App提供在线体验与API调用。
评论与建议
登录 后参与评论或提建议