Meta Muse Glimmer

300亿参数本地Agent开源模型,单卡24G显存即可运行

LLM大模型 部分免费

Muse Glimmer 是 Meta 于2026年8月正式发布的开源权重模型,由 Meta Superintelligence Labs 团队打造,采用 Apache 2.0 协议在 Hugging Face 平台开源。该模型拥有300亿参数(30B),专为全天候常驻运行的本地智能体(Agent)工作流深度优化,是全球首个在消费级硬件上实现单卡部署的开源 Agent 模型。

Muse Glimmer 的核心技术创新在于三大方面:首先,模型通过 logit 蒸馏技术从更大尺寸的 Muse Spark 教师模型提取智能体推理能力,并应用 4bit 量化技术,可在 24GB/32GB 显存的 Mac 或 PC 上单卡本地运行,无需云端 API 或网络连接即可完成日程管理、文件整理、编码、文档分析及个人助手等典型 Agent 任务;其次,架构采用 2B 参数 ViT 风格视觉编码器(Perception Encoder)+ 28B 文本解码器的多模态混合设计,支持输入文本和图像、输出文本,可处理截图、图表和文档等多模态内容;第三,推理优化方面采用 GQA-16(每16个 Query 头共享1组 KV 头,KV 缓存内存压缩16倍)和 Hybrid Attention(3个滑动窗口层 + 1个全注意力层循环13次共52层),显著降低显存占用。

在基准测试中,Muse Glimmer 在 MCP Atlas(75.5)、DeepSearch QA(74.6)、SWE-Bench Pro(51.2)、SWE-Bench Verified(76.0)、AIME 2026(94.7)等多项 Agentic 评测上超越 Gemma4-31B 与 Qwen3.6-27B 等同尺寸竞品。推理速度方面,借助 DFlash 推测解码技术,在 Nvidia RTX 5090 上实现 3.1 倍加速(74.9→233.4 tok/s),在 Apple M5 Max 上实现 1.8 倍加速。

Hugging Face 同步上线 day-0 支持,覆盖 transformers、llama.cpp、vLLM、MLX、ExecuTorch、Inference Endpoints 等主流推理框架。开源协议为 Apache 2.0,允许商业使用和二次开发。

Muse Glimmer 的发布标志着 AI Agent 从云端 API 调用向本地常驻运行的范式迁移正式开启,中小企业和独立开发者可低门槛部署私有化 Agent,开源模型在 2026 年下半场的竞争焦点从参数规模转向端侧可用性与 Agentic 能力。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论