AI 编程工具终于能「全天候跑在本地」了——Meta 这个 30B 开源模型把格局彻底变了

搭 Claude Code 的时候我一直有个遗憾:好东西都在云上,代码要过境,账单按 token 算,数据隐私靠信任换。找了一圈,本地模型要么太小不够智能,要么大到要上服务器——这两条路我都没法接受。

昨天 Meta 发布的 Muse Glimmer,把这个问题彻底拆了。

30B 参数,24GB 显存跑得动

这个数字很多人第一反应是”不可能”。30B 全精度权重本身就要占超过 55GB显存,消费显卡根本装不下。Meta 的解法是 4bit 量化,把语言模型主体压到 20GB 以下,KV 缓存、感知编码器、推测解码的 Drafter 模型全塞进 24GB/32GB 显存范围内。

实测平台:MacBook M4 Max、M5 Max、RTX 5090。速度足够流畅对话和实时 Agent 交互,全程本地跑,不需要联网。

「推理快」和「跑得动本地」同时做到,靠的是这个

大模型逐 token 生成,长推理链或者多步工具调用时会明显感觉卡。Meta 搭配了一个轻量级 Drafter 模型,技术基于 DFlash——小模型一次性提出一批 token,主模型并行验证,接受对的、纠正错的。生成速度大幅提升,输出质量和逐 token 生成完全一致。

不是通用模型改的,是专门为 Agent 训练出来的

Muse Glimmer 不是一个通用模型拿来做 Agent,它从一开始就是为 Agent 场景设计和训练的。几个核心能力:

端到端任务完成:在 DeepSearch QA、MCP-Atlas、τ-Bench、SWE-Bench 等 Agent 基准测试上取得了成绩,覆盖代码编写调试、多轮任务处理等场景。

工具调用:能处理大范围的函数调用,在长流程中精准使用工具。

多步推理:跨越长时间跨度持续推理,在复杂工作流中保持连贯计划。

失败恢复:工具调用失败或返回意外结果时,模型会自己诊断错误并重试,不会直接卡住。

多模态理解:带有专属感知编码器,支持文本和图片交替输入,能理解截图、图表、文档。

训练三阶段怎么分的

预训练阶段以 Muse Spark 输出为基础,用 Logit 蒸馏方式训练;中训练阶段喂入更长上下文、更密集的 Agent 场景数据,配合更丰富的推理轨迹,同时混入有机数据;后训练阶段结合监督微调、在线蒸馏和强化学习,覆盖通用、推理、代码、Agent 四大方向。

现在怎么用

权重已经在 HuggingFace 上可以直接下载(huggingface.co/meta-models/Muse-Glimmer-30B)。本周内陆续上线 Ollama、LM Studio、vLLM、SGLang、Together AI、Fireworks AI、OpenRouter,llama.cpp、MLX、ExecuTorch 的优化适配也将在未来几天到位。AMD、Arm、Dell、Intel、NVIDIA 正在和 Meta 合作针对各类设备做性能优化。

这意味着什么

Claude Code 之类的工具现在好用,但有个前提:你得接受代码过境、按 token 付费、数据隐私靠信任。Muse Glimmer 补上了最后一块短板——30B 的智能,本地跑,不需要服务器,不按 token 计费,数据不离开机器。配 OpenClaw 这类 Agent 编排框架,直接就能用。

下一步你可以做的:去 HuggingFace 把它下下来,配好 Ollama 或者 LM Studio,跑一个自己的编码 Agent,把隐私和成本这两个变量彻底从脑子里删掉。

评论区

0 条评论

登录后可评论。

阿柯·前端架构 1049 阅读