手机和手表能自己跑AI Agent了——这不是云端的事,是硬件的事
手机和手表能自己跑 AI Agent 了——这不再是云端的事,是硬件的事。
8月10日,Meta 正式发布了 Muse Glimmer,一款 300 亿参数的开源权重模型,核心定位只有一个:让 AI Agent 常驻在你的设备上跑,不需要联网,不需要把数据送出去。
官方说,4bit 量化之后,它只需要一张有 24GB 或 32GB 显存的 GPU 就能跑。MacBook M4 Max、M5 Max、桌面 PC 的 RTX 5090,实测都能跑到「流畅对话 + 实时 Agent 交互」的程度。所有计算在本地完成,数据不离开设备。
这不是第一款主打端侧的模型。但它的意义在于:把本地 Agent 这件事,从极客玩具变成了可以正经用的产品。
三个关键数据,把这件事说清楚
第一个数字:12.8 万 Token 上下文
Agent 跑任务经常需要多步推理、读一堆文件。上下文窗口太小,中间结果得反复加载,体验会很差。Muse Glimmer 给的是 12.8 万 Token——相当于一部中长篇小说的长度,够一张显卡在本地处理,不需要拆成多次调用。
第二个数字:2 万 Token/秒
这是官方在 RTX 5090 上测出来的数字。听起来很快,但实际跑 Agent 任务时,2 万 Token/秒指的是生成速度,不是整个推理链路的速度。不过它说明一件事:单卡本地跑的响应速度,已经可以支撑实时对话和连续任务执行了,不像以前那样等个十几秒才有反应。
第三个数字:Apache 2.0 许可证
权重在 Hugging Face 直接下载,不需要申请,不需要审核,商业使用也没限制。这一点比很多「开源」但限制一堆的模型要干净得多。
它和云端模型差在哪?
最大的区别不是能力上限,是数据走向。
用 GPT-4o 或 Claude,你的对话数据先到云端,模型处理完再回来。数据在你的设备上,但处理在别人那里。隐私政策再好,物理上就是送出去了。
Muse Glimmer 跑在本地,数据从进到出都在你自己的设备上。适合两类场景:一是对隐私极度敏感的任务,比如处理公司内部文档、CRM 数据、医疗记录;二是需要常驻跑的任务,比如每天自动整理邮件、生成日报、监控仪表盘——这些不需要每次都联网唤醒一个云端 API,本地跑更划算。
当然,能力上限和云端还是有差距的。30B 参数在本地已经是很大的量级,但和 GPT-5.6 这种万亿参数的云端模型比,复杂推理和多模态能力不在一个量级。它不是要替代云端,是在本地 Agent 这个场景里找到了自己的位置。
硬件门槛这件事,怎么看?
24GB 显存是个门槛,但不是高不可攀。
一张 RTX 3090 是 24GB,RTX 4090 也是 24GB——这两张显卡 2022 年就发了,现在二手市场价格已经下来。M4 Max MacBook 统一内存最高能到 128GB,但基础配置就有 36GB,够跑量化版本。
对于普通用户,现在一台 M4 MacBook Air 或者配一张 RTX 3060 的 PC,其实跑不动这个模型——不是它不好,是硬件要求摆在那里。但对于已经有高性能设备的开发者,或者企业里配了工作站的人,这张显卡本来就在,跑一个本地 Agent 模型几乎是零额外成本。
我的判断:这件事值不值得跟?
Muse Glimmer 解决的是本地 Agent 的「有没有」问题,而不是「好不好」问题。
以前你想在本地跑一个正经的 AI Agent,可以选的方向很有限:要么用很小的模型(几 B 参数),能力差很多;要么用云端 API,把数据送出去。Muse Glimmer 把中间这条路填上了——30B 参数够用,4bit 量化让它跑得动,Apache 2.0 让商业使用没有法律障碍。
对于 AI 产品观察这个视角,Muse Glimmer 真正的意义是:它把「端侧 AI Agent」从 Demo 阶段推进到了可以正经用的阶段。接下来看的是,谁能在它上面做出真正好用的产品——个人助手、自动化工作流、隐私敏感的垂直场景,这些才是它真正的主战场。
下一步可以关注:Muse Spark 版本(官方说会更强)、以及基于它做出的第三方 Agent 产品。
评论区
登录后可评论。