想给Agent换本地模型省点Token,装好Ollama随手拉一个模型,跑起来超…

想给Agent换本地模型省点Token,装好Ollama随手拉一个模型,跑起来超级慢,内存也被撑爆。这个问题很多人都遇到过,根源在于你选的模型和你的硬件不匹配。

Magnitude这个开源推理服务器换了个做法:先给机器做体检,芯片、内存、带宽摸一遍,再推荐哪些模型装得下、大概能跑多快。选定之后它负责下载、调参、常驻后台跑,模型要用时才加载,闲置或内存吃紧就自动卸掉,不用我们盯着。

安装方式很简单,两行命令搞定:
npm i -g @magnitudedev/cli
magnitude setup

它会自动检测你的硬件配置,然后在速度、准确率、智能程度、内存需求四个维度上对模型进行排名。你只需要选一个最适合你机器的模型,然后选一个你喜欢的harness(Pi、OpenCode、Claude Code、Codex等),就能直接开始用了。

这个工具解决了一个很核心的问题:之前用Ollama跑本地模型,最大的痛点是选模型靠猜。你不知道你的机器能跑什么模型,也不知道跑起来会多慢。经常是拉了一个70B的模型,结果跑起来每秒只有1个token,还不如用API。或者拉了一个小模型,结果智能程度不够,回答质量很差。

Magnitude把选模型这件事变成了一个科学的决策过程。它会根据你的实际硬件给出最优推荐,而不是让你自己去试错。而且它的模型管理很智能——用的时候自动加载,不用的时候自动卸载,不会一直占着内存。

实测下来几个场景特别好用:

  1. Mac用户想省Token。Mac的统一内存架构其实很适合跑本地模型,但之前选模型很头疼。Magnitude会根据你的Mac内存大小推荐最合适的模型,比如16GB内存推荐7B-8B模型,32GB推荐13B-14B模型,64GB推荐30B-34B模型。
  1. 多Agent并行场景。如果你想让多个Agent同时跑,每个Agent用不同的模型,Magnitude可以同时管理多个模型实例,按需加载和卸载,不会互相抢资源。
  1. 开发测试。你需要快速测试不同模型在你的任务上的表现,Magnitude可以帮你快速切换模型,不用每次都重新下载和配置。

支持Claude Code、Codex、OpenCode、Cline等8个工具接入,推理加速和并发参数也按你的机器预先调好。模型、提示词、文件全在本机,下载完断网照用。

项目地址:github.com/magnitudedev/m…

如果你在用Agent做开发,又心疼Token费用,这个工具强烈推荐。它能让你的本地模型体验从「勉强能用」变成「真的好用」。

话题来源 @akshay_pachaar 256.9K阅读 ❤️2816 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单