Magnitude Skill:让 AI 编码 Agent 零成本跑本地大模型

Magnitude 是一个开源本地推理服务器,能自动检测你的硬件配置,推荐并运行最适合的本地大模型,让 AI 编码助手摆脱云端 API 和 Token 费用。它支持 Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi 和 Cline 等主流 Agent,一行命令完成本地模型切换,全程离线运行、数据不出本机。

功能与原则

Magnitude 解决的是”本地跑 Agent”这件事的最后一公里问题:硬件检测 → 模型推荐 → 下载 → 推理,全部开箱即用,不需要自己搭 Ollama 或 LM Studio。它自带推理引擎和模型管理,Agent 调用本地模型时只需连 Magnitude,无需额外部署服务。核心理念是:免费、隐私、全程本地

认可度

  • GitHub stars:1,849(截至 2026-09-03)
  • Forks:139
  • 2026-08-21 登上 GitHub Trending(TypeScript 日榜),当日 +130 stars
  • AGI Hunt、quidproquo 等 AI Agent 垂直媒体有专题报道
  • 官方 Discord 社区活跃,文档更新频繁(最近一次 commit 距今不到 24 小时)

链接

GitHub:https://github.com/magnitudedev/magnitude

原作者

magnitudedev 团队维护(GitHub org),背后是一家专注本地 AI 推理的基础设施公司。Magnitude 同时也是一个完整 Agent 产品(内置 Agent + 推理引擎),定位是”本地 AI Agent 的基础设施层”。

介绍

Magnitude 起源于 2026 年 6 月,是一个 TypeScript/Bun 技术栈的单体仓库(Turbo monorepo),包含 CLI、Desktop App、Web UI 和核心推理引擎。它的核心使用路径极简:

npm i -g @magnitudedev/cli
magnitude docs onboarding

Agent 收到这条指令后,会自动检测本机 CPU、内存、带宽,写入 harness 配置,下载推荐模型,然后切换到本地推理模式。过程中 Agent 自主完成,不需要人工介入。

支持的模型通过 GGUF 格式加载,支持从 Hugging Face 下载自定义模型。模型按需加载,空闲或内存紧张时自动卸载,适合长期后台运行。实测案例:DGX Spark 上跑 Qwen 3.6 35B-A3B 达到约 60 tok/s。

特点

  • 零成本推理:无 Token 消耗、无 API 限流、无订阅费
  • 完全离线:模型、Prompt、文件全程留在本机,首次下载后无需联网
  • 硬件感知:自动检测芯片/内存/带宽,推荐最适合当前机器的模型及量化版本
  • 多 Agent 兼容:Pi、OpenCode、Hermes、OpenClaw、Codex、Claude Code、Oh My Pi、Cline 全部支持
  • 按需调度:模型 JIT 加载 + 空闲卸载,内存管理由 Magnitude 自动处理
  • 端到端调优:推测解码、并发参数均针对 Agent 工作负载预配置
  • 技能扩展:通过 skills.sh 可一键为 Magnitude 添加 Excel、PDF、Chrome 等技能包

使用方法

安装(任选一种):

# 通过 npm 安装 CLI
npm i -g @magnitudedev/cli

# 或通过 Skills CLI 注入已有 Agent
npx skills add vercel-labs/agent-browser  # 浏览器控制技能示例

启动引导(让 Agent 自动完成):

Set up local models for me with the Magnitude CLI. Install it with `npm i -g @magnitudedev/cli`, then run `magnitude docs onboarding` and follow the instructions.

手动浏览模型库:

npm i -g @magnitudedev/cli
magnitude setup

接入已有 Agent:

在 Agent 中运行 magnitude docs onboarding,Magnitude 会自动写入对应 harness 配置,Agent 随后切换到本地模型推理。

使用场景与人群

  • 有隐私需求的开发者:代码、数据、文档不想经过任何云端
  • 成本敏感型用户:Token 费用累计较高的重度 Agent 用户
  • 离线/内网环境:公司内网或无法访问外部 API 的场景
  • 多 Agent 玩家:同时维护多个 Agent(Claude Code + Cline + OpenCode 等),想统一管理本地推理后端

输入与输出案例

案例一:硬件感知模型推荐

输入(Agent 执行):

Set up local models for me with the Magnitude CLI. Install it with `npm i -g @magnitudedev/cli`, then run `magnitude docs onboarding`

输出:
Magnitude 检测到本机硬件(假设为 M3 Max MacBook Pro),推荐 Qwen 3.6 35B-A3B Q4_K_M,预估推理速度约 45 tok/s,用户确认后自动下载并切换 Agent 到本地模型,Agent 后续所有推理基于本地,无任何 Token 消耗。

案例二:多 Agent 共享同一本地推理后端

用户同时运行 Claude Code(主力编码)和 Cline(轻量辅助),两者都连接同一个 Magnitude 实例。Magnitude 在后台管理同一个模型的生命周期,多个 Agent 按请求轮流使用,内存紧张时自动卸载,释放后重新加载,全程无需人工干预。


GitHub: https://github.com/magnitudedev/magnitude
Stars: 1,849(截至 2026-09-03)


GitHub: https://github.com/magnitudedev/magnitude

评论区

0 条评论

登录后可评论。

Skill超级捕获手 13 阅读