llmfit Skill:一条命令找到你硬件能跑的 LLM 模型

llmfit Skill:一条命令找到你硬件能跑的 LLM 模型

llmfit 是一个 Rust 编写的终端工具,通过检测本机 RAM、CPU、GPU/VRAM 等硬件配置,自动对 HuggingFace 上的数百个 LLM 进行四维评分(质量、速度、适配度、上下文),并告诉用户哪些模型在当前机器上能跑、跑多快。它于 2026 年 2 月发布,因解决了”我的显卡能跑哪个模型”这个高频痛点,迅速成为本地 LLM 选型的事实标准工具。GitHub 主题明确打上了 skill 标签,可作为 Agent 的选型 Skill 接入 OpenClaw、Claude Code 等主流平台。

功能与设计原则

llmfit 的核心能力是”硬件感知型模型推荐”。它不依赖云端查询,本地即可完成;兼容多种推理运行时;输出结构化,可供 Agent 脚本调用。

设计原则方面:本地优先——所有检测和评分在本地完成,不上传硬件数据;可验证性——用户可用 llmfit bench 实测真实 tok/s,结果可提交 PR 合并到官方数据中;渐进式披露——TUI 交互界面适合人类浏览,--json 输出适合 Agent 脚本消费。

认可度

  • GitHub Star:31,994(截至 2026-08-17)
  • Forks:1,985
  • GitHub 主题标签:gguf, llm, localai, mlx, skill, unsloth
  • 今日 GitHub Trending:榜上有名(2026-08-17 日榜)
  • License:MIT
  • 最新提交:2026-08-17(当日活跃维护)

链接

GitHub:https://github.com/AlexsJones/llmfit

原作者

  • GitHub:@AlexsJones(SignPath.io 团队成员)
  • 背景:长期专注本地 LLM 推理工具链,旗下还有 llmserve(本地模型 TUI 服务)、llama-panel(macOS 原生 llama-server 管理)、sympozium(K8s Agent 管理)等一系列相关项目
  • 合作方:SignPath.io(代码签名平台)

介绍

本地运行 LLM 的门槛不在于模型本身,而在于选型。用户面对 HuggingFace 上成百上千的模型,加上不同的量化等级(Q8_0 到 Q2_K)、不同的运行时(Ollama、llama.cpp、MLX、LM Studio 等),很难快速判断”我这块 8GB 显存显卡到底能跑哪个模型、跑多快”。

llmfit 解决的就是这个问题。运行 llmfit,它会自动检测本机硬件(RAM、CPU 核心数、GPU 型号与 VRAM,支持 NVIDIA/AMD/Intel Arc/Apple Silicon/Ascend),然后对模型数据库中的每个模型计算四维评分:

  • Quality:参数规模、家族声誉、量化损耗、任务匹配度
  • Speed:基于后端类型估算 tokens/sec
  • Fit:显存利用率效率(50-80% 为最优区间)
  • Context:上下文窗口大小与目标场景的匹配程度

评分结果按用途(通用/编程/推理/聊天/多模态/嵌入)加权,用户得到一个适合自己硬件和场景的排名列表。

最新版本还加入了 benchmark & share 功能:用户实测 tok/s 后可直接从 TUI 提交 PR,数据合并后所有使用相同硬件的人都能获得实测数据而非估算值。

特点

  • 硬件自动检测:NVIDIA GPU(多卡聚合 VRAM)、AMD ROCm、Apple Silicon 统一内存、Intel Arc、Ascend 等
  • 多运行时兼容:Ollama、llama.cpp、MLX(Apple Silicon)、Docker Model Runner、LM Studio
  • 动态量化选择:从 Q8_0(最高质量)到 Q2_K(最高压缩)自动选择最适合当前硬件的量化等级
  • MoE 模型支持:自动识别 Mixtral、DeepSeek-V2/V3 等稀疏架构,只计入激活参数而非全量参数
  • 双模式输出:交互式 TUI(默认)面向人类用户,--json 面向 Agent 脚本自动化
  • 可验证数据:实测 tok/s 可提交 PR,所有相同硬件用户受益

使用方法

安装(多平台)

# macOS
brew install AlexsJones/llmfit/llmfit

# Windows(Scoop)
scoop install llmfit

# Linux/macOS 通用脚本
curl -fsSL https://llmfit.axjns.dev/install.sh | sh

# Python 生态
uv tool install -U llmfit

# Docker
docker run ghcr.io/alexsjones/llmfit

# 源码编译
git clone https://github.com/AlexsJones/llmfit.git && cd llmfit && cargo build --release

基本使用

llmfit                          # 交互式 TUI:硬件信息 + 模型排名
llmfit fit                      # 输出所有模型适配度表格
llmfit recommend --json         # JSON 输出(供 Agent 脚本使用)
llmfit info "<model>"          # 单模型详细分析
llmfit bench                    # 实测 tok/s(需本地运行模型)
llmfit doctor                   # 硬件检测报告(调试用)

OpenClaw Agent 接入

通过 OpenClaw 的 openclaw skills 命令可将其作为选型 Skill 使用:

openclaw skills add AlexsJones/llmfit

使用场景与人群

适用场景
– 本地 LLM 选型(个人开发者的 Mac/PC、游戏主机、工作站)
– CI/CD 环境自动选择量化等级
– Agent 工作流中的模型自动切换
– 企业内网离线推理环境评估

目标用户
– 本地运行 LLM 的开发者
– 需要在资源受限环境下选型的 AI 工程师
– 搭建本地 AI 工作流的 Agent 用户
– 关注隐私、不希望数据上云的 LLM 用户

输入与输出案例

案例一:交互式选型

用户在终端运行 llmfit,TUI 显示本机硬件:
- Apple M3 Max(统一内存 64GB)
- 后端:Metal(macOS GPU 加速)

TUI 排序输出(Top 5):
1. Qwen2.5-14B-Q5_K_M   Fit:96  Speed:42 tok/s  Quality:87
2. Llama-3.1-8B-Q4_K_M  Fit:94  Speed:58 tok/s  Quality:85
3. Mistral-7B-Q5_K_M    Fit:91  Speed:51 tok/s  Quality:83
4. Phi-3.5-mini-Q4_K_M  Fit:89  Speed:63 tok/s  Quality:79
5. DeepSeek-Coder-Q4_K  Fit:87  Speed:55 tok/s  Quality:82

案例二:Agent 脚本调用

llmfit recommend --use-case coding --json
{
  "use_case": "coding",
  "hardware": {"ram_gb": 32, "vram_gb": 8, "backend": "cuda"},
  "models": [
    {"name": "Qwen2.5-Coder-14B-Q4_K_M", "score": 91, "speed_est": 31, "fit": 95},
    {"name": "DeepSeek-Coder-7B-Q5_K_M", "score": 88, "speed_est": 28, "fit": 92},
    {"name": "Starcoder2-15B-Q4_K_M", "score": 84, "speed_est": 24, "fit": 88}
  ]
}

GitHub: https://github.com/AlexsJones/llmfit

评论区

0 条评论

登录后可评论。

Skill超级捕获手 14 阅读