llmfit Skill:一条命令找到你硬件能跑的 LLM 模型
llmfit Skill:一条命令找到你硬件能跑的 LLM 模型
llmfit 是一个 Rust 编写的终端工具,通过检测本机 RAM、CPU、GPU/VRAM 等硬件配置,自动对 HuggingFace 上的数百个 LLM 进行四维评分(质量、速度、适配度、上下文),并告诉用户哪些模型在当前机器上能跑、跑多快。它于 2026 年 2 月发布,因解决了”我的显卡能跑哪个模型”这个高频痛点,迅速成为本地 LLM 选型的事实标准工具。GitHub 主题明确打上了 skill 标签,可作为 Agent 的选型 Skill 接入 OpenClaw、Claude Code 等主流平台。
功能与设计原则
llmfit 的核心能力是”硬件感知型模型推荐”。它不依赖云端查询,本地即可完成;兼容多种推理运行时;输出结构化,可供 Agent 脚本调用。
设计原则方面:本地优先——所有检测和评分在本地完成,不上传硬件数据;可验证性——用户可用 llmfit bench 实测真实 tok/s,结果可提交 PR 合并到官方数据中;渐进式披露——TUI 交互界面适合人类浏览,--json 输出适合 Agent 脚本消费。
认可度
- GitHub Star:31,994(截至 2026-08-17)
- Forks:1,985
- GitHub 主题标签:gguf, llm, localai, mlx, skill, unsloth
- 今日 GitHub Trending:榜上有名(2026-08-17 日榜)
- License:MIT
- 最新提交:2026-08-17(当日活跃维护)
链接
GitHub:https://github.com/AlexsJones/llmfit
原作者
- GitHub:@AlexsJones(SignPath.io 团队成员)
- 背景:长期专注本地 LLM 推理工具链,旗下还有 llmserve(本地模型 TUI 服务)、llama-panel(macOS 原生 llama-server 管理)、sympozium(K8s Agent 管理)等一系列相关项目
- 合作方:SignPath.io(代码签名平台)
介绍
本地运行 LLM 的门槛不在于模型本身,而在于选型。用户面对 HuggingFace 上成百上千的模型,加上不同的量化等级(Q8_0 到 Q2_K)、不同的运行时(Ollama、llama.cpp、MLX、LM Studio 等),很难快速判断”我这块 8GB 显存显卡到底能跑哪个模型、跑多快”。
llmfit 解决的就是这个问题。运行 llmfit,它会自动检测本机硬件(RAM、CPU 核心数、GPU 型号与 VRAM,支持 NVIDIA/AMD/Intel Arc/Apple Silicon/Ascend),然后对模型数据库中的每个模型计算四维评分:
- Quality:参数规模、家族声誉、量化损耗、任务匹配度
- Speed:基于后端类型估算 tokens/sec
- Fit:显存利用率效率(50-80% 为最优区间)
- Context:上下文窗口大小与目标场景的匹配程度
评分结果按用途(通用/编程/推理/聊天/多模态/嵌入)加权,用户得到一个适合自己硬件和场景的排名列表。
最新版本还加入了 benchmark & share 功能:用户实测 tok/s 后可直接从 TUI 提交 PR,数据合并后所有使用相同硬件的人都能获得实测数据而非估算值。
特点
- 硬件自动检测:NVIDIA GPU(多卡聚合 VRAM)、AMD ROCm、Apple Silicon 统一内存、Intel Arc、Ascend 等
- 多运行时兼容:Ollama、llama.cpp、MLX(Apple Silicon)、Docker Model Runner、LM Studio
- 动态量化选择:从 Q8_0(最高质量)到 Q2_K(最高压缩)自动选择最适合当前硬件的量化等级
- MoE 模型支持:自动识别 Mixtral、DeepSeek-V2/V3 等稀疏架构,只计入激活参数而非全量参数
- 双模式输出:交互式 TUI(默认)面向人类用户,
--json面向 Agent 脚本自动化 - 可验证数据:实测 tok/s 可提交 PR,所有相同硬件用户受益
使用方法
安装(多平台):
# macOS
brew install AlexsJones/llmfit/llmfit
# Windows(Scoop)
scoop install llmfit
# Linux/macOS 通用脚本
curl -fsSL https://llmfit.axjns.dev/install.sh | sh
# Python 生态
uv tool install -U llmfit
# Docker
docker run ghcr.io/alexsjones/llmfit
# 源码编译
git clone https://github.com/AlexsJones/llmfit.git && cd llmfit && cargo build --release
基本使用:
llmfit # 交互式 TUI:硬件信息 + 模型排名
llmfit fit # 输出所有模型适配度表格
llmfit recommend --json # JSON 输出(供 Agent 脚本使用)
llmfit info "<model>" # 单模型详细分析
llmfit bench # 实测 tok/s(需本地运行模型)
llmfit doctor # 硬件检测报告(调试用)
OpenClaw Agent 接入:
通过 OpenClaw 的 openclaw skills 命令可将其作为选型 Skill 使用:
openclaw skills add AlexsJones/llmfit
使用场景与人群
适用场景:
– 本地 LLM 选型(个人开发者的 Mac/PC、游戏主机、工作站)
– CI/CD 环境自动选择量化等级
– Agent 工作流中的模型自动切换
– 企业内网离线推理环境评估
目标用户:
– 本地运行 LLM 的开发者
– 需要在资源受限环境下选型的 AI 工程师
– 搭建本地 AI 工作流的 Agent 用户
– 关注隐私、不希望数据上云的 LLM 用户
输入与输出案例
案例一:交互式选型
用户在终端运行 llmfit,TUI 显示本机硬件:
- Apple M3 Max(统一内存 64GB)
- 后端:Metal(macOS GPU 加速)
TUI 排序输出(Top 5):
1. Qwen2.5-14B-Q5_K_M Fit:96 Speed:42 tok/s Quality:87
2. Llama-3.1-8B-Q4_K_M Fit:94 Speed:58 tok/s Quality:85
3. Mistral-7B-Q5_K_M Fit:91 Speed:51 tok/s Quality:83
4. Phi-3.5-mini-Q4_K_M Fit:89 Speed:63 tok/s Quality:79
5. DeepSeek-Coder-Q4_K Fit:87 Speed:55 tok/s Quality:82
案例二:Agent 脚本调用
llmfit recommend --use-case coding --json
{
"use_case": "coding",
"hardware": {"ram_gb": 32, "vram_gb": 8, "backend": "cuda"},
"models": [
{"name": "Qwen2.5-Coder-14B-Q4_K_M", "score": 91, "speed_est": 31, "fit": 95},
{"name": "DeepSeek-Coder-7B-Q5_K_M", "score": 88, "speed_est": 28, "fit": 92},
{"name": "Starcoder2-15B-Q4_K_M", "score": 84, "speed_est": 24, "fit": 88}
]
}
评论区
登录后可评论。