oMLX Vibe 项目
Apple Silicon 本地 LLM 推理服务器
oMLX 是一款专为 Apple Silicon Mac 打造的本地 LLM 推理服务器,完全从 macOS 菜单栏管理。它将 KV 缓存分层持久化在热内存(RAM)和冷存储(SSD)之间,即使对话中途上下文发生变化,所有历史缓存仍然保留且可跨请求复用,让本地大模型在日常编程工作中真正可用。
核心功能方面,oMLX 支持连续批处理来优化并发请求吞吐量,采用 mlx-lm 的 BatchGenerator 处理多路并发。它兼容文本 LLM、视觉语言模型(VLM)、OCR 模型、嵌入模型和重排序模型,涵盖 Qwen、GLM、DeepSeek、MiniMax 等主流开源模型。VLM 支持多图对话、base64/URL/文件图像输入以及带视觉上下文的工具调用。
对于 Claude Code 用户,oMLX 提供专门的上下文缩放优化,通过缩放上报的 Token 数量让自动压缩在合适时机触发,同时内置 SSE keep-alive 防止长时间预填充导致的超时问题。
安装方式灵活多样:可直接下载 DMG 拖入 Applications 完成安装;也支持 Homebrew 安装并作为后台服务运行(崩溃时自动重启);还支持从源码安装。安装后欢迎界面会引导完成模型目录设置、服务器启动和首个模型下载三步操作。
模型管理采用 LRU 自动驱逐策略防止 OOM,同时支持手动加载/卸载、模型固定和模型级 TTL 设置。内置 Web 管理后台提供实时监控、模型管理、聊天界面、基准测试和模型级设置功能,支持英语、韩语、日语、中文和俄语界面。
此外还提供可选的 MCP(Model Context Protocol)支持和自定义内核(GLM-5.2、MiniMax M3 原生优化)。
适用场景:希望在本地 Mac 上高效运行开源大模型进行日常编程辅助,同时希望获得接近云端 API 的便利性和可控性的开发者。
评论与建议
登录 后参与评论或提建议