FreeToken Skill:单卡 5090 满血跑 DeepSeek-V4-Flash 的端侧 MoE 引擎
单张 RTX 5090 满血跑 DeepSeek-V4-Flash 284B,这在一个月前还只是科研 PPT 上的愿景。FlashML-org 的 FreeToken 把这件事做成了开箱即用的桌面应用与 CLI,一周内登顶 GitHub 周榜、刷屏中文 AI 社区,正在重新定义「个人硬件 + 前沿 MoE」的边界。
功能与原则
FreeToken 是一个端侧 MoE(Mixture-of-Experts)大模型推理引擎,定位是「把数据中心级的智能,搬到你已有的游戏 PC 上」。它在设计上有三条核心原则:
- 全栈异构协同:把 GPU、CPU、主机内存和 PCIe 互连视作统一的弹性推理平台,CPU + GPU 不是分工,而是按 PCIe 拓扑自动收敛到一个最优调度点($q^star$ policy)。
- 面向 Agent 的语义缓存:在 Token 边界做轻量级检查点、复用 KV cache,让 Agent 多轮工具调用不必重算历史上下文,显著降低 TTFT。
- 弹性显存管理:后台进程抢显存时,运行时动态重分配 Expert cache 与 KV 内存,0 停机、0 OOM、0 重载模型。
认可度
- GitHub 截至 2026-08-27 约 8,664 ⭐、Fork 756、订阅者 79、最新 release v0.1.2(2026-08-19)。
- 2026-08-27 Trendshift GitHub 周榜 AI 方向 #1(位置高于 tt-a1i/archify、basecamp/omarchy 等热点项目)。
- 中文 AI 社区爆款:53AI、BestAITool、52AI、微博科技圈同步刷屏,「单卡 5090 跑满血 DeepSeek」成为 8 月下旬最热的本地 LLM 话题之一。
- 上线不到 6 周即冲到近 9K 星,符合「近期正在爆」的爆款曲线。
- 官方提供 Windows / Linux 桌面 App(GUI)、CLI、Python SDK、Slack / Discord / 微信群开发者社区。
链接
- GitHub: https://github.com/FlashML-org/FreeToken
- 官网: https://www.flashml.ai/
- 论文: https://arxiv.org/abs/2608.16157
原作者
- 一作 Shuo Yang(杨硕):UC Berkeley EECS 博士生。
- Xiaoze Fan(范晓泽):UT Austin,本科毕业于上海交通大学。
- 共同作者还包括 Ion Stoica、Matei Zaharia、Kurt Keutzer、韩松(Song Han)、Melissa Pan、Haocheng Xi、Zhe Wang、Shanlin Sun、Chenfeng Xu。
- 团队横跨 Berkeley Sky / RISELab、MIT、UT Austin,是 Spark / Ray / SGLang 一脉的端侧延伸。
介绍
FreeToken 解决的是一个具体而普遍的痛点:前沿 MoE 模型(DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2 等)参数动辄几十 GB 到几百 GB,个人开发者只能在「完全没法跑」和「加载半天、生成一字」之间二选一。传统的 CPU–GPU 权重卸载方案被 PCIe 带宽锁死,每秒 token 经常掉到个位数。
FreeToken 的关键创新是把 MoE 推理的瓶颈从「带宽搬运」重新定义为「协同调度」。它引入双缓冲 prefill 流式、全局 LRU Expert cache、FTW 快权重格式,并对齐 Anthropic / OpenAI 兼容 API,使下游 Codex、Claude Code、OpenCode、OpenClaw、DeepSeek Harness 等 Agent 工具可以零改动接入。
在论文与官方 benchmark 中:RTX 4060 笔记本跑 Qwen3.6-35B 达到约 39.3 tok/s;RTX 5090 台式机跑 DeepSeek-V4-Flash 284B 约 22–25 tok/s;4–16k 长 Prompt 下首 Token 延迟(TTFT)相比基线降低 42–58%;Agent 多轮工具调用场景下的 TTFT 进一步降低 65–80%。这些数字意味着 Claude Code 这类 agentic 工具第一次真正可以在个人笔记本上「交互级」运行。
特点
- 首款面向 Agent 的端侧 MoE 引擎:不是单纯的模型加载器,而是把 Agent 多轮上下文改动、Tool call、CoT 迭代纳入缓存语义,做到「上一轮工具结果改一行,下一轮立刻复用 KV cache」。
- PCIe 带宽自适应:后台进程抢占总线时,自动提升 CPU 分流比例,无需人工调参。
- 弹性显存,零停机:后台 3D 渲染 / 游戏 / 编译同时跑时,可热扩缩 Expert cache 与 KV 内存,不触发 CUDA OOM。
- 主流 MoE 全覆盖:DeepSeek-V4-Flash、Qwen3.6、GLM-5.2 等 20+ 模型原生支持,量化格式覆盖 MXFP4 / NVFP4 / FP8 / BF16。
- 生态对齐:Anthropic / OpenAI 兼容 API,一行
npx skills add就能让 Claude Code、Codex、OpenCode 等 Agent 在本地驱动 DeepSeek 等前沿 MoE。
使用方法
方式 1:桌面 App(最省事)
到 flashml.ai 下载 Windows 或 Linux 桌面客户端,自带 GUI、聊天窗口与引擎调参面板,双击安装即用。
方式 2:CLI 一行安装
# 推荐:使用 uv
uv pip install "freetoken[accel]"
# 或从源码构建
git clone https://github.com/FlashML-org/FreeToken.git
cd FreeToken
uv venv && source .venv/bin/activate
uv pip install -e ".[accel]"
方式 3:接入 Claude Code / Codex
FreeToken 暴露 Anthropic / OpenAI 兼容 API,本地启动后端服务,把 ANTHROPIC_BASE_URL 或 OPENAI_BASE_URL 指向本地端口,Claude Code、Codex、OpenCode、OpenClaw 即可使用本地 MoE 替代云端推理,实现「完全离线 + 完全免费 + 完全自托管」的 Agent 工作流。
使用场景与人群
- 个人本地 Agent 开发者:笔记本 + 游戏 PC 想跑 Claude Code / Codex,又不想每月为 token 烧钱。
- 前沿模型研究者:想本地试用 DeepSeek-V4-Flash、GLM-5.2 等 200B+ MoE,又受限于机房排队。
- 企业内网 / 涉密场景:必须全离线,又不能接受「小模型 = 弱能力」的代价。
- Agent 框架作者:在 Claude Code / Codex / OpenCode / OpenClaw 之上做应用,需要可复现的本地推理后端。
- 游戏 / 工作并行用户:边跑 3D 渲染或编译、边让本地 Agent 干活,对显存弹性要求极高。
输入与输出案例
案例 1:RTX 5090 单卡满血 DeepSeek-V4-Flash
- 输入:RTX 5090 32GB + 192GB DDR5 内存,加载 DeepSeek-V4-Flash(284B MoE,官方检查点非量化)。
- 输出:约 22–25 tok/s 持续生成速度,Agent 工具调用 + CoT 多轮场景 TTFT 相比传统卸载方案降低 65–80%,完整跑通 Claude Code 的多文件重构、PR 审查、调试循环而无需联网。
案例 2:RTX 4060 笔记本跑 Qwen3.6-35B
- 输入:RTX 4060 8GB 笔记本,加载 Qwen3.6-35B-A3B。
- 输出:约 39.3 tok/s 的「交互级」生成速度,4–16k 长 Prompt 首 Token 延迟相比 Ollama 基线降低 42–58%,后台挂着 Chrome / Slack / 编译任务时不触发 OOM,GPU cache 自动收缩、转交 CPU 算力。
评论区
登录后可评论。