时间:2026 年 8 月 23 日
地点:美国(加州大学伯克利分校 UC Berkeley 与 德州大学奥斯汀分校 UT Austin)
人物:Shuo Yang(UC Berkeley)、Chenfeng Xu(UT Austin)、Matei Zaharia、Ion Stoica、Song Han、Kurt Keutzer 等 11 位研究者组成的 FlashML 团队
事件详情:FlashML 团队正式开源边缘原生 MoE 推理引擎 FreeToken,可在单张消费级工作站显卡上运行 753B 参数的 GLM-5.2 模型。该系统采用带宽自适应执行 q* 策略与语义感知缓存,将个人电脑视为统一弹性推理平台,按实时可用的 GPU/CPU/内存/总线带宽动态映射计算与权重:8GB 笔电 GPU 跑 35B Qwen3.6 达 39 tokens/s,RTX 5090 台式机跑 284B DeepSeek-V4-Flash 达 22-25 tokens/s,RTX PRO 6000 工作站单卡跑 753B GLM-5.2 达 14.9 tokens/s、平均 TTFT 7.5 秒。FreeToken 以 Apache-2.0 协议发布在 GitHub(FlashML-org/FreeToken),同时上架 PyPI(freetoken v0.1.2)与 flashml.ai 一键桌面端,兼容 Claude Code、Codex、OpenCode、OpenClaw、DeepSeek Harness 等智能体。论文 8 月 17 日上线 arXiv(2608.16157),相比 llama.cpp 在 RTX 5090 上解码速度提升 2.0-2.3 倍,TTFT 控制在 44 秒以内。
行业背景:Kimi-K3、GLM-5.2、DeepSeek-V4-Flash 等开源权重模型能力已逼近闭源系统,但运行成本仍是瓶颈;全球超过 1 亿台消费级设备搭载独立显卡,Steam 月活超 2 亿、其中 72% 系统有独立 NVIDIA GPU。现有引擎(llama.cpp、KTransformers、Ollama、MoE-Infinity)存在三大痛点:预填充破坏稀疏性、专家分配静态化、消费级 CPU 难以承担剩余计算。
影响:FreeToken 将前沿 MoE 模型的部署从数据中心级 GPU 集群下沉到单张消费级显卡,意味着医疗、法律、国防、金融等数据敏感行业的本地大模型部署成本结构性下降;同时也对 Etched 等专用推理芯片公司提出挑战,开源生态可能在消费级硬件上吃掉相当一部分推理工作负载。
总结:FreeToken 用软件重新定义了大模型的硬件门槛,把 753B 级 MoE 模型从机房搬进桌面,标志着用已有的硬件跑前沿开源模型在工程上正式可行。
参考来源:
1. https://www.marktechpost.com/2026/08/23/meet-freetoken-an-edge-native-moe-serving-engine-that-runs-753b-glm-5-2-on-a-single-workstation-gpu/
2. https://arxiv.org/abs/2608.16157
3. https://github.com/FlashML-org/FreeToken
4. https://www.flashml.ai/
5. https://ai-beat.github.io/news/2026/08/freetoken-edge-moe-serving
6. https://aiinsiders.net/article/a-753b-parameter-model-now-fits-on-one-workstation-gpu
7. https://dev.to/breachprotocol/a-753-billion-parameter-model-ran-on-a-single-workstation-gpu-bh6
8. https://wpnews.pro/news/run-frontier-models-on-gaming-gpus
9. https://www.emergentmind.com/papers/2608.16157
10. https://thecryptopost.io/meet-freetoken-an-edge-native-moe-serving-engine-that-runs-753b-glm-5-2-on-a-single-workstation-gpu









