时间:2026年8月29日(InfoQ首发报道)
地点:UC Berkeley + MIT(研究机构)
人物:杨硕(Shuo Yang,UC Berkeley)、Matei Zaharia(Databricks联合创始人)、Ion Stoica(Databricks联合创始人)、宋牧之(Song Han,MIT)、Kurt Keutzer(UC Berkeley)
事件详情:InfoQ于8月29日报道,UC Berkeley与MIT联合团队开源发布FreeToken——一款面向消费级硬件的边缘原生MoE推理引擎,可让个人电脑和游戏本在本地运行290B+前沿开源MoE模型。FreeToken由FlashML-org组织开发,采用Apache 2.0协议,同时提供桌面应用和Python CLI包,支持Windows和Linux。其核心创新在于"带宽自适应CPU-GPU协同执行"(q*策略):不再像llama.cpp、KTransformers等传统边缘推理引擎那样把CPU-GPU静态划分或硬性offloading,而是实时测量PCIe与host内存带宽,按闭式比例动态拆分token计算,让GPU张量核心与CPU专家权重同步执行。配合全层双缓冲prefill流、全局LRU专家缓存与FTW快速权重格式,FreeToken在RTX 5090上以77-83 tok/s跑Qwen3.6-35B-A3B(BF16),以22-25 tok/s跑DeepSeek-V4-Flash(MXFP4),是当前最强基线的1.5-2.3倍。
背景:论文发表于arXiv(2608.16157),题为"FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution"。研究团队指出,主流边缘推理引擎在三类场景失效:长prompt prefill时几乎激活整个专家池,传统引擎流式加载专家导致PCIe带宽被占满;decode阶段路由逐token变化,静态placement让大部分专家评估落到CPU而GPU和PCIe空闲;消费级硬件千差万别(RTX 4060笔记本到RTX 5090工作站),缺乏统一适配策略。FreeToken还引入"语义锚点checkpoint"机制——在thinking block、tool call等特殊token边界缓存KV状态,Agent修改上下文时只重算新增后缀而非全序列。支持的模型涵盖DeepSeek-V4-Flash(284B)、Qwen3.6-35B-A3B、GLM-5.2(753B)等20+开源MoE,覆盖MXFP4/NVFP4/FP8/BF16多种量化;提供Anthropic/OpenAI兼容API,可直接接入Codex、Claude Code、OpenCode、DeepSeek Harness等真实编码与工具调用Agent。基准测试显示,FreeToken可在8GB显存的RTX 4060笔记本上以约39 tok/s跑Qwen3.6-35B,在RTX 5090台式机上服务DeepSeek-V4-Flash(284B),并在单台工作站GPU上跑通GLM-5.2(753B)。
影响:FreeToken的发布标志着"数据中心级智能"在消费硬件上成为可能。Steam月活超2亿,其中约72%的系统配有英伟达独显——这是被严重低估的算力池;FreeToken把这部分"沉睡GPU"转化为可统一调度的弹性推理资源。开发者可在自有设备上零成本本地推理前沿模型,摆脱云API锁定与按token计费,对医疗、法律、国防、金融、IP密集型研发等数据敏感场景尤其重要——意味着"air-gapped或合规工作负载"也能跑动前沿模型。Hacker News与Reddit LocalLLaMA社区的反馈显示,"硬件主权"叙事正在获得共鸣:用二手RTX 3090/4080搭配标准DDR4/DDR5内存,就能本地部署前沿推理Agent,门槛被显著拉低。然而学界也有技术争论——q*闭式解是否准确反映真实CPU调度延迟、内存争用、并发Agent工作负载下的专家驻留变化,仍需进一步社区验证。
总结:FreeToken的核心价值不是单纯"加速推理",而是重新定义边缘AI范式——把个人电脑从"小型GPU"重新理解为"异构、弹性、统一调度的推理平台"。当开源模型权重与边缘推理引擎形成正循环,开源大模型与闭源API的可用性差距正在快速收敛;本地优先(local-first)的Agent工作流,有望在未来几年成为C端开发者与小型团队的主流选择。
参考来源:
1. https://www.infoq.com/news/2026/08/freetoken-local-inference/ (InfoQ:FreeToken Unlocks Frontier MoE Inference on Consumer Hardware via Dynamic Co-Execution)
2. https://arxiv.org/abs/2608.16157 (arXiv原论文:FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution)
3. https://github.com/FlashML-org/FreeToken (FreeToken GitHub仓库)
4. https://www.worldprogramming.org/posts/freetoken-unlocks-frontier-moe-inference-on-consumer-hardware-via-dynamic-co-execution-reh4zu (World Programming:FreeToken Unlocks Frontier MoE Inference on Consumer Hardware)
5. https://metaailabs.com/meet-freetoken-an-edge-native-moe-serving-engine-that-runs-753b-glm-5-2-on-a-single-workstation-gpu (Meta Ai Labs:Meet FreeToken - 753B GLM-5.2 on a Single Workstation GPU)
6. https://hyper.ai/en/papers/2608.16157 (HyperAI:FreeToken论文解读)
7. https://www.everydev.ai/tools/freetoken (EveryDev:FreeToken项目介绍)
8. https://gittrend.io/repo/FlashML-org/FreeToken (GitTrend:FreeToken项目数据)









