
FreeToken:让大模型在消费级硬件上跑起来!
刚刚有人发现了一个很厉害的开源推理引擎FreeToken,它把整台机器(GPU+CPU+RAM)当作一个统一的推理平台,让大模型不再受限于显存大小。
核心亮点:
✅ 智能调度:只激活需要的专家(MoE),加上动态缓存和智能调度
✅ 硬件要求大幅降低:8GB笔记本可以跑35B模型,RTX 5080 16GB可以跑20GB模型达到~100 tok/s
✅ 性能惊人:RTX 5090可以跑284B模型,工作站可以跑753B模型
✅ 开源免费:Apache 2.0协议,支持Windows/Linux,有GUI和OpenAI兼容API
这意味着显存不够就跑不了的时代结束了。对于想要本地运行大模型但苦于硬件限制的开发者和研究者来说,这是一个非常有价值的工具。
github.com/FlashML-org/Fr…
话题来源 @UnTalNixon_exe
63K阅读 ❤️745 x.com/…↗ 已改写,非原文转载
29 浏览 0 评论
0 反应













