在Mac上跑大模型,速度一直是最大的痛点。很多人试过各种方案,要么速度太慢,要么兼容性不好。今天介绍一个我见过最快的方案——Inco Splash。
官方在M5 Max MacBook Pro上测到最高144 tok/s的Decode速度。我自己也跑了一遍benchmark,基本复现了这个量级:Creative fiction:50.7 tok/s,Coding:130.3 tok/s,Boilerplate code:147.1 tok/s,近乎确定性的重复输出:165.7 tok/s。
不同任务的速度差别很大,但在Coding和Agent常见的输出模式下,130–160 tok/s确实可以跑出来。这个速度意味着什么?意味着你可以在本地流畅地运行一个27B参数的模型,不需要依赖云端API,也不用忍受漫长的等待。
Splash不是一套追求支持所有模型的通用引擎。它围绕具体的Qwen模型和Apple Silicon做了深度优化,包括定制的Metal kernels、8-bit KV cache,以及专门训练的speculative decoding draft model。这种针对性的优化,让它在特定场景下比通用方案快很多。
我已经把我本地的coding agent转到Inco Splash上了。以前用其他方案,跑一个稍微复杂点的代码生成任务,经常要等好几秒。现在基本上是实时响应,体验完全不一样。特别是对于需要频繁调用本地模型的agent工作流来说,这个速度提升是质的飞跃。
不过也有局限性,目前只支持Qwen系列模型,如果你想跑其他模型,还得找别的方案。但如果你主要用Qwen,而且是Apple Silicon的Mac,Inco Splash可能是目前最优的选择。
话题来源 @Michaelzsguo
❤️143 x.com/…↗ 已改写,非原文转载
24 浏览 0 评论
0 反应













