在Mac上本地跑大模型,速度一直是最大的痛点。很多方案要么支持的模型有限,要么速度慢到没法用。最近发现一个叫Inco Splash的方案,专门针对Qwen模型和Apple Silicon做了优化,实测速度确实惊人。
官方在M5 Max MacBook Pro上测到最高144 tok/s的Decode速度。我自己也跑了一遍benchmark,基本复现了这个量级:Creative fiction任务50.7 tok/s,Coding任务130.3 tok/s,Boilerplate code任务147.1 tok/s,近乎确定性的重复输出能达到165.7 tok/s。
不同任务的速度差别很大,但在Coding和Agent常见的输出模式下,130-160 tok/s确实可以跑出来。这个速度已经接近实时交互的体验了,不用再等半天才能看到回复。
Splash不是一套追求支持所有模型的通用引擎。它围绕具体的Qwen模型和Apple Silicon做了深度优化,包括定制的Metal kernels、8-bit KV cache,以及专门训练的speculative decoding draft model。这种针对性的优化策略,比通用方案的效率高很多。
我之前用Ollama跑Qwen3.8-27B,速度大概在30-40 tok/s,虽然也能用,但写代码的时候经常要等。换成Splash之后,coding场景直接提到130 tok/s,写函数的时候基本感觉不到延迟。现在我已经把本地的coding agent转到Inco Splash上了。
对于用Mac做AI开发的人来说,这个方案值得试试。特别是如果你主要用Qwen系列模型,针对性的优化确实能带来质的飞跃。不过要注意,它目前只支持Qwen模型,如果你用的是其他模型,可能还得找别的方案。
话题来源 @Michaelzsguo
11.4K阅读 ❤️73 x.com/…↗ 已改写,非原文转载
21 浏览 0 评论
0 反应













