在Mac上跑大模型,速度一直是痛点。直到我试了Inco Splash,才发现原来本地推理可以这么快。
Inco Splash是专门为Qwen模型和Apple Silicon深度优化的推理引擎。官方在M5 Max MacBook Pro上测到最高144 tok/s的Decode速度。
我自己也跑了一遍benchmark,基本复现了这个量级:Creative fiction 50.7 tok/s,Coding 130.3 tok/s,Boilerplate code 147.1 tok/s,近乎确定性的重复输出165.7 tok/s。
我有个做AI开发的朋友,他之前用其他引擎跑Qwen模型,速度一直上不去。用了Inco Splash后,他说速度提升了不少,特别是在Coding和Agent场景下,130-160 tok/s确实可以跑出来。
Inco Splash不是一套追求支持所有模型的通用引擎。它围绕具体的Qwen模型和Apple Silicon做了深度优化,包括定制的Metal kernels、8-bit KV cache,以及专门训练的speculative decoding draft model。这种针对性优化确实带来了速度上的提升。
不同任务的速度差别很大,但在Coding和Agent常见的输出模式下,130-160 tok/s确实可以跑出来。这个速度对于本地开发来说够用了,不需要再依赖云端API。
我已经把本地的coding agent转到Inco Splash上了。如果你也在Mac上跑大模型,可以试试这个方案。特别是那些对速度有要求的场景,用这个方案确实能省不少时间。
18 浏览 0 评论
0 反应














