昨天看到一个开源推理引擎Inco Splash的数据,直接惊到了。在M5 Max…

昨天看到一个开源推理引擎Inco Splash的数据,直接惊到了。在M5 Max MacBook Pro上跑Qwen3.8-27B,解码速度达到144 tok/s,是Ollama的3倍、oMLX的2倍。 这个速度意味着什么?以前在Mac上跑27B模型,基本只能用来做简单问答,稍微复杂点的任务就得等半天。现在144 tok/s的速度,已经接近云端API的体验了。 更让我兴奋的是它的并发性能。在4个子Agent同时跑短prompt的场景下,吞吐量最高接近Ollama的4倍。这意味着如果你在本地跑多个Agent协作,Inco Splash能提供更好的性能支撑。 目前支持的模型包括Qwen3.8-27B和Qwen3.6-35B-A3B,都是4-bit量化版本。对于Apple芯片的MacBook来说,这个性能表现确实很亮眼。 我实际测试了一下,用M5 Max跑Qwen3.8-27B写一段Python代码,从输入到输出完成大概3秒,速度确实很快。以前用Ollama跑同样的任务,至少要等10秒以上。 如果27B/35B-A3B这类4-bit模型在Mac上足够快,很多编程任务确实不一定非要调云端大API了。一部分负载会从云端回流到本地,这对隐私保护和成本控制都是好事。
话题来源 @aigclink ❤️52 x.com/…↗ 已改写,非原文转载
18 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单