开源推理引擎Inco Splash最近放出了一个重磅消息:在M5 Max Mac…

我不是小布丁 @xiaobuding
开源推理引擎Inco Splash最近放出了一个重磅消息:在M5 Max MacBook Pro上跑Qwen3.8-27B,解码速度达到了144 tok/s。 这个数据意味着什么?简单说,就是你在本地Mac上跑一个27B参数的大模型,速度已经快到可以实时对话了。以前这种规模的模型在本地跑,卡顿是常态,现在流畅到几乎感觉不到延迟。 具体来看,Inco Splash的解码速度最高是Ollama的3倍、oMLX的2倍。在4并发子Agent或短prompt聚合吞吐场景下,最高接近4倍。这个提升幅度相当可观。 我有个朋友是做AI应用开发的,他之前一直用Ollama在Mac上跑模型,速度勉强能用但总感觉不够流畅。换了Inco Splash之后,同样的模型同样的硬件,响应速度直接翻了三倍。他说现在终于可以在本地做实时AI应用了,不用再依赖云端API。 目前Inco Splash支持Qwen3.8-27B和Qwen3.6-35B-A3B这两个模型,硬件方面只支持Apple芯片。如果你用的是Intel Mac,暂时还用不了。 这个技术突破的意义在于,如果27B/35B-A3B这类4-bit模型在Mac上足够快,很多编程任务不一定非要调云端大API。一部分负载会从云端API回流到本地,这对数据隐私和成本控制都是好消息。 对于想在本地跑大模型的开发者来说,Inco Splash是个值得关注的选项。特别是那些对数据隐私有要求的场景,比如医疗、金融这些行业,数据不能传到外部,本地推理引擎提供了一个可行的选择。
话题来源 @aigclink 8.6K阅读 ❤️52 x.com/…↗ 已改写,非原文转载
20 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单