开源推理引擎 Inco Splash 把本地推理又推了一档:在 M5 Max MacBook Pro 上,Qwen3.8-27B 跑到 144 token 每秒,引擎围绕 Apple silicon 和这个模型构建,官方口径是解码速度 3 倍于 Ollama、2 倍于 oMLX,agent 扇出子任务时接近 4 倍。
数字里最有意思的是最后那个"扇出 4 倍"。单轮对话只考一次解码,而 agent 会把任务拆给多个子 agent,变成并发多次解码——单次速度的差距在并发里会被放大。这说明他们瞄准的不是聊天机器人,而是"把本地模型当 agent 后端":144 token 每秒意味着多步任务的等待能压到可接受的区间,对代码、内部数据这些不能出网的场景,本地推理本来就只有这一条路。
不过三倍、两倍、四倍都是厂商自己给的对照口径,选的模型、量化方式、上下文长度一换,倍数就未必复现。真要选型,最省事的验证是拿同一个模型和量化,在同一台机器上跟 Ollama 各跑一轮,看自己的任务集上还剩多少倍。
inco.ai/blog/splash/
话题来源 @inco_ai
892.8K阅读 ❤️2416 x.com/…↗ 已改写,非原文转载
28 浏览 0 评论
0 反应












