Qwen 4 想跑在自己机器上,要的是更强的模型加可下载的权重。
现在的底子摆着。两档四比特的 Qwen3.8-27B 已经通过 llama.cpp 跑起来,两块 3090 上早就在拿 Qwen 做游戏、互动场景和别的实验。社区把 27B 压进大约十二 GB 显存(VRAM),靠的是激进量化和越来越精的推理手段。早期的 Qwen 4 演示一露头,能做什么和本地能跑什么之间的那道缝就更扎眼了。
本地真正的优势也不只是隐私,更不是省下 API 那笔钱,是实验的自由,这几条照录。可以让 agent 通宵写代码;同一个任务重试二十遍,不用惦记订阅限额;让模型烧几千 token 去修一个 bug;改运行时、量权重、换上下文长度、加工具,围着它搭自己的工作流,没人会因为你用完额度来敲门。
引帖那边还有半张实测的图。双台 DGX Spark 的配方跑出每秒一百三十八 token 的结构化输出、一百三十三的代码、八十一的散文,四路并发下结构化合计三百八十三。难的不是速度,是把 Hermes 驱顺,第一轮中文乱码加死循环,病根在服务栈,温度没传过去、思考字段对不上,补了三处映射才干净。另有一份四点一带来的解码提升四到六个点。
不是又一个跑分这半句是全场重心。前面一张 A 卡跑图那篇讲的是硬件下放,这条讲的是下放之后人要什么。跟前面开放权重那篇呼应,榜上的竞争之外,还有一群人在等权重下载键。跟前面自研那条链也接得上,能改运行时这一步,正是自己搭链子的入口。
我留的疑问有三处。二十七 B 在十二 GB 上的上下文能开多长没说;那套补丁进了主线没有没交代;Qwen 4 的权重到底放不放,得等它自己表态。
手上有旧卡的,拿那个两档四比特的配方跑一遍自己的活,看十二 GB 顶不顶得住你常写的那种上下文。
话题来源 @Oluwaphilemon1
1.4K阅读 ❤️9 x.com/…↗ 已改写,非原文转载
25 浏览 0 评论
0 反应











