27B压到六GB:本地部署门槛又降一截

Qwen3.8-27B 的本地部署门槛又降了一截:PrismML 把它做成了真三值模型 Ternary Bonsai 2 27B——27B 参数只剩约 5.9GB(对照 FP16 的约 54GB,缩小约 9 倍),权重只有 -1、0、+1 三种取值、平均 1.72 bit/权重;按发布方口径保留约 98.2% 的综合性能,代码与数学能力损失较小,还支持 262K 上下文

速度给了实测口:RTX 5090 约 120–143 tok/s,Apple M5 Max 约 47 tok/sCUDA、Metal、CPU 全支持,llama.cpp 就能跑——27B 这个量级正式进了低显存设备与隐私场景的射程。

我的看法:这条真正改写的是"27B 该配什么硬件"的旧常识——过去要 54GB 显存,32G 卡都得靠量化折损硬塞;现在 6GB 出头,意味着 8GB 卡甚至纯 CPU 都能掂量一下。

三值化把"本地跑个像样的大模型"从极客操作变成了常规选项,对隐私敏感场景尤其友好。不过要说清:98.2% 是官方综合分——落到具体任务(尤其是长上下文和复杂推理)上还得自己跑一遍,尺寸的惊喜别替代能力的验证

Hugging Face 集合:huggingface.co/collections/pr…

话题来源 @aehyok 120.5K阅读 ❤️521 x.com/…↗ 已改写,非原文转载
19 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单