Qwen3.8-27B 的本地部署门槛又降了一截:PrismML 把它做成了真三值模型 Ternary Bonsai 2 27B——27B 参数只剩约 5.9GB(对照 FP16 的约 54GB,缩小约 9 倍),权重只有 -1、0、+1 三种取值、平均 1.72 bit/权重;按发布方口径保留约 98.2% 的综合性能,代码与数学能力损失较小,还支持 262K 上下文。
速度给了实测口:RTX 5090 约 120–143 tok/s,Apple M5 Max 约 47 tok/s;CUDA、Metal、CPU 全支持,llama.cpp 就能跑——27B 这个量级正式进了低显存设备与隐私场景的射程。
我的看法:这条真正改写的是"27B 该配什么硬件"的旧常识——过去要 54GB 显存,32G 卡都得靠量化折损硬塞;现在 6GB 出头,意味着 8GB 卡甚至纯 CPU 都能掂量一下。
三值化把"本地跑个像样的大模型"从极客操作变成了常规选项,对隐私敏感场景尤其友好。不过要说清:98.2% 是官方综合分——落到具体任务(尤其是长上下文和复杂推理)上还得自己跑一遍,尺寸的惊喜别替代能力的验证。
Hugging Face 集合:huggingface.co/collections/pr…
21 浏览 0 评论
0 反应













