我的天哪。重磅消息,Qwen3.8-27B 本地部署大模型再降配置。
PrismML 基于 Qwen3.8-27B 做成了真三值模型 Ternary Bonsai 2 27B,27B 参数只剩 5.9GB,性能还能保留约 98.2%。
核心亮点:
27B 模型压到约 5.9GB,相比 FP16 的约 54GB 缩小约 9 倍
权重只有 1、0、+1 三种值,平均 1.72 bit/weight
官方称可保留约 98.2% 的原模型综合性能,代码、数学能力损失较小
支持 262K 上下文
RTX 5090 生成速度约 120–143 tok/s,Apple M5 Max 约 47 tok/s
支持 CUDA、Metal、CPU,可通过 llama.cpp 本地运行
适合 本地 AI、隐私敏感场景、低显存设备
最后附上链接,有兴趣的冲哈huggingface.co/collections/pr…
话题来源 @aehyok
115.7K阅读 ❤️517 x.com/…↗ 已改写,非原文转载
15 浏览 0 评论
0 反应













