时间:2026年7月23日
地点:美国旧金山
人物:Hugging Face 团队与 Nunchaku 团队
事件详情:Hugging Face 近日在其官方博客宣布,将 Nunchaku 的 4 位扩散推理能力原生集成进旗下 Diffusers 库,让开发者无需单独编译 CUDA 内核即可直接调用预量化模型。Nunchaku 基于 ICLR 2025 焦点论文 SVDQuant 方法,在主 Transformer 层同时使用 4 位权重与 4 位激活(W4A4),既显著降低显存占用,又加速去噪循环。配合 HF 自研的 kernels 包,新版本通过 from_pretrained() 一行代码即可加载 Nunchaku Lite 量化检查点;同期开放的 diffuse-compressor 工具允许社区将任意架构自行量化为标准 Diffusers 仓库。
背景:当前主流的扩散 Transformer(如 Stable Diffusion 3、Flux、Qwen-Image 等)在 BF16 精度下推理往往需要 20–30 GB 显存,普通消费级 GPU 难以承载。已有的 bitsandbytes、GGUF、torchao、Quanto 等后端多为 weight-only 量化,能省内存但不一定提速,甚至可能带来额外延迟。SVDQuant 则用低秩分量吸收异常值,把权重与激活同时压到 4 位,对去噪循环更友好,让小显存设备也能跑出可接受的速度。Nunchaku 推理引擎一直是该方案的开源实现,但过去依赖独立的 Python 库,安装门槛较高。
影响:
- 消费级显卡可跑大模型——4 位推理让 20–30 GB 显存的扩散模型压缩到单卡消费级 GPU 上即可运行
- 速度提升显著——相比 weight-only 量化,SVDQuant 同时量化激活,推理速度可比 FP16 快数倍
- 生态接入门槛骤降——原生集成到 Diffusers 后不再需要本地编译 CUDA,pip 装好即可加载
- 量化民主化——diffuse-compressor 让社区可以自行量化任意模型并以标准仓库发布
总结:这是扩散模型量化生态的一次重要整合。Hugging Face 把学界 ICLR Spotlight 论文 SVDQuant 的推理引擎装进最主流的 Diffusers 库,并配合 Kernels 包和 diffuse-compressor 工具,把 4 位量化从研究者实验推到了开源社区生产线;开发者可以低成本地把消费级显卡变成扩散模型工作机,也意味着边缘端和中小团队的生成式 AI 应用门槛进一步下移。
参考来源:
- https://huggingface.co/blog/nunchaku-diffusers
- https://github.com/nunchaku-ai/nunchaku
- https://arxiv.org/abs/2411.05007
- https://github.com/huggingface/kernels
- https://github.com/rootonchair/diffuse-compressor









