时间: 2026 年 9 月 22 日
地点: 全球(Hugging Face 官方博客)
人物: Hugging Face Transformers 团队、GGML / llama.cpp 团队(Georgi Gerganov 等)
事件: Hugging Face 9 月 22 日发布 Transformers 新能力,原生支持 llama.cpp 的 GGUF 量化模型加载。开发者可直接通过 from_pretrained 接口配合 gguf_file 参数加载 GGUF 权重,无需额外转换脚本或独立推理引擎。Hugging Face 借助自研 kernels 库复用 ggml 内核,让 Transformers 在 Apple Silicon 上以接近 llama.cpp 原生速度运行量化模型,首批重点支持 Qwen3.5 架构。
背景: 今年 2 月,Hugging Face 已正式宣布收购 GGML.ai 团队,将 llama.cpp 与 GGUF 格式生态纳入麾下。Transformers 与 llama.cpp 长期作为两套并行生态:前者依托 PyTorch 主打训练与生产部署,后者凭借 GGUF 与 C++ 内核主导本地推理。本次集成被视为两套生态融合的首个落地产品,意在打通 Hugging Face 模型 Hub 与 llama.cpp 本地推理能力。
影响: 一是开发者无需在 Transformers 与 llama.cpp 之间二选一,from_pretrained 一行即可加载 GGUF 权重;二是 GGUF 模型在 Hugging Face Hub 已积累数百万次下载,整合后用户体验和性能进一步提升;三是 Ollama、LM Studio、Jan 等本地推理工具所依赖的生态能力进入 Transformers 体系,长期推动开源 LLM 部署走向统一 API。
总结: Transformers 兼容 GGUF 是 Hugging Face 收购 GGML 团队后的关键产品整合,让模型即代码的本地推理体验更接近开箱即用。对开源模型作者而言,只需上传一份 GGUF 权重即可同时被 Transformers 与 llama.cpp 生态消费。
参考来源:
1. https://huggingface.co/blog/transformers-llama-cpp-quants (Hugging Face 官方博客)
2. https://huggingface.co/docs/transformers/en/quantization/gguf (Transformers 官方文档)
3. https://huggingface.co/kernels/ggml-org/ggml-quantization (ggml-quantization 内核)
4. https://huggingface.co/blog/ggml-joins-hf (GGML 加入 Hugging Face 公告)
5. https://github.com/ggml-org/llama.cpp (llama.cpp 上游仓库)
6. https://github.com/ggml-org/llama.cpp/discussions/19759 (GGML 加入 Hugging Face 讨论)
7. https://imasters.com.br/inteligencia-artificial/transformers-passa-a-rodar-quantizados-gguf-do-llama-cpp-nativamente (iMasters 报道)
8. https://enclaveai.app/blog/2026/02/21/llama-cpp-joins-hugging-face-local-ai/ (Enclave AI 评论)







