# Hugging Face 的 transformers 现在能直接加载 GGUF 量化模型了，本地跑的速度接近 llama.cpp

> 原标题：transformers 支持直接加载 GGUF 量化模型，本地推理性能接近 llama.cpp

- 来源：AI HOT 精选
- 发布时间：2026-09-22T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58133
- 原文：https://huggingface.co/blog/transformers-llama-cpp-quants

## 摘要

transformers 开始原生支持 GGUF 文件，你可以直接用 from_pretrained 加载一个 GGUF 模型，在本地跑起来。GGUF 是 llama.cpp 社区常用的模型压缩格式，能把模型体积压到适合笔记本内存的大小，代价是牺牲一点精度。这次更新背后复用了 llama.cpp 的 ggml 底层计算核心，优先在苹果芯片上做了优化，所...

## 推荐理由

HuggingFace 让 transformers 原生支持 GGUF，把最主流的量化格式和最大众的模型库接上了，本地推理门槛又低了一点。分数没往上拉，因为这是生态管道层面的改进，不是能力突破，而且性能只说“接近”没给具体数字，我会先打个折。

## 锐评

这条更新对想在笔记本上跑大模型的人来说是个实在的好消息。以前你要用 GGUF 这种压缩格式（把模型体积压小，适合本地跑，代价是损失一点精度），基本得靠 llama.cpp 生态。现在 transformers 直接支持 `from_pretrained` 加载 GGUF 文件，底层复用了 llama.cpp 的 ggml 计算核心，优先在苹果芯片上做了优化。官方给的初步测试说推理速度接近原版 llama.cpp，这意味着你不用离开熟悉的 transformers 接口就能享受差不多的性能。

不过现在支持还很早期。正文明确说目前只支持 Qwen3.5 这一种模型架构，其他模型还得等。另外，虽然速度接近，但具体差多少、在非苹果设备上表现如何，文章没给详细数据。这点先别太激动，等更多模型适配和跨平台基准测试出来再看。
