跳到正文
热点事件历史事件

Hugging Face 的 transformers 现在能直接加载 GGUF 量化模型了,本地跑的速度接近 llama.cpp

1 篇报道1 个报道来源8 天前更新

先了解这件事

事实说明

transformers 开始原生支持 GGUF 文件,你可以直接用 from_pretrained 加载一个 GGUF 模型,在本地跑起来。GGUF 是 llama.cpp 社区常用的模型压缩格式,能把模型体积压到适合笔记本内存的大小,代价是牺牲一点精度。这次更新背后复用了 llama.cpp 的 ggml 底层计算核心,优先在苹果芯片上做了优化,所...

报道时间线

沿着报道,了解事件的不同侧面。

9月22日
  1. AI HOT 精选精选
    Hugging Face 的 transformers 现在能直接加载 GGUF 量化模型了,本地跑的速度接近 llama.cpp

    transformers 开始原生支持 GGUF 文件,你可以直接用 from_pretrained 加载一个 GGUF 模型,在本地跑起来。GGUF 是 llama.cpp 社区常用的模型压缩格式,能把模型体积压到适合笔记本内存的大小,代价是牺牲一点精度。这次更新背后复用了 llama.cpp 的 ggml 底层计算核心,优先在苹果芯片上做了优化,所...