跳到正文
AI HOT 精选

Hugging Face 的 transformers 现在能直接加载 GGUF 量化模型了,本地跑的速度接近 llama.cpp

transformers 支持直接加载 GGUF 量化模型,本地推理性能接近 llama.cpp

transformers 开始原生支持 GGUF 文件,你可以直接用 from_pretrained 加载一个 GGUF 模型,在本地跑起来。GGUF 是 llama.cpp 社区常用的模型压缩格式,能把模型体积压到适合笔记本内存的大小,代价是牺牲一点精度。这次更新背后复用了 llama.cpp 的 ggml 底层计算核心,优先在苹果芯片上做了优化,所...

推荐理由:HuggingFace 让 transformers 原生支持 GGUF,把最主流的量化格式和最大众的模型库接上了,本地推理门槛又低了一点。分数没往上拉,因为这是生态管道层面的改进,不是能力突破,而且性能只说“接近”没给具体数字,我会先打个折。

读原文 ↗导出 Markdown