热点事件历史事件
Hugging Face 的 transformers 现在能直接加载 GGUF 量化模型了,本地跑的速度接近 llama.cpp
1 篇报道1 个报道来源8 天前更新
先了解这件事
事实说明
transformers 开始原生支持 GGUF 文件,你可以直接用 from_pretrained 加载一个 GGUF 模型,在本地跑起来。GGUF 是 llama.cpp 社区常用的模型压缩格式,能把模型体积压到适合笔记本内存的大小,代价是牺牲一点精度。这次更新背后复用了 llama.cpp 的 ggml 底层计算核心,优先在苹果芯片上做了优化,所...
报道时间线
沿着报道,了解事件的不同侧面。
9月22日
- AI HOT 精选精选Hugging Face 的 transformers 现在能直接加载 GGUF 量化模型了,本地跑的速度接近 llama.cpp
transformers 开始原生支持 GGUF 文件,你可以直接用 from_pretrained 加载一个 GGUF 模型,在本地跑起来。GGUF 是 llama.cpp 社区常用的模型压缩格式,能把模型体积压到适合笔记本内存的大小,代价是牺牲一点精度。这次更新背后复用了 llama.cpp 的 ggml 底层计算核心,优先在苹果芯片上做了优化,所...