# llama.cpp 合入 CPU 分块矩阵乘法，本地推理有望提速

> 原标题：ggml-cpu: tiled mul_mat for k-quants by jbooth · Pull Request #27851 · ggml-org/llama.cpp

- 来源：r/LocalLLaMA
- 发布时间：2026-09-26T06:18:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/59084
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1wqj4zg/ggmlcpu_tiled_mul_mat_for_kquants_by_jbooth_pull/

## 摘要

llama.cpp 合并了一个 PR，给 CPU 推理加上了分块矩阵乘法（tiled mul_mat）。简单说就是把大矩阵切成小块算，让 CPU 缓存更友好、内存带宽压力更小——这对跑本地大模型是实打实的优化。不过正文被 Reddit 屏蔽了，没披露具体提速多少、内存省了多少。如果是真的，本地推理延迟应该能降一截。
