跳到正文
热点事件历史事件

llama.cpp 合入 CPU 分块矩阵乘法,本地推理有望提速

1 篇报道1 个报道来源4 天前更新

先了解这件事

事实说明

llama.cpp 合并了一个 PR,给 CPU 推理加上了分块矩阵乘法(tiled mul_mat)。简单说就是把大矩阵切成小块算,让 CPU 缓存更友好、内存带宽压力更小——这对跑本地大模型是实打实的优化。不过正文被 Reddit 屏蔽了,没披露具体提速多少、内存省了多少。如果是真的,本地推理延迟应该能降一截。

报道时间线

沿着报道,了解事件的不同侧面。

9月26日
  1. r/LocalLLaMA
    llama.cpp 合入 CPU 分块矩阵乘法,本地推理有望提速

    llama.cpp 合并了一个 PR,给 CPU 推理加上了分块矩阵乘法(tiled mul_mat)。简单说就是把大矩阵切成小块算,让 CPU 缓存更友好、内存带宽压力更小——这对跑本地大模型是实打实的优化。不过正文被 Reddit 屏蔽了,没披露具体提速多少、内存省了多少。如果是真的,本地推理延迟应该能降一截。