一台 16GB 显卡跑通 Qwen 3.8 27B 模型,100k 上下文速度冲到 50 token/秒
Qwen 3.8 27B at 50 tok/s with 100k Context on a 16GB GPU! (beellama.cpp)
一位玩家在 RTX 4070 Ti SUPER(16GB 显存)上把 Qwen 3.8 27B 模型塞满了,生成速度跑到每秒 47-50 个 token,上下文窗口拉到 10 万 token。关键操作是用 beellama.cpp 引擎的非对称 KV 缓存压缩——K 缓存用 kvarn5、V 缓存用 kvarn4,省出约 6% 显存,把上下文从 8.8...
推荐理由:一条社区实战贴,参数和跑分都摆出来了,对 16GB 显卡用户有直接参考意义。没给更高分是因为 beellama.cpp 还是个偏小众的引擎,受众面不如 llama.cpp 广,而且这是个人分享的玩法,不是官方发布。