跳到正文
r/LocalLLaMA

32 块 AMD MI50 老卡跑 Kimi K2.6 模型,生成速度 9.7 token/秒

Final Monster: 32x AMD MI50 32GB at 9.7 t/s (TG) & 264 t/s (PP) with Kimi K2.6

Reddit 用户 ai-infos 用 32 块 AMD MI50 32GB 显卡(分两台机器,每台 16 卡,走 10G 网线)跑 Kimi K2.6 的 int4 量化版。处理 1.4 万多字的输入时,预处理速度能到 264 token/秒;生成 136 个字的回答时,速度掉到 9.7 token/秒。空载功耗 640W,跑推理时峰值 4,800...

推荐理由:这条帖子本身是个 Reddit 上的野路子基准测试,不是官方发布,所以分数不会给太高。但它的钩子很强——用 32 张二手 MI50 攒出一台能跑 Kimi K2.6 的机器,还给出了吞吐、功耗和网络拓扑的实测数据,对想低成本自建推理集群的人有直接参考价值。我会先打个折,因为正文没披露精度损失的具体对比、延迟抖动和长时间稳定性,这些对生产环境很关键。不过就凭它把 AMD 老卡 + vLLM 分布式栈的可行性摆上台面,加上功耗和 PCIe 带宽这两个真实痛点,74 分放在 featured 里是合理的。

读原文 ↗导出 Markdown