跳到正文
r/LocalLLaMA

双卡 Radeon PRO R9700 跑 Qwen 3.8 27B 解码冲到 111 tok/s,整机比一张 RTX 5090 还便宜一千多欧

2x R9700, 64 GB DDR5 is an absolute beast machine with vLLM Radiance / R9V and Qwen 3.8 27b and Flash next

一位玩家用两块 AMD Radeon AI PRO R9700(每张 32 GB 显存)攒了一台本地推理机。跑 Qwen 3.8 27B 的 MXFP4 量化版时,解码速度中位数达到 111.4 tok/s,最慢的 1% 请求也有 77.9 tok/s,生成第一个字的延迟是 81 毫秒。换成 FP8 精度会慢一些,解码降到 87.6 tok/s。作者还...

读原文 ↗导出 Markdown