# club-rdna16：一个在 16GB AMD 显卡上实测本地大模型的仓库

> 原标题：club-rdna16: practical 16GB AMD/Radeon local LLM testing repo

- 来源：r/LocalLLaMA
- 发布时间：2026-05-23T03:16:23.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25939
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tl4o1m/clubrdna16_practical_16gb_amdradeon_local_llm/

## 摘要

这个仓库用一张 RX 6900 XT（16GB 显存）跑 llama.cpp，后端是 ROCm/HIP，专门验证 AMD 卡在本地跑大模型的实际表现。目前放出的一个亮点是 Qwen3.6 35B-A3B 这个 MoE 模型，用 q8 格式缓存 KV 状态，能稳定撑到 131k 上下文窗口。正文没披露具体的推理速度、功耗和温度数据，所以性能上限和日常可用...

## 推荐理由

这是一条 Reddit 帖子，不是论文或官方报告。作者把测试仓库公开了，但正文只给了能跑起来的配置条件，没放推理速度、显存占用曲线或可复现的完整日志。我会先打个折：它证明了 16GB A 卡跑大上下文 MoE 模型可行，这点挺省钱，但别急着当生产参考，信息缺口还很大。HKR 三项都踩中了，作为一条给本地 LLM 玩家的实操线索，上 featured 没问题。

## 锐评

这个仓库用一张 16GB 显存的 RX 6900 XT 跑 llama.cpp，后端是 ROCm/HIP，专门验证 AMD 卡在本地跑大模型的实际表现。目前放出的一个亮点是 Qwen3.6 35B-A3B 这个 MoE 模型，用 q8 格式缓存 KV 状态，能稳定撑到 131k 上下文窗口。131k 意味着你可以一次性塞进一本中篇小说或大量代码文件，对本地长文本处理来说是个不错的信号。

但正文没披露推理速度、功耗和温度数据，所以性能上限和日常可用性还不好判断。AMD 卡跑大模型的老问题是生态兼容和优化不如 NVIDIA，这个仓库能跑通本身就有参考价值，但别把它当成性能标杆。另外，仓库只测了一张卡，多卡或不同型号的表现未知。

还缺什么：具体的 token 生成速度、首 token 延迟、内存占用峰值，以及不同量化格式下的对比。如果作者能补上这些，对想用 AMD 卡跑本地模型的人会更有说服力。
