# RTX 5000 PRO 48GB 实跑测试：27B 模型跑到 80 tok/s，200k 上下文全精度缓存

> 原标题：The RTX 5000 PRO (48GB) arrived and it is better than I expected.

- 来源：r/LocalLLaMA
- 发布时间：2026-05-14T17:28:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/20653
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1td53ii/the_rtx_5000_pro_48gb_arrived_and_it_is_better/

## 摘要

一位完全没装过机的 Reddit 用户花了 5600 美元攒了一台 RTX 5000 PRO 48GB 的机器，单卡跑 Qwen3.6-27B-FP8 模型。他自己说装机全靠问 LLM，配 vLLM 时烧掉了 Claude Code 一半的周额度才搞定。实测下来，生成速度最高能到每秒 80 个 token，提示很长时掉到 50–60 tok/s，但提示...

## 推荐理由

这篇来自 Reddit 的个人装机实测，把价格和跑分都摆出来了，对想自己攒机跑大模型的人参考价值很高。我会先打个折：只有单卡、单模型、单人测试，没对比其他卡，也没提散热和长期稳定性，所以不能直接当采购指南。但 48GB 显存能跑 27B 模型还这么快，确实让人对本地推理的成本和体验更有信心。

## 锐评

这条帖子来自一个完全没装过机的 Reddit 用户，他花了 4300 美元买卡、总共 5600 美元攒了一台机器，单卡跑 Qwen3.6-27B-FP8 模型。他自己说装机、配 Linux 和 vLLM 全靠问 Claude Code，还烧掉了一半的周额度才搞定。

实测数据挺实在：生成速度最高 80 tok/s，提示很长时掉到 50–60 tok/s；提示处理速度 4400 tok/s，这个数字对单卡来说确实快。他用的是全精度缓存，能塞下 20 万 token 的上下文。他对比了 Mac Studio 和双 5090，认为这张卡在功耗、噪音和成本之间找到了一个平衡点——比 5090 贵 1000 美元，但显存多了一倍，功耗只有一半。

不过得打个折：这是单用户、单场景的体验，没跑其他模型，也没做并发或长时间稳定性测试。正文没披露温度、功耗墙和风扇策略这些细节，也没提推理延迟的百分位数分布。如果真想判断这张卡的生产力价值，还得看多用户并发、微调场景和连续运行几小时后的表现。
