跳到正文
r/LocalLLaMA

双 RTX Pro 本地跑 Qwen 和 DeepSeek,解码速度 150 tok/s

Upgraded my local setup with 2 rtx pros and it's amazing.

一位开发者用两块 RTX Pro 显卡组了台本地推理机,跑 Qwen 3.8 Flash Next 和 DeepSeek V4 Flash,解码速度达到 150 tok/s,预填充 10K tok/s,还能同时处理 4 个请求。他之前用 M3 Ultra 512GB,觉得推理太慢。新机器能跑 DeepSeek 的 1M 上下文窗口,但 Qwen 的思考...

读原文 ↗导出 Markdown