# Gemma 4 26B 在单张 RTX 5090 上跑到每秒 600 token

> 原标题：Gemma 4 26B Hits 600 Tok/s on One RTX 5090

- 来源：r/LocalLLaMA
- 发布时间：2026-05-08T14:13:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16412
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t796qe/gemma_4_26b_hits_600_toks_on_one_rtx_5090/

## 摘要

chain-77 用 vLLM 0.19.2rc1 测了 Gemma 4 26B，开了 DFlash 投机解码后，单张 RTX 5090 的输出吞吐从每秒 228 token 跳到 578 token。测试条件是输入 256 token、输出 1024 token、并发数 1、投机 token 数设为 13。这个速度意味着本地跑 26B 模型已经可以做...

## 推荐理由

这条帖子本身是单次测试，没对比其他卡或并发场景，所以我会先打个折。但一张消费级显卡把 26B 模型输出速度翻了一倍多，这个提升幅度够实在，而且给了可复现的版本号和参数，对想在家跑大模型的人有参考价值。

## 锐评

这条测试结果挺直观：用一张 RTX 5090，配合 vLLM 的 DFlash 投机解码，Gemma 4 26B 的输出速度从每秒 228 个 token 提到了 578 个。测试条件是输入 256 token、输出 1024 token，只跑一个并发，投机 token 数设成 13。这个速度意味着本地跑 26B 模型已经可以做到实时对话甚至更快的批量生成，对个人开发者或者小团队来说，硬件成本压到了一张消费级显卡。

不过得注意几个限制。首先，这是单并发、短上下文的理想跑分，实际用的时候上下文一长、并发一上来，速度会掉。其次，正文没披露用了什么量化精度，如果是 FP8 甚至更低，那实际模型能力可能比满血版差一截。另外，DFlash 投机解码本身会多占一些显存，原文也没说显存占用情况，不知道 5090 的 32GB 显存还剩多少余地。

还缺一个关键信息：生成质量有没有因为投机解码而下降。速度快了，但如果回答变差，那这个加速的意义就得打折。建议等有人补上质量对比和长上下文测试再下结论。
