Gemma 4 26B 在单张 RTX 5090 上跑到每秒 600 token
Gemma 4 26B Hits 600 Tok/s on One RTX 5090
chain-77 用 vLLM 0.19.2rc1 测了 Gemma 4 26B,开了 DFlash 投机解码后,单张 RTX 5090 的输出吞吐从每秒 228 token 跳到 578 token。测试条件是输入 256 token、输出 1024 token、并发数 1、投机 token 数设为 13。这个速度意味着本地跑 26B 模型已经可以做...
推荐理由:这条帖子本身是单次测试,没对比其他卡或并发场景,所以我会先打个折。但一张消费级显卡把 26B 模型输出速度翻了一倍多,这个提升幅度够实在,而且给了可复现的版本号和参数,对想在家跑大模型的人有参考价值。