# 用 LiteRT 跑 Gemma 4 E4B，文字生成比 Q4 GGUF 快 2.4 倍，图片处理几乎没变

> 原标题：Using Gemma 4 E4B with the LiteRT engine - ~2.4x speedup over Q4 GGUF in text generation, image processing roughly the same

- 来源：r/LocalLLaMA
- 发布时间：2026-06-02T17:46:39.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/32885
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tuygn6/using_gemma_4_e4b_with_the_litert_engine_24x/

## 摘要

有人在 RTX 4060 Ti 16GB 上实测了 Gemma 4 E4B 模型。用 LiteRT 引擎跑文字生成，平均每秒能出 157.2 个 token，而用 llama.cpp 的 Q4 GGUF 格式只有 66.3 tok/s，快了大约 2.4 倍。不过图片标注任务就没这么乐观了：处理 111 张全分辨率图片，LiteRT 耗时约 72 秒，Q...

## 推荐理由

这是一篇个人在 Reddit 上发的实测，不是官方报告，权威性有限，所以分数没往上拉。但 H、K、R 三项都站得住：速度对比抓眼球，测试条件和数据都写清楚了，对想在自己机器上跑 Gemma 的人有直接参考价值。我会先打个折，因为只有单卡单次测试，没提功耗和精度变化，但作为一手体验已经够用。

## 锐评

这条实测对在本地跑小模型的人挺有用。作者用一张 RTX 4060 Ti 16GB 显卡，对比了 LiteRT 和 llama.cpp 的 Q4 GGUF 两种跑法。纯文字生成，LiteRT 跑到每秒 157.2 个 token，GGUF 只有 66.3，确实快了约 2.4 倍，延迟体感会好不少。但别急着全切过去——图片标注任务里，处理 111 张全分辨率图，LiteRT 耗时 72 秒，GGUF 约 80 秒，只快了 1.1 倍，基本算同一水平。

要注意的是，这只是一个用户的单卡单次测试，正文没披露 prompt 长度、batch size 和精度细节，也没说显存占用对比。LiteRT 这个优势在长文本或并发场景能不能稳住，还不好说。另外原帖被 Reddit 挡了，信息来自转载摘要，没法核对评论区有没有翻车反馈。想跟的话，先在自己常用任务上跑一遍再决定。
