# 把 prompt 缓存用到强化学习训练里：长提示短回复场景下，Qwen3.5-4B 训练速度提升 7.5 倍

> 原标题：prompt caching, but for rl training - 7.5x speedup on long-prompt/short-response workloads

- 来源：r/LocalLLaMA
- 发布时间：2026-05-11T21:01:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17665
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tage06/prompt_caching_but_for_rl_training_75x_speedup_on/

## 摘要

作者提出在强化学习训练时复用 prompt 缓存，专门针对那种提示很长、模型回复很短的任务。在 Qwen3.5-4B 上跑 16k token 提示、64 token 回复的例子，训练速度直接快了 7.5 倍。另一个 G=8 的例子更直观：1000 token 提示加 100 token 回复，原本要处理 8800 个 token，用这方法后实际只需处...

## 推荐理由

这是一篇 Reddit 帖子，作者把推理时常用的 prompt caching 思路搬到了 RL 训练里，在长提示短回答的场景下效果明显：Qwen3.5-4B 跑 16k 提示、64 输出 token 的任务，训练速度提了 7.5 倍。核心逻辑是 RL 训练时同一组 prompt 会被反复采样，把重复的 token 缓存起来不重复算，G=8 时实际要处理的 token 数从 8800 掉到 1800。这个数字说明去重效果确实好，但前提是 prompt 够长、回答够短，场景比较挑。正文没给代码或论文链接，也没有独立复现验证，所以分数先打个折，定在 78。

## 锐评

这条消息的核心卖点很直接：把推理时常用的 prompt 缓存思路搬到了强化学习训练里，专门吃那种提示巨长、模型只回几个字的场景。作者在 Qwen3.5-4B 上跑 16k token 提示配 64 token 回复，训练速度直接拉到 7.5 倍。另一个例子更直观，1000 token 提示加 100 token 回复，原本要处理 8800 个 token，用这方法后实际只处理 1800 个独立 token，省掉了大量重复计算。

但这里有个硬伤：Reddit 原文被网络屏蔽，我们拿到的只有摘要，看不到具体怎么实现缓存、对训练收敛有没有影响、是不是只对特定 RL 算法有效。7.5 倍这个数字是在单一模型和单一任务上测的，换别的模型或回复长度变长后还能剩多少加速，正文没披露。另外，缓存本身会吃显存，显存换时间的账怎么算也没提。

对做 RL 训练的人来说，这个方向值得跟，但先别急着改 pipeline。等原文解封或者作者放出代码和更完整的消融实验再说。
