# Claude API 提示预缓存：先预热系统提示，再让真实请求直接命中缓存，首 token 生成更快

> 原标题：API提示预缓存加速首令牌生成

- 来源：AI HOT 精选
- 发布时间：2026-05-14T23:35:36.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/20715
- 原文：https://x.com/ClaudeDevs/status/2055069548672631218

## 摘要

一个减少长提示首 token 延迟的实用技巧。在用户请求到达前，先单独发一次系统提示给 Claude，让它把提示写进缓存，但跳过输出。等真实请求进来时，缓存已经热好，直接命中，省掉重复处理长提示的时间。正文没披露具体提速多少，但思路很直接，适合系统提示固定、用户提示多变的场景。

## 推荐理由

Claude API 搞了个提示预缓存，相当于提前把系统提示塞进缓存里热着，真实请求一来就能省掉首令牌的等待。正文没给出具体能省多少毫秒，也没说缓存能热多久、会不会额外计费，所以省钱效果先打个折看。整体是个实用的推理优化小更新，不是模型能力或大版本发布，放在 featured 里当个中等权重的消息刚好。

## 锐评

这条推文讲了一个很实用的 Claude API 调用技巧：预热提示缓存。做法是在用户请求到达前，先单独发一次系统提示给 Claude，让它把提示写进缓存，但跳过输出。等真实请求进来时，缓存已经热好，直接命中，省掉重复处理长提示的时间。

这个思路适合系统提示固定、用户提示多变的场景，比如客服机器人或带固定人设的对话应用。但正文没披露具体能提速多少，也没说缓存能热多久、会不会被清掉。这些在实际落地时都是关键变量，得自己压测验证。

另外要注意，预热请求本身也消耗 token，虽然不生成输出，但系统提示的输入 token 还是要算钱的。如果请求量不大，这个预热成本可能比直接跑还高。建议先拿自己的典型 prompt 长度测一轮，看首 token 延迟降了多少，再决定要不要加这层逻辑。
