# OpenAI API 自动缓存重复的提示词前缀，费用直接打五折

> 原标题：Prompt Caching in the API

- 来源：OpenAI News
- 发布时间：2024-10-01T10:03:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/700
- 原文：https://openai.com/index/api-prompt-caching

## 摘要

OpenAI 给 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 的 API 加上了自动提示词缓存。只要你的请求里有一段超过 1024 个 token 的前缀最近被用过，系统就会自动命中缓存，这部分输入 token 的价格直接减半。缓存从 1024 token 起步，按 128 token 的粒度往上加。不过这个缓存不是...

## 推荐理由

OpenAI 这次没发新模型，但给 API 加了自动提示缓存，复用前缀就能省一半输入费用。我会先打个折：缓存不是永久的，空闲 5-10 分钟就可能被清，最长活不过 1 小时，所以别把它当长期存储。真正有用的地方是 cached_tokens 这个返回字段，能直接看命中率，团队可以据此优化公共前缀设计。对跑长上下文、固定系统提示或大批量推理的团队，这是近期最直接的成本优化手段，值得马上测一下自己的复用率。

## 锐评

OpenAI 在 GPT-4o、o1 等模型 API 里上线了自动提示词缓存。如果你的请求前缀超过 1024 个 token 且最近被用过，这部分输入 token 价格直接减半。比如 GPT-4o 的输入从 $2.50/百万 token 降到 $1.25，o1-preview 从 $15 降到 $7.5，对频繁复用系统提示或长文档的场景确实能省一笔。

不过这个缓存不是持久化的。官方说通常 5-10 分钟没请求就清掉，最长也只保留一小时，而且缓存不跨组织共享。这意味着它更适合高频、连续的调用，而不是隔半天再回来用的那种。另外，缓存命中情况要看 API 返回里的 cached_tokens 字段，正文没提怎么主动控制缓存策略，看起来全由系统自动判定。

还缺两点：一是缓存命中率在实际业务里能到多少，没有基准数据；二是对 o1 这类推理模型，缓存的是思考过程还是最终输出，正文没说清楚。
