# Claude Code 构建经验：如何围绕提示词缓存设计智能体

> 原标题：Lessons from building Claude Code: Prompt caching is everything

- 来源：claude.dev 开发者博客
- 发布时间：2026-04-30T12:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/zqeiiu4vdyu9dlgahpwqad6m0
- 原文：https://claude.dev/blog/lessons-from-building-claude-code-prompt-caching-is-everything/

## 摘要

Claude Code 团队分享提示词缓存的工程经验，通过保持请求前缀稳定来降低长会话智能体的延迟与成本。具体做法包括静态内容前置、通过消息更新状态、避免会话中切换模型或增删工具，以及用 defer_loading 延迟加载工具。上下文压缩时复用原会话的系统提示词、工具定义和历史消息，再追加压缩请求以命中缓存；团队也监控缓存命中率，并将异常下降视为事故。

## 推荐理由

Claude Code 团队把缓存前缀稳定性落实到提示词排序、工具加载和上下文压缩，为长会话智能体提供可迁移的缓存优化方法。

## 锐评

100k token 时图便宜切到 Haiku 反而比继续用 Opus 更贵，这个账算得挺透。很多团队做 agent 喜欢按任务复杂度切大小模型，在 prompt caching 面前往往成了负优化。只要中途换模型，前面缓存的前缀全部失效，新模型必须重新吃一遍 100k 的输入 token，省下的那点钱当场倒贴回去。我觉得在长会话里把一个模型用到底，成本反而最低。
