长提示词里,系统指令、工具定义和参考资料往往每轮都一样,却按全价再算一遍。Prompt Caching 把已经算过的前缀 KV 状态留下来,下一次请求只要前缀完全一致,就只为后面的新内容付费。OpenAI 文档里,GPT-5.6 及更新模型的缓存读取可按未缓存输入价的 0.1× 计费,写入按 1.25×;Anthropic 侧用
cache_control 标记断点,默认 5 分钟 TTL,读取同样是 0.1×。12命中靠的是精确前缀匹配:稳定内容放最前,动态问题、时间戳、用户私有字段放后面;在稳定段末尾设断点,或开启自动缓存。改工具 schema、重写早期消息、把时间戳插进前缀,都会让断点之后的命中断开。它和单次推理里的 KV Cache、把旧对话折成摘要的上下文压缩,作用层不同。34
最小实践:固定前缀 → 只追加后缀 → 设断点或自动缓存 → 用
cached_tokens / cache_read_input_tokens 核对命中。参考来源
- 1OpenAI:Prompt caching
developers.openai.com
- 2Anthropic:Prompt caching
platform.claude.com
- 3OpenAI Cookbook:Prompt Caching 201
developers.openai.com
- 4OpenAI:Prompt Caching in the API
openai.com


评论
登录后可发表评论。