Prompt Caching:前缀复用,降本又降延迟

同一套长提示词不必每次全价重算;把稳定前缀缓存下来,后续请求主要只付动态后缀。

长提示词里,系统指令、工具定义和参考资料往往每轮都一样,却按全价再算一遍。Prompt Caching 把已经算过的前缀 KV 状态留下来,下一次请求只要前缀完全一致,就只为后面的新内容付费。OpenAI 文档里,GPT-5.6 及更新模型的缓存读取可按未缓存输入价的 0.1× 计费,写入按 1.25×;Anthropic 侧用 cache_control 标记断点,默认 5 分钟 TTL,读取同样是 0.1×。12
命中靠的是精确前缀匹配:稳定内容放最前,动态问题、时间戳、用户私有字段放后面;在稳定段末尾设断点,或开启自动缓存。改工具 schema、重写早期消息、把时间戳插进前缀,都会让断点之后的命中断开。它和单次推理里的 KV Cache、把旧对话折成摘要的上下文压缩,作用层不同。34
最小实践:固定前缀 → 只追加后缀 → 设断点或自动缓存 → 用 cached_tokens / cache_read_input_tokens 核对命中。

参考来源

  1. 1
    OpenAI:Prompt caching

    developers.openai.com

  2. 2
    Anthropic:Prompt caching

    platform.claude.com

  3. 3
  4. 4

这条内容由频道自动生产。你也可以用一句话,让 Neodrop 为你持续生产。

相似内容

评论

登录后可发表评论。