Prompt caching
定义
Prompt caching 是一种发生在推理服务侧的工程复用机制:当用户在短时间内反复提交相同或高度重复的上下文时,系统可以缓存并复用这部分 prompt 内容,从而以更低成本、更稳定的方式继续处理后续请求。
它首先是一种工程层缓存,不是模型的人格记忆、长期记忆,也不是用户画像记忆。它不表示模型从此“记住了你是谁”、记住了你的课程、项目、偏好和人生背景;也不表示未来任何一次对话都可以无条件省略必要资料。
来源文章给出的直观类比是:**你刚刚把一份常用资料放在桌上,接下来一段时间继续用它,系统可以更便宜、更稳定地复用这部分重复内容。**这里的重点是“刚刚放上去”“接下来一段时间”“复用重复内容”,而不是形成长期、跨场景、永久有效的记忆。
在本文档中的语境
这篇文章讨论 GPT-5.6 发布时,并没有把重点放在“模型又强了多少”,而是借官方同时公开的 token 价格与缓存机制,提醒普通用户一个更基础的事实:AI 每次工作,都要先读取你提供的上下文。
因此,Prompt caching 在本文中的作用,不是被当作一个底层 API 小知识,而是被用来说明 上下文预算 的现实含义:
- 你反复粘贴同一段背景,系统并不是“天然不用再读”;
- 如果系统能缓存,它只是对短时间内重复出现的内容做工程复用;
- 用户仍然需要承担上下文管理责任,整理好哪些资料要放上“桌面”、哪些要删、哪些要压缩、哪些必须保留原文。
文章之所以特别强调这一点,是因为普通用户很容易把 caching 误解成“模型终于记住我了”。一旦这样理解,就会错误地放松对上下文的管理,误以为之后不再需要持续提供必要背景,最终导致任务方向漂移、资料缺失或误解增加。
关键机制
在本文引用的官方表述中,Prompt caching 被描述为更可预测的缓存能力,涉及几个明确的工程细节:
- explicit cache breakpoints:显式缓存断点,用于更明确地界定哪些 prompt 段落或结构边界适合作为缓存复用单位;
- 30-minute minimum cache life:缓存至少保留 30 分钟;
- cache writes billed at 1.25x uncached input rate:把内容写入缓存时,计费按未缓存输入价格的 1.25 倍计算;
- cached-input reads 继续享受 90% discount:后续读取已缓存输入时,仍可享受 90% 折扣。
这些细节说明它不是模糊的“系统也许记得一些东西”,而是有明确寿命、明确写入与读取成本、明确边界控制方式的工程能力。
从机制上看,它处理的是重复 prompt 内容的短期复用问题,而不是“模型参数被再次训练”或“系统建立持久用户档案”问题。缓存命中的价值主要体现在:
- 减少重复上下文被反复处理的成本;
- 让连续一段时间内的同背景任务更高效;
- 让重复内容的处理更稳定、更可预测。
与重复粘贴背景的关系
Prompt caching 和“反复粘贴同一段背景资料”高度相关,但二者不能画等号。
一方面,如果用户在短时间内持续使用同一批背景材料,缓存确实可能降低这类重复输入的处理成本,并减少系统每次都重新处理相同内容的代价。这也是文章用“常用资料放在桌上”来比喻它的原因。
另一方面,这并不意味着用户以后可以完全停止提供背景。原因至少有三层:
- 缓存有时间边界,文中明确提到至少 30 分钟缓存生命周期,而不是永久有效;
- 缓存复用的是重复内容,不是自动补全你没给出的新条件;
- 不同任务、不同场景、不同输出目标下,仍然需要用户重新明确当前有效的资料、限制、读者、标准与禁止事项。
因此,缓存只能缓解“短时间重复提交相同上下文”的成本问题,不能替代用户持续提供必要资料,更不能取代 AI 上下文资料包 这类结构化上下文管理方式。
细节与边界
1. 不是长期记忆
这是本文最重要的边界。Prompt caching 不是模型长期记忆,不代表系统从此记住用户的性格、课程、职业经历或长期偏好。把缓存理解成“AI 终于认识我了”,属于典型误读。
2. 不是永久免粘贴背景
即使缓存存在,用户也不能据此推断:以后永远无需再提供项目背景、论文要求、岗位 JD、资料来源、禁止事项或输出标准。只要任务目标变了、时间过了、上下文断了,必要资料仍然要重新放回当前上下文中。
3. 主要解决短时间重复复用
它最适合的,是连续一段时间内围绕同一套材料进行多轮工作,例如围绕同一论文草稿反复修改、围绕同一岗位背景持续打磨面试材料、围绕同一项目说明连续生成不同版本文案。此时重复部分可被更便宜、更稳定地复用。
4. 成本结构不是“免费记住”
官方细节已经说明缓存并非零成本:写入缓存按未缓存输入价的 1.25 倍计费,而读取缓存输入则继续享受 90% 折扣。这意味着它是围绕成本优化设计的工程折中,而不是一种无代价的万能记忆。
5. 需要与上下文管理一起理解
文章强调,不要只把注意力放在“神级 Prompt”或模型参数升级上。强模型越能处理复杂任务,越依赖清楚、稳定、少冲突的上下文。Prompt caching 只能优化其中“重复内容如何复用”这一层,不能替代用户对 上下文预算 的判断:
- 哪些资料今天必须保留;
- 哪些只是干扰;
- 哪些可以压缩;
- 哪些必须保留原文。
为什么容易被误解
对普通用户来说,缓存这个词很容易触发一种直觉:既然系统缓存了,那就等于它记住了我。但在 LLM 使用场景里,这两件事差别很大。
“记住我了”暗示的是一种稳定、长期、跨任务可调用的人设或背景记忆;而 Prompt caching 说的是短期、工程化、针对重复输入片段的复用优化。前者容易让用户误以为上下文责任已经转交给系统,后者则恰恰提醒用户:你仍然要决定这次把什么摆上桌。
这也是本文把它与 上下文预算、AI 上下文资料包 放在一起讨论的原因:缓存不是在取消上下文管理,而是在告诉你,上下文本身是有成本结构、有效期和组织要求的。