提示词缓存
当您在附加了 Space 的情况下进行聊天时,消息中有很大一部分——即取自该 Space 的背景上下文——在每一轮对话中都保持不变。**提示词缓存(Prompt Caching)**让 AI 提供商能够记住这部分重复内容,而不是每次都重新读取(并重新计费)。结果就是:更低的成本,通常也会带来更快的响应速度,而您得到的答案不会有任何变化。
Rephlo 会主动为 Anthropic(Claude) 启用提示词缓存——默认开启,并可配置缓存生命周期。本页说明缓存何时生效以及如何查看它带来的收益。
工作原理(通俗解释)
发送给 AI 的请求是分层构建的:一段稳定的指令、您 Space 中的背景上下文,然后是对话中的新内容。每轮重复出现的背景上下文正是被缓存的部分。
- 稳定前缀(指令 + Space 上下文)会从缓存中复用。
- 每一轮中只有新增内容会被重新处理。
- 对于重复出现的上下文,这可以大幅降低这些输入 token 的成本。
缓存何时生效
当以下两个条件同时满足时,缓存才会生效:
- 对话中附加了一个 Space。 Space 上下文正是构成一个庞大且可重复、值得缓存的前缀的关键。如果没有附加 Space,就没有稳定的内容块可供缓存,缓存也就无从谈起。
- 您使用的提供商支持缓存。 Rephlo 会为 Anthropic(Claude) 驱动缓存,使重复的上下文在后续轮次中从缓存中提供。其他一些云提供商会在其自身一侧自动缓存重复上下文——这是它们自身的行为,并非 Rephlo 所控制。本地设备模型在本地运行,不进行缓存,因此缓存在这类模型上根本不适用。
此外还有一个实际门槛:被缓存的上下文需要达到一定规模,提供商才会真正从缓存中提供服务。较小的 Space 可能达不到这一门槛,此时您几乎不会看到缓存带来的收益——这并无害处,只是没有节省效果而已。
Anthropic(Claude)相关细节
不同提供商的缓存方式各不相同。大多数云厂商会自动缓存重复的上下文。Anthropic(Claude)则略有不同——Rephlo 会为其驱动缓存,并在 Anthropic 提供商配置中为您提供两项设置:
| 设置项 | 作用 |
|---|---|
| Prompt caching enabled | 开启 Anthropic 缓存。默认开启。 |
| Cache lifetime(TTL) | 缓存在各轮之间存续的时长:ephemeral(约 5 分钟,默认值)或 extended(约 1 小时)。生命周期越长,写入缓存的成本会略高一些,但缓存保持有效的时间也更久。 |
默认的 ephemeral 缓存设置适合大多数对话场景,即您的后续消息会在几分钟内接连发送。如果您习惯离开一段时间后再返回聊天,extended 可以让缓存保持有效更久,使下一条消息仍能命中缓存。
您可以在 Anthropic 配置下的 Providers 页面找到这些选项。若想了解模型与提供商之间的关系,请参见 模型与推理。
查看节省效果
Rephlo 会记录每次响应中有多少输入 token 来自缓存,多少是重新处理的。启用详细缓存日志后(Anthropic 默认开启),这些信息会被记录下来,方便您确认缓存确实在发挥作用——在后续轮次中,缓存 token 占比较高就意味着缓存正按预期被复用。
节省效果来自提供商对缓存输入收取的费用低于全新输入,因此在具有稳定 Space 上下文的较长对话中,缓存带来的收益最为明显。
快速提示
- 为聊天附加一个 Space——这是触发缓存的前提条件。
- 保持 Space 上下文的稳定性,跨多轮对话不变。Rephlo 会替您处理好这一点,每轮只添加真正新增的内容,而不是重建整个内容块。
- 不必担心“冷”缓存。 第一轮会写入缓存;即使后续某一轮恰好未命中缓存,也不会有任何代价——只是按正常方式处理而已。
相关页面
- 模型与推理——提供商与模型如何协作。
- 数据模式与压缩——Space 上下文与 token 预算如何管理。
- Providers 设置——Anthropic 缓存选项所在位置。
- 聊天与对话——为聊天附加一个 Space。
- 积分与用量——用量是如何计算的。