Skip to main content
如果请求会重复出现且提示词稳定,并且你希望降低延迟和重复推理成本,请使用本指南。

1. 从预设开始,而不是临时拼装请求

如果以下内容需要保持稳定,请创建预设:
  • 目标模型
  • 提供商偏好
  • temperature 和其他生成参数
  • 推理设置
  • 系统提示词
请求保持稳定,缓存键也会保持稳定。

2. 在预设级别启用响应缓存

配置:
  • response_caching.enabled = true
  • 合适的 ttl_seconds
推荐的默认值:
  • 对变化较快的事实类提示词使用较短 TTL
  • 对稳定的结构化输出使用较长 TTL

3. 保持请求具有确定性

避免不必要的请求变化,能让响应缓存发挥更大作用。 避免更改:
  • 系统提示词措辞
  • temperature
  • 提供商覆盖项
  • 推理配置
  • 工具列表
如果某个调用方经常更改这些设置,请为它单独使用另一个预设,避免影响其他请求复用缓存。

4. 在请求详情中检查缓存行为

经过缓存路径的请求应在详情中显示缓存信息。 请检查:
  • 缓存命中或未命中
  • TTL 行为
  • 返回缓存响应时的提供商上下文

5. 有意地将缓存与路由结合

推荐方式:
  1. 为确定性的结构化输出使用一个启用了缓存的预设。
  2. 为探索性请求或较高 temperature 的请求使用另一个禁用缓存的预设。
这样可以避免混合不兼容的流量,让缓存内容更有价值。

6. 扩大 TTL 前先排查未命中

如果预期会命中但仍然频繁未命中,请比较:
  • 提示词文本
  • 模型 ID
  • 提供商选项
  • 响应格式
  • 工具和工具选择
  • 预设 slug 与配置
延长 TTL 无法解决指纹不匹配。

7. 何时避免缓存

以下请求默认不要启用响应缓存:
  • 依赖实时外部状态的提示词
  • 上下文快速变化的用户专属回答
  • 工具输出易变的请求
  • 不适合精确重放的高度随机生成

相关内容

最后修改于 2026年10月2日