1. 从预设开始,而不是临时拼装请求
如果以下内容需要保持稳定,请创建预设:- 目标模型
- 提供商偏好
- temperature 和其他生成参数
- 推理设置
- 系统提示词
2. 在预设级别启用响应缓存
配置:response_caching.enabled = true- 合适的
ttl_seconds
- 对变化较快的事实类提示词使用较短 TTL
- 对稳定的结构化输出使用较长 TTL
3. 保持请求具有确定性
避免不必要的请求变化,能让响应缓存发挥更大作用。 避免更改:- 系统提示词措辞
- temperature
- 提供商覆盖项
- 推理配置
- 工具列表
4. 在请求详情中检查缓存行为
经过缓存路径的请求应在详情中显示缓存信息。 请检查:- 缓存命中或未命中
- TTL 行为
- 返回缓存响应时的提供商上下文
5. 有意地将缓存与路由结合
推荐方式:- 为确定性的结构化输出使用一个启用了缓存的预设。
- 为探索性请求或较高 temperature 的请求使用另一个禁用缓存的预设。
6. 扩大 TTL 前先排查未命中
如果预期会命中但仍然频繁未命中,请比较:- 提示词文本
- 模型 ID
- 提供商选项
- 响应格式
- 工具和工具选择
- 预设 slug 与配置
7. 何时避免缓存
以下请求默认不要启用响应缓存:- 依赖实时外部状态的提示词
- 上下文快速变化的用户专属回答
- 工具输出易变的请求
- 不适合精确重放的高度随机生成