OpenAI GPT-5.6
使用本指南在生产环境中安全采用 GPT-5.6 系列。 GPT-5.6 是 OpenAI 当前面向复杂生产工作流的 GPT 系列。在 AI Stats 中,固定档位 ID 对应 OpenAI 模型 ID:gpt-5.6-sol、gpt-5.6-terra 和 gpt-5.6-luna。
迁移快速入门
- 选择与工作负载相匹配的固定模型 Sol、Terra 或 Luna。
- 只替换模型 ID,其余请求内容保持不变。
- 重新测试推理强度、结构化输出、工具、延迟和任务成本。
- 将新路由以金丝雀方式发布,同时保留之前的 GPT-5 模型作为回退。
选择模型
OpenAI 的
gpt-5.6 别名会路由到 gpt-5.6-sol。在 AI Stats 中,如果要使用 Sol 档位作为默认值,请使用 openai/gpt-5.6 或 openai/gpt-sol-latest;如需控制路由,则使用固定档位 ID。
AI Stats 还会跟踪每个档位最新模型的档位别名:openai/gpt-sol-latest、openai/gpt-terra-latest 和 openai/gpt-luna-latest。受控迁移请使用固定 GPT-5.6 ID;只有在你明确希望未来的 Sol、Terra 或 Luna 版本沿用同一路由时,才使用档位别名。
新增内容
- GPT-5.6 新增 Sol/Terra/Luna 档位划分,不再只有一个默认 GPT 路由。
- GPT-5.6 的三个档位均支持
reasoning.effort: "max",用于最高推理预算。 - GPT-5.6 支持
reasoning.mode: "pro",无需切换到单独的 Pro 模型标识。 - GPT-5.6 通过
reasoning.context增加了持久化推理控制。 - GPT-5.6 为符合条件且大量使用工具的工作流新增了多代理支持和 Programmatic Tool Calling(测试版)。
- 提示缓存分别计算未缓存输入、缓存读取、缓存写入和输出的费用。
- 显式提示缓存通过
prompt_cache_options支持;OpenAI 目前建议使用prompt_cache_options.ttl,而不是prompt_cache_retention。
更新请求
首先只替换模型 ID,其余请求内容保持不变。 前面的示例使用 Responses API 风格的input 结构。如果要迁移 Chat Completions 流量,请在路由支持的情况下继续使用 messages 和扁平的 reasoning_effort 字段。
max。
reasoning_effort:
查看价格
目录中的 GPT-5.6 价格按每百万令牌统计。
缓存读取与缓存写入分别计费。在当前目录中,缓存读取比未缓存输入便宜 90%,而缓存写入的价格是未缓存输入的 1.25 倍。
有意识地使用提示缓存
对于重复使用的上下文,将提示中的稳定部分放入可缓存块,并让请求专属文本不进入缓存。cache_control。如果需要直接传递 OpenAI 缓存模式和 TTL 选项,请使用 prompt_cache_options。
测试内容
推理和输出质量
- 按计划向用户开放的强度测试 Sol、Terra 和 Luna;质量优先的工作流可包括
max - 在质量比延迟更重要的复杂任务上,对比 standard 模式与
reasoning.mode: "pro" - 各强度下的结构化输出和 schema 通过率
- 工具调用选择和参数质量
成本和延迟
- 各推理强度下的延迟
- 相较当前生产基准的输出 token 增长
- 重复 prompt 的缓存读写比例
- 每项成功任务的成本,而不只是 token 单价
回滚
- 保留之前的 GPT-5.x 路由作为备用方案
- 在通过接近生产环境的 prompt 验证之前,将
max保留在配置标志或预设之后 - 分别监控缓存写入量和读取量
- 只有在自己的评测确认任务成功率、成本和延迟后,才将 GPT-5.6 加入默认路由