Token 预算构成
请求的总 Token 量通常包括:- 系统/开发者指令
- 用户提示词/输入
- 检索到的上下文(RAG、文档、工具)
- 工具 Schema/函数定义
- 模型输出 Token
预算为何重要
- 提示词越长,延迟和成本越高。
- 上下文质量较低时,过长的提示词可能降低相关性。
- 输出预算过小可能导致响应被截断或结构化输出无效。
reasoning_content 和 finish_reason: "length"。
Responses 保留推理输出项并
报告 status: "incomplete"。提供商正常停止时仍为 stop 或 completed。
预算策略
- 为每条路由设置最大输入 Token 目标。
- 为可能出现的最长响应预留输出空间。
- 大幅削减低价值上下文。
- 持续监控实际 Token 用量的分布变化。
实用防护措施
- 对输入和输出 Token 设置硬性上限。
- 为较长的上下文添加预处理截断或摘要规则。
- 使用路由专属限额(例如搜索回答与长文本生成)。
- 验证输出中是否存在截断标记或不完整 JSON。
常见错误
- 在所有端点上使用同一 Token 限额。
- 为所有请求类型保留冗长的系统提示词。
- 忽略工具 Schema 的额外 Token 开销。