Skip to main content
Token 预算管理是生产环境中的核心技能,会直接影响延迟、开支和可靠性。

Token 预算构成

请求的总 Token 量通常包括:
  • 系统/开发者指令
  • 用户提示词/输入
  • 检索到的上下文(RAG、文档、工具)
  • 工具 Schema/函数定义
  • 模型输出 Token

预算为何重要

  • 提示词越长,延迟和成本越高。
  • 上下文质量较低时,过长的提示词可能降低相关性。
  • 输出预算过小可能导致响应被截断或结构化输出无效。
推理可能在模型生成答案之前耗尽输出预算。这些 响应返回 HTTP 200 和已生成的推理,不会编造 答案。达到输出上限时,Chat Completions 保留 reasoning_content 和 finish_reason: "length"。 Responses 保留推理输出项并 报告 status: "incomplete"。提供商正常停止时仍为 stop 或 completed。

预算策略

  1. 为每条路由设置最大输入 Token 目标。
  2. 为可能出现的最长响应预留输出空间。
  3. 大幅削减低价值上下文。
  4. 持续监控实际 Token 用量的分布变化。

实用防护措施

  • 对输入和输出 Token 设置硬性上限。
  • 为较长的上下文添加预处理截断或摘要规则。
  • 使用路由专属限额(例如搜索回答与长文本生成)。
  • 验证输出中是否存在截断标记或不完整 JSON。

常见错误

  • 在所有端点上使用同一 Token 限额。
  • 为所有请求类型保留冗长的系统提示词。
  • 忽略工具 Schema 的额外 Token 开销。

建议

应将 Token 预算视为需要持续监控的配置,而非一次性设置。
最后修改于 2026年10月2日