> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 上下文与 Token 预算

> 如何分配输入和输出 Token，以兼顾质量、速度和成本。

Token 预算管理是生产环境中的核心技能，会直接影响延迟、开支和可靠性。

## Token 预算构成

请求的总 Token 量通常包括：

* 系统/开发者指令
* 用户提示词/输入
* 检索到的上下文（RAG、文档、工具）
* 工具 Schema/函数定义
* 模型输出 Token

## 预算为何重要

* 提示词越长，延迟和成本越高。
* 上下文质量较低时，过长的提示词可能降低相关性。
* 输出预算过小可能导致响应被截断或结构化输出无效。

推理可能在模型生成答案之前耗尽输出预算。这些
响应返回 HTTP 200 和已生成的推理，不会编造
答案。达到输出上限时，Chat Completions 保留 `reasoning_content` 和 `finish_reason: "length"`。
Responses 保留推理输出项并
报告 `status: "incomplete"`。提供商正常停止时仍为 `stop` 或 `completed`。

## 预算策略

1. 为每条路由设置最大输入 Token 目标。
2. 为可能出现的最长响应预留输出空间。
3. 大幅削减低价值上下文。
4. 持续监控实际 Token 用量的分布变化。

## 实用防护措施

* 对输入和输出 Token 设置硬性上限。
* 为较长的上下文添加预处理截断或摘要规则。
* 使用路由专属限额（例如搜索回答与长文本生成）。
* 验证输出中是否存在截断标记或不完整 JSON。

## 常见错误

* 在所有端点上使用同一 Token 限额。
* 为所有请求类型保留冗长的系统提示词。
* 忽略工具 Schema 的额外 Token 开销。

## 建议

应将 Token 预算视为需要持续监控的配置，而非一次性设置。


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.