> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# コンテキストとトークン予算

> 品質、速度、コストを考慮して入力と出力のトークンを配分する方法。

トークン予算の管理は、本番運用に欠かせないスキルです。レイテンシ、コスト、信頼性に直接影響します。

## トークン予算の内訳

リクエスト全体のトークン量には、通常次の要素が含まれます。

* システム／開発者の指示
* ユーザーのプロンプト／入力
* 取得したコンテキスト（RAG、ドキュメント、ツール）
* ツールスキーマ／関数定義
* モデルの出力トークン

## 予算が重要な理由

* プロンプトが長いほど、レイテンシとコストが増加します。
* コンテキストの品質が低い場合、プロンプトが長すぎると回答の関連性が下がることがあります。
* 出力予算が小さすぎると、回答が途中で切れたり、構造化出力が無効になったりします。

モデルが回答を生成する前に、推論が出力予算を使い切る場合があります。この場合、
生成された推論を含むHTTP 200の応答が返され、回答は
捏造されません。Chat Completionsでは、出力上限に達すると`reasoning_content`と`finish_reason: "length"`
が保持されます。Responsesでは推論の出力項目が保持され、
`status: "incomplete"`が報告されます。通常のプロバイダー終了は`stop`または`completed`のままです。

## 予算の立て方

1. ルートごとに入力トークンの上限目標を設定します。
2. 想定される最長の回答に備えて、出力用の余裕を確保します。
3. 価値の低いコンテキストを積極的に削減します。
4. 実際のトークン使用量の分布を継続的に監視します。

## 実用的なガードレール

* 入力と出力のトークンに厳格な上限を設定します。
* 大きなコンテキストを事前に切り詰める、または要約するルールを追加します。
* ルートごとに上限を使い分けます（検索回答と長文生成など）。
* 出力に切り詰めマーカーや不完全なJSONがないことを検証します。

## よくある間違い

* すべてのエンドポイントに同じトークン上限を設定する。
* すべての種類のリクエストに冗長なシステムプロンプトを使う。
* ツールスキーマに必要な追加トークンを無視する。

## 推奨事項

トークン予算は一度設定して終わりではなく、継続的に監視する設定として扱います。


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.