> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Kontext und Token-Budgetierung

> So verteilst du Eingabe- und Ausgabetoken für Qualität, Geschwindigkeit und Kosten.

Die Token-Budgetierung ist eine zentrale Fähigkeit für den Produktionseinsatz. Sie wirkt sich direkt auf Latenz, Kosten und Zuverlässigkeit aus.

## Bestandteile des Token-Budgets

Der Gesamtumfang einer Anfrage umfasst in der Regel:

* System- und Entwickleranweisungen
* Nutzerprompt oder -eingabe
* Abgerufener Kontext (RAG, Dokumentation und Tools)
* Tool-Schemas oder Funktionsdefinitionen
* Ausgabetoken des Modells

## Warum Budgets wichtig sind

* Längere Prompts erhöhen Latenz und Kosten.
* Zu lange Prompts können die Relevanz beeinträchtigen, wenn der Kontext von geringer Qualität ist.
* Ein zu kleines Ausgabebudget kann Antworten abschneiden und ungültige strukturierte Ausgaben verursachen.

Reasoning kann das Ausgabebudget aufbrauchen, bevor ein Modell eine Antwort erzeugt. Diese
Antworten liefern HTTP 200 mit dem erzeugten Reasoning und ohne erfundene
Antwort. Chat Completions behält `reasoning_content` und `finish_reason: "length"`
bei Erreichen des Ausgabelimits. Responses behält das Reasoning-Ausgabeelement und
meldet `status: "incomplete"`. Ein normaler Anbieterabschluss bleibt `stop` oder `completed`.

## Strategie zur Budgetierung

1. Lege für jede Route ein maximales Eingabetoken-Ziel fest.
2. Plane einen Ausgabepuffer für die längsten erwarteten Antworten ein.
3. Entferne wenig hilfreichen Kontext konsequent.
4. Überwache die tatsächliche Verteilung des Token-Verbrauchs im Zeitverlauf.

## Praktische Schutzmaßnahmen

* Setze feste Obergrenzen für Ein- und Ausgabetoken.
* Ergänze Vorabregeln zum Kürzen oder Zusammenfassen umfangreicher Kontexte.
* Verwende routenspezifische Limits (Suchantworten oder umfangreiche Generierung).
* Prüfe Ausgaben auf Kürzungsmarker oder unvollständiges JSON.

## Häufige Fehler

* Dasselbe Tokenlimit für alle Endpunkte übernehmen.
* Ausführliche System-Prompts für jede Anfrageart beibehalten.
* Den zusätzlichen Tokenbedarf von Tool-Schemas ignorieren.

## Empfehlung

Behandle Token-Budgets als Konfiguration, die fortlaufend überwacht werden muss, nicht als einmalige Einrichtung.


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.