Skip to main content
Die Token-Budgetierung ist eine zentrale Fähigkeit für den Produktionseinsatz. Sie wirkt sich direkt auf Latenz, Kosten und Zuverlässigkeit aus.

Bestandteile des Token-Budgets

Der Gesamtumfang einer Anfrage umfasst in der Regel:
  • System- und Entwickleranweisungen
  • Nutzerprompt oder -eingabe
  • Abgerufener Kontext (RAG, Dokumentation und Tools)
  • Tool-Schemas oder Funktionsdefinitionen
  • Ausgabetoken des Modells

Warum Budgets wichtig sind

  • Längere Prompts erhöhen Latenz und Kosten.
  • Zu lange Prompts können die Relevanz beeinträchtigen, wenn der Kontext von geringer Qualität ist.
  • Ein zu kleines Ausgabebudget kann Antworten abschneiden und ungültige strukturierte Ausgaben verursachen.
Reasoning kann das Ausgabebudget aufbrauchen, bevor ein Modell eine Antwort erzeugt. Diese Antworten liefern HTTP 200 mit dem erzeugten Reasoning und ohne erfundene Antwort. Chat Completions behält reasoning_content und finish_reason: "length" bei Erreichen des Ausgabelimits. Responses behält das Reasoning-Ausgabeelement und meldet status: "incomplete". Ein normaler Anbieterabschluss bleibt stop oder completed.

Strategie zur Budgetierung

  1. Lege für jede Route ein maximales Eingabetoken-Ziel fest.
  2. Plane einen Ausgabepuffer für die längsten erwarteten Antworten ein.
  3. Entferne wenig hilfreichen Kontext konsequent.
  4. Überwache die tatsächliche Verteilung des Token-Verbrauchs im Zeitverlauf.

Praktische Schutzmaßnahmen

  • Setze feste Obergrenzen für Ein- und Ausgabetoken.
  • Ergänze Vorabregeln zum Kürzen oder Zusammenfassen umfangreicher Kontexte.
  • Verwende routenspezifische Limits (Suchantworten oder umfangreiche Generierung).
  • Prüfe Ausgaben auf Kürzungsmarker oder unvollständiges JSON.

Häufige Fehler

  • Dasselbe Tokenlimit für alle Endpunkte übernehmen.
  • Ausführliche System-Prompts für jede Anfrageart beibehalten.
  • Den zusätzlichen Tokenbedarf von Tool-Schemas ignorieren.

Empfehlung

Behandle Token-Budgets als Konfiguration, die fortlaufend überwacht werden muss, nicht als einmalige Einrichtung.
Zuletzt geändert am 2. Oktober 2026