Bestandteile des Token-Budgets
Der Gesamtumfang einer Anfrage umfasst in der Regel:- System- und Entwickleranweisungen
- Nutzerprompt oder -eingabe
- Abgerufener Kontext (RAG, Dokumentation und Tools)
- Tool-Schemas oder Funktionsdefinitionen
- Ausgabetoken des Modells
Warum Budgets wichtig sind
- Längere Prompts erhöhen Latenz und Kosten.
- Zu lange Prompts können die Relevanz beeinträchtigen, wenn der Kontext von geringer Qualität ist.
- Ein zu kleines Ausgabebudget kann Antworten abschneiden und ungültige strukturierte Ausgaben verursachen.
reasoning_content und finish_reason: "length"
bei Erreichen des Ausgabelimits. Responses behält das Reasoning-Ausgabeelement und
meldet status: "incomplete". Ein normaler Anbieterabschluss bleibt stop oder completed.
Strategie zur Budgetierung
- Lege für jede Route ein maximales Eingabetoken-Ziel fest.
- Plane einen Ausgabepuffer für die längsten erwarteten Antworten ein.
- Entferne wenig hilfreichen Kontext konsequent.
- Überwache die tatsächliche Verteilung des Token-Verbrauchs im Zeitverlauf.
Praktische Schutzmaßnahmen
- Setze feste Obergrenzen für Ein- und Ausgabetoken.
- Ergänze Vorabregeln zum Kürzen oder Zusammenfassen umfangreicher Kontexte.
- Verwende routenspezifische Limits (Suchantworten oder umfangreiche Generierung).
- Prüfe Ausgaben auf Kürzungsmarker oder unvollständiges JSON.
Häufige Fehler
- Dasselbe Tokenlimit für alle Endpunkte übernehmen.
- Ausführliche System-Prompts für jede Anfrageart beibehalten.
- Den zusätzlichen Tokenbedarf von Tool-Schemas ignorieren.