Éléments du budget de jetons
La taille totale d’une requête comprend généralement :- Instructions système ou développeur
- Prompt ou entrée utilisateur
- Contexte récupéré (RAG, documentation et outils)
- Schémas d’outils ou définitions de fonctions
- Jetons générés par le modèle
Pourquoi les budgets sont importants
- Les prompts plus longs augmentent la latence et le coût.
- Des prompts trop longs peuvent réduire la pertinence lorsque le contexte est de mauvaise qualité.
- Un budget de sortie trop faible peut tronquer la réponse et produire des sorties structurées non valides.
reasoning_content et finish_reason: "length"
lorsque la limite de sortie est atteinte. Responses conserve l’élément de raisonnement et
indique status: "incomplete". Un arrêt normal du fournisseur reste stop ou completed.
Stratégie de budgétisation
- Définissez une cible maximale de jetons d’entrée pour chaque route.
- Réservez une marge de sortie pour les réponses les plus longues prévues.
- Supprimez sans hésiter le contexte de faible valeur.
- Surveillez l’évolution de la distribution réelle de l’utilisation des jetons.
Garde-fous pratiques
- Imposer des limites strictes aux jetons d’entrée et de sortie.
- Ajoutez des règles préalables de troncature ou de résumé des contextes volumineux.
- Utilisez des limites propres à chaque route (réponse de recherche ou génération longue).
- Vérifiez que les sorties ne contiennent pas de marqueurs de troncature ni de JSON partiel.
Erreurs fréquentes
- Copier la même limite de jetons sur tous les endpoints.
- Conserver de longs prompts système pour tous les types de requête.
- Ignorer le coût en jetons des schémas d’outils.