Objectif
- limiter la taille du code Python appelant
- router à l’aide d’un slug de préréglage plutôt que d’un modèle codé en dur
- demander une sortie JSON stricte et structurée
- conserver suffisamment de métadonnées de réponse pour déboguer le routage ou le comportement des plugins
1. Commencer avec un client partagé
2. Placer les valeurs par défaut stables dans un préréglage
Créez un préréglage dans Tableau de bord -> Paramètres -> Préréglages si les valeurs suivantes doivent rester stables entre plusieurs appelants :- le prompt système
- le modèle ou la liste de modèles autorisés
- les préférences de fournisseur
- la configuration du raisonnement
- la température et les paramètres de génération associés
- la politique de mise en cache des réponses si la répétition déterministe est importante
3. Demander une forme JSON stricte
presetgarde le routage et les prompts par défaut hors du code de l’applicationresponse_formatrend le contrat explicitepluginspeut récupérer un JSON mal formé mais presque valide si le flux de travail le permetmetaconserve les détails de routage et d’exécution des plugins pour le débogage
4. Analyser le JSON et enregistrer les identifiants opérationnels
- la fenêtre des détails de la requête dans le tableau de bord
- les diagnostics de routage
- les métadonnées d’exécution des plugins
5. Déboguer avant d’ajouter des exceptions
Si le routage d’une requête diffère de vos attentes :- ouvrez la requête sous Gateway -> Utilisation
- consultez les diagnostics de routage et les fournisseurs candidats
- examinez les métadonnées d’exécution des plugins si la requête utilisait du JSON structuré
- ne modifiez le préréglage qu’après avoir compris ce qui s’est passé dans les journaux
6. Préserver la compatibilité du cache pour réutiliser les résultats
Si le préréglage active la mise en cache des réponses :- gardez le prompt stable
- gardez le schéma de réponse stable
- évitez les remplacements de fournisseur inutiles par requête
- évitez les listes d’outils qui changent souvent