Ziel
- den Python-Aufrufer schlank halten
- über einen Voreinstellungs-Slug statt über ein fest codiertes Modell routen
- eine streng strukturierte Ausgabe anfordern
- genügend Antwortmetadaten behalten, um Routing- oder Plugin-Verhalten zu untersuchen
1. Mit einem gemeinsam genutzten Client beginnen
2. Stabile Standardwerte in eine Voreinstellung verschieben
Erstelle unter Dashboard -> Einstellungen -> Voreinstellungen eine Voreinstellung, wenn diese Werte für mehrere Aufrufer stabil bleiben sollen:- der System-Prompt
- das Modell oder die Liste erlaubter Modelle
- Provider-Präferenzen
- Reasoning-Konfiguration
- Temperatur und weitere zugehörige Generierungsparameter
- Richtlinie für das Antwort-Caching, wenn deterministische Wiederholung wichtig ist
3. Eine strenge JSON-Form anfordern
presethält Routing- und Prompt-Standardwerte aus dem Anwendungscode herausresponse_formatmacht den Vertrag eindeutigpluginskann fast gültiges, fehlerhaftes JSON wiederherstellen, sofern der Workflow das zulässtmetaerhält Routing- und Plugin-Ausführungsdetails für die Untersuchung
4. JSON parsen und Betriebskennungen protokollieren
- dem Dialog mit den Anfragedetails im Dashboard
- den Routing-Diagnosen
- den Ausführungsmetadaten der Plugins
5. Erst untersuchen, dann überschreiben
Wenn eine Anfrage anders geroutet wird als erwartet:- öffne sie unter Gateway -> Nutzung
- prüfe Routing-Diagnosen und mögliche Provider
- prüfe bei strukturiertem JSON die Ausführungsmetadaten der Plugins
- ändere die Voreinstellung erst, wenn die Protokolle den tatsächlichen Ablauf zeigen
6. Caching-Kompatibilität für die Wiederverwendung erhalten
Wenn die Voreinstellung Antwort-Caching aktiviert:- formuliere den Prompt stets gleich
- behalte das Antwortschema bei
- vermeide unnötige Provider-Überschreibungen pro Anfrage
- vermeide häufig wechselnde Tool-Listen