Skip to main content
Nutze dieses Rezept, wenn das Modell gleich bleibt, das Gateway die Anbieterangebote für eine Anfrage aber anders sortieren soll.

Ziel

  • Den günstigsten Anbieter für eine Anfrage bevorzugen.
  • Für interaktive Abläufe den Anbieter mit der niedrigsten Latenz bevorzugen.
  • Für die Massengenerierung den Anbieter mit dem höchsten Durchsatz bevorzugen.

1. provider.sort zur Anfrage hinzufügen

Lege bei Textanfragen die gewünschte Sortierung direkt im Objekt provider fest.
Für diesen Ablauf werden folgende Routing-Sortierungen unterstützt:
  • price
  • latency
  • throughput

2. Die passende Sortierung für die Workload wählen

Verwende:
  • price, wenn Kosten wichtiger als die Latenz am Verteilungsende sind
  • latency für Chat, Copilots und Tools mit menschlicher Beteiligung
  • throughput für umfangreiche Generierung oder Backfills

3. Verstehen, was das Gateway vergleicht

Bei einer expliziten anfragebezogenen Sortierung ordnet das Gateway die Kandidaten deterministisch, statt die übliche ausgewogene, gewichtete Zufallsauswahl zu verwenden. Bei Textmodellen:
  • price vergleicht eine gemeinsame Preisgrundlage der geeigneten Anbieter
  • wenn gemeinsame Textzähler vorhanden sind, bevorzugt das Gateway übereinstimmende input_text_tokens und output_text_tokens
  • latency verwendet die neuesten Latenzdaten der Anbieter
  • throughput verwendet die neuesten Durchsatzmessungen

4. Einen realistischen Anbieterkreis beibehalten

Die Sortierung funktioniert am besten, wenn du den Kandidatenkreis bei Bedarf zuvor eingrenzt. Sortiere beispielsweise nur innerhalb einer genehmigten Anbieterauswahl:

5. Das Ranking-Ergebnis prüfen

Prüfe beim Debugging die Anfrage unter Gateway -> Nutzung auf folgende Angaben:
  • berücksichtigte Anbieter
  • gerankte Anbieter
  • die Routing-Bewertungsfaktoren für Preis, Latenz oder Durchsatz
So kannst du leicht prüfen, ob das Gateway wie erwartet sortiert hat.

Verwandte Leitfäden

Zuletzt geändert am 2. Oktober 2026