Ziel
- Den günstigsten Anbieter für eine Anfrage bevorzugen.
- Für interaktive Abläufe den Anbieter mit der niedrigsten Latenz bevorzugen.
- Für die Massengenerierung den Anbieter mit dem höchsten Durchsatz bevorzugen.
1. provider.sort zur Anfrage hinzufügen
Lege bei Textanfragen die gewünschte Sortierung direkt im Objekt provider fest.
pricelatencythroughput
2. Die passende Sortierung für die Workload wählen
Verwende:price, wenn Kosten wichtiger als die Latenz am Verteilungsende sindlatencyfür Chat, Copilots und Tools mit menschlicher Beteiligungthroughputfür umfangreiche Generierung oder Backfills
3. Verstehen, was das Gateway vergleicht
Bei einer expliziten anfragebezogenen Sortierung ordnet das Gateway die Kandidaten deterministisch, statt die übliche ausgewogene, gewichtete Zufallsauswahl zu verwenden. Bei Textmodellen:pricevergleicht eine gemeinsame Preisgrundlage der geeigneten Anbieter- wenn gemeinsame Textzähler vorhanden sind, bevorzugt das Gateway übereinstimmende
input_text_tokensundoutput_text_tokens latencyverwendet die neuesten Latenzdaten der Anbieterthroughputverwendet die neuesten Durchsatzmessungen
4. Einen realistischen Anbieterkreis beibehalten
Die Sortierung funktioniert am besten, wenn du den Kandidatenkreis bei Bedarf zuvor eingrenzt. Sortiere beispielsweise nur innerhalb einer genehmigten Anbieterauswahl:5. Das Ranking-Ergebnis prüfen
Prüfe beim Debugging die Anfrage unter Gateway -> Nutzung auf folgende Angaben:- berücksichtigte Anbieter
- gerankte Anbieter
- die Routing-Bewertungsfaktoren für Preis, Latenz oder Durchsatz