Mit der Entscheidung beginnen
Wähle die Kennzahl, die zu der Nutzererfahrung passt, die du schützen möchtest.
Keine einzelne Punktzahl beweist, dass ein Modell für jede Workload die beste Wahl ist.
Preise vergleichen
Preislisten von Anbietern verwenden unterschiedliche Einheiten: pro Token, Million Tokens, Bild, Sekunde, Minute oder Anfrage. Phaseo behält die zugrunde liegende Einheit bei und normalisiert vergleichbare Preise für Katalogansichten und den Preisrechner. Vergleiche bei Textmodellen vorhandene Preise für Eingabe, Cache-Eingabe, Cache-Schreiben, Reasoning und Ausgabe getrennt. Bei Medienmodellen muss die native Abrechnungseinheit sichtbar bleiben; ein Videopreis pro Sekunde darf nicht wie ein Tokenpreis dargestellt werden.Katalogpreise dienen zur Schätzung einer Anfrage und sind kein Angebot für jede mögliche Nutzlast. Anbieterstufen, regionale Angebote, Batch-Preise, Cache-Verhalten und anfragespezifische Zähler können den Endbetrag verändern.
Leistungskennzahlen verstehen
Phaseo erfasst die Betriebszeiten von Anfragen, die über das Gateway geleitet werden.
TTFT, Ausgabegeschwindigkeit, TPOT und ITL setzen eine Streaming-Antwort mit einer ersten inhaltstragenden Ausgabe voraus. Reine Metadaten-Frames im Stream zählen nicht. Nicht gestreamte Antworten können weiterhin zur Anbieterdauer, Gateway E2E und zum effektiven Durchsatz beitragen, ohne einen TTFT zu erfinden.
Der Phaseo-Overhead erfasst die Zeit außerhalb des Aufrufs beim ausgewählten Anbieter. Er kann Gateway-Verarbeitung, Routing, Wiederholungsversuche und Netzwerkeinflüsse umfassen. Er ist keine feste Plattformkonstante und sollte als Verteilung über ein festgelegtes Zeitfenster betrachtet werden.
Operative Daten richtig lesen
Leistungsseiten fassen den aktuellen Gateway-Verkehr zusammen. Es handelt sich um Beobachtungsmessungen, nicht um kontrollierte Benchmark-Läufe oder intrinsische Eigenschaften eines Modells. Ergebnisse können sich aus folgenden Gründen verändern:- der Auswahl von Anbieter und Route
- dem Cloudflare-Ausführungsort und dem Netzwerkpfad
- Warteschlangen beim Anbieter oder regionalen Auslastung
- der Länge von Prompt und Ausgabe
- Streaming- oder Nicht-Streaming-Verhalten
- Wiederholungsversuchen, Abbrüchen und Tool-Aufrufen
- Aktualisierungen von Modell oder Anbieter im ausgewählten Zeitraum
Eine reproduzierbare Workload-Studie durchführen
Grenze die Kandidaten anhand öffentlicher Telemetrie ein und prüfe die Favoriten anschließend mit deinem eigenen Prompt-Mix.- Wähle zwei oder drei routbare Modelle aus der Standardantwort von
GET /v1/models. - Erstelle einen bereinigten Prompt-Satz mit kurzen, typischen und langen Anfragen.
- Lege Endpoint, Region, Streaming-Modus, Anbieterbeschränkungen und Parallelität fest.
- Sende mehrere Anfragen pro Prompt, statt dich auf eine einzelne Messung zu verlassen.
- Erfasse Request-ID, ausgewählten Anbieter, Erfolg oder Fehler, Ausgabetokens, Gateway TTFT, Anbieterdauer, Gateway E2E, Phaseo-Overhead und Kosten.
- Vergleiche Verteilungen und Fehlermuster und bewahre die Rohdaten zusammen mit der Testkonfiguration auf.
Was Phaseo nicht behauptet
- Ein Modelle im Katalog ist nicht automatisch routbar. Verwende den standardmäßigen Filter für aktive Verfügbarkeit.
- Öffentliche Betriebsdaten garantieren weder zukünftige Latenz noch Verfügbarkeit.
- Ein Benchmark-Ergebnis belegt nicht die Produktionsqualität für deinen Prompt-Mix.
- Ein beispielhaftes UI-Profil ist keine Live-Messung des Modells.
- Kundenreferenzen, Logos oder Workload-Ergebnisse dürfen nur mit Genehmigung und Belegen veröffentlicht werden.
Nächste Schritte
Zuverlässigkeit und Status prüfen
Prüfe Vorfälle, aktuelle Modell-Routbarkeit, Metrikdefinitionen und Fehleranalyse.
Modelle vergleichen
Vergleiche Preise, Metadaten und verfügbare Leistungssignale nebeneinander.
Modellrouten prüfen
Prüfe Anbieterrouten, Funktionen, Verfügbarkeitsstatus und Preise für ein Modell.
Benchmark-Methodik prüfen
Erfahre, wie Benchmark-Quellen und -Ergebnisse unabhängig von Gateway-Telemetrie normalisiert werden.