Skip to main content
Nutze diesen Leitfaden, um Kosten und Geschwindigkeit über Routen hinweg zu vergleichen, die von Phaseo angezeigten Kennzahlen zu verstehen und eine Workload-Studie zu planen, bevor du Produktionsverkehr umstellst.

Mit der Entscheidung beginnen

Wähle die Kennzahl, die zu der Nutzererfahrung passt, die du schützen möchtest. Keine einzelne Punktzahl beweist, dass ein Modell für jede Workload die beste Wahl ist.

Preise vergleichen

Preislisten von Anbietern verwenden unterschiedliche Einheiten: pro Token, Million Tokens, Bild, Sekunde, Minute oder Anfrage. Phaseo behält die zugrunde liegende Einheit bei und normalisiert vergleichbare Preise für Katalogansichten und den Preisrechner. Vergleiche bei Textmodellen vorhandene Preise für Eingabe, Cache-Eingabe, Cache-Schreiben, Reasoning und Ausgabe getrennt. Bei Medienmodellen muss die native Abrechnungseinheit sichtbar bleiben; ein Videopreis pro Sekunde darf nicht wie ein Tokenpreis dargestellt werden.
Katalogpreise dienen zur Schätzung einer Anfrage und sind kein Angebot für jede mögliche Nutzlast. Anbieterstufen, regionale Angebote, Batch-Preise, Cache-Verhalten und anfragespezifische Zähler können den Endbetrag verändern.
Nutze den Preisrechner mit einer repräsentativen Nutzlast und prüfe nach einer Testanfrage den abgerechneten Betrag in der Gateway-Nutzung.

Leistungskennzahlen verstehen

Phaseo erfasst die Betriebszeiten von Anfragen, die über das Gateway geleitet werden. TTFT, Ausgabegeschwindigkeit, TPOT und ITL setzen eine Streaming-Antwort mit einer ersten inhaltstragenden Ausgabe voraus. Reine Metadaten-Frames im Stream zählen nicht. Nicht gestreamte Antworten können weiterhin zur Anbieterdauer, Gateway E2E und zum effektiven Durchsatz beitragen, ohne einen TTFT zu erfinden. Der Phaseo-Overhead erfasst die Zeit außerhalb des Aufrufs beim ausgewählten Anbieter. Er kann Gateway-Verarbeitung, Routing, Wiederholungsversuche und Netzwerkeinflüsse umfassen. Er ist keine feste Plattformkonstante und sollte als Verteilung über ein festgelegtes Zeitfenster betrachtet werden.

Operative Daten richtig lesen

Leistungsseiten fassen den aktuellen Gateway-Verkehr zusammen. Es handelt sich um Beobachtungsmessungen, nicht um kontrollierte Benchmark-Läufe oder intrinsische Eigenschaften eines Modells. Ergebnisse können sich aus folgenden Gründen verändern:
  • der Auswahl von Anbieter und Route
  • dem Cloudflare-Ausführungsort und dem Netzwerkpfad
  • Warteschlangen beim Anbieter oder regionalen Auslastung
  • der Länge von Prompt und Ausgabe
  • Streaming- oder Nicht-Streaming-Verhalten
  • Wiederholungsversuchen, Abbrüchen und Tool-Aufrufen
  • Aktualisierungen von Modell oder Anbieter im ausgewählten Zeitraum
Öffentliche Diagramme können Perzentile wie P50, P90, P95 und P99 zeigen. Bei der Latenz gilt: Je niedriger, desto besser. Beim Durchsatz gilt: höher ist besser. Ein niedrigeres Durchsatz-Perzentil beschreibt daher den langsamen Randbereich. Notiere neben dem Ergebnis immer den ausgewählten Zeitraum, die Route, die Region, die Stichprobenfilter und das Perzentil. Vergleiche keine Screenshots mit unterschiedlichen Zeiträumen, als wären sie Teil derselben Studie.

Eine reproduzierbare Workload-Studie durchführen

Grenze die Kandidaten anhand öffentlicher Telemetrie ein und prüfe die Favoriten anschließend mit deinem eigenen Prompt-Mix.
  1. Wähle zwei oder drei routbare Modelle aus der Standardantwort von GET /v1/models.
  2. Erstelle einen bereinigten Prompt-Satz mit kurzen, typischen und langen Anfragen.
  3. Lege Endpoint, Region, Streaming-Modus, Anbieterbeschränkungen und Parallelität fest.
  4. Sende mehrere Anfragen pro Prompt, statt dich auf eine einzelne Messung zu verlassen.
  5. Erfasse Request-ID, ausgewählten Anbieter, Erfolg oder Fehler, Ausgabetokens, Gateway TTFT, Anbieterdauer, Gateway E2E, Phaseo-Overhead und Kosten.
  6. Vergleiche Verteilungen und Fehlermuster und bewahre die Rohdaten zusammen mit der Testkonfiguration auf.
Beispiel für ein Ergebnisschema:
Die Nullwerte sind Platzhalter. Veröffentliche Messwerte nur zusammen mit der Workload-Definition, der Stichprobenzahl, dem Zeitraum und der Erlaubnis zur Offenlegung der Daten.

Was Phaseo nicht behauptet

  • Ein Modelle im Katalog ist nicht automatisch routbar. Verwende den standardmäßigen Filter für aktive Verfügbarkeit.
  • Öffentliche Betriebsdaten garantieren weder zukünftige Latenz noch Verfügbarkeit.
  • Ein Benchmark-Ergebnis belegt nicht die Produktionsqualität für deinen Prompt-Mix.
  • Ein beispielhaftes UI-Profil ist keine Live-Messung des Modells.
  • Kundenreferenzen, Logos oder Workload-Ergebnisse dürfen nur mit Genehmigung und Belegen veröffentlicht werden.

Nächste Schritte

Zuverlässigkeit und Status prüfen

Prüfe Vorfälle, aktuelle Modell-Routbarkeit, Metrikdefinitionen und Fehleranalyse.

Modelle vergleichen

Vergleiche Preise, Metadaten und verfügbare Leistungssignale nebeneinander.

Modellrouten prüfen

Prüfe Anbieterrouten, Funktionen, Verfügbarkeitsstatus und Preise für ein Modell.

Benchmark-Methodik prüfen

Erfahre, wie Benchmark-Quellen und -Ergebnisse unabhängig von Gateway-Telemetrie normalisiert werden.
Zuletzt geändert am 2. Oktober 2026