Skip to main content
Utilisez ce guide pour comparer les coûts et la vitesse entre les routes, comprendre les métriques affichées par Phaseo et concevoir une étude de charge avant de déplacer le trafic de production.

Commencez par le besoin

Choisissez la métrique correspondant à l’expérience utilisateur que vous souhaitez préserver. Aucun score ne prouve à lui seul qu’un modèle est le meilleur choix pour toutes les charges de travail.

Comparer les tarifs

Les grilles tarifaires des fournisseurs utilisent différentes unités : par jeton, par million de jetons, par image, par seconde, par minute ou par requête. Phaseo conserve l’unité d’origine et normalise les prix comparables pour le catalogue et le calculateur de tarifs. Pour les modèles textuels, comparez séparément les tarifs d’entrée, d’entrée en cache, d’écriture du cache, de raisonnement et de sortie, lorsqu’ils existent. Pour les modèles multimédias, gardez visible l’unité de facturation native : un tarif vidéo à la seconde ne doit pas être présenté comme un tarif par jeton.
Les tarifs du catalogue permettent d’estimer une requête ; ils ne constituent pas un devis pour toutes les charges utiles possibles. Les niveaux du fournisseur, les offres régionales, les tarifs par lots, le comportement du cache et les compteurs propres à chaque requête peuvent modifier le montant final.
Utilisez le calculateur de tarifs avec une charge utile représentative, puis vérifiez le montant facturé dans l’utilisation de Gateway après une requête de test.

Comprendre les métriques de performance

Phaseo mesure le temps de traitement des requêtes acheminées par la passerelle. Le TTFT, la vitesse de sortie, le TPOT et l’ITL nécessitent une réponse en streaming dont la première sortie contient du contenu. Les trames du flux contenant uniquement des métadonnées ne sont pas prises en compte. Les réponses qui ne sont pas en streaming peuvent tout de même contribuer à la durée du fournisseur, au Gateway E2E et au débit effectif, sans attribuer un TTFT artificiel. La surcharge Phaseo isole le temps passé en dehors de l’appel au fournisseur sélectionné. Il peut inclure le traitement de Gateway, le routage, les nouvelles tentatives et les effets du réseau. Ce n’est pas une constante fixe de la plateforme : il faut l’interpréter comme une distribution sur une période définie.

Interpréter correctement les données opérationnelles

Les pages de performance résument le trafic Gateway en temps réel. Il s’agit de mesures d’observation, pas de tests de benchmark contrôlés ni de propriétés intrinsèques d’un modèle. Les résultats peuvent varier en raison :
  • la sélection du fournisseur et de la route
  • l’emplacement d’exécution de Cloudflare et le chemin réseau
  • la file d’attente du fournisseur ou la charge régionale
  • la longueur du prompt et de la sortie
  • le comportement en streaming ou hors streaming
  • les nouvelles tentatives, les annulations et les appels d’outils
  • les mises à jour du modèle ou du fournisseur pendant la période choisie
Les graphiques publics peuvent afficher des percentiles tels que P50, P90, P95 et P99. Pour la latence, une valeur plus basse est préférable. Pour le débit, une valeur plus élevée est préférable ; un percentile bas décrit donc la partie la plus lente de la distribution. Indiquez toujours à côté du résultat la période choisie, la route, la région, les filtres d’échantillon et le percentile. Ne comparez pas deux captures d’écran portant sur des périodes différentes comme s’il s’agissait de la même étude.

Mener une étude de charge reproductible

Utilisez les données télémétriques publiques pour présélectionner les options, puis validez les finalistes avec vos propres prompts.
  1. Choisissez deux ou trois modèles routables dans la réponse par défaut de GET /v1/models.
  2. Créez un ensemble de prompts anonymisés représentatif de requêtes courtes, courantes et longues.
  3. Fixez l’endpoint, la région, le mode de streaming, les contraintes de fournisseur et le niveau de concurrence.
  4. Exécutez plusieurs requêtes pour chaque prompt au lieu de vous fier à un seul échantillon.
  5. Relevez l’identifiant de requête, le fournisseur sélectionné, la réussite ou l’erreur, les jetons de sortie, le Gateway TTFT, la durée du fournisseur, le Gateway E2E, la surcharge Phaseo et le coût.
  6. Comparez les distributions et les modes d’échec, puis conservez les résultats bruts avec la configuration du test.
Exemple de schéma de résultat :
Les valeurs nulles sont des espaces réservés. Ne publiez des valeurs mesurées qu’avec la définition de la charge de travail, le nombre d’échantillons, la période et l’autorisation de divulguer les données.

Ce que Phaseo ne prétend pas

  • La présence dans le catalogue ne signifie pas qu’un modèle est routable. Utilisez le filtre de disponibilité active par défaut.
  • Les données opérationnelles publiques ne garantissent ni la latence ni la disponibilité futures.
  • Un score de benchmark ne suffit pas à établir la qualité en production pour votre ensemble de prompts.
  • Un profil d’interface illustratif n’est pas une mesure réelle du modèle.
  • Ne publiez pas de citation, de logo ni de résultat de charge de travail client sans autorisation et justificatifs.

Étapes suivantes

Vérifier la fiabilité et l’état

Consultez les incidents, la routabilité actuelle des modèles, les définitions des métriques et le diagnostic des échecs.

Comparer les modèles

Comparez côte à côte les tarifs, les métadonnées et les indicateurs de performance disponibles.

Examiner les routes des modèles

Examinez les routes des fournisseurs, les capacités, la disponibilité et les tarifs d’un modèle.

Examiner la méthodologie des benchmarks

Comprenez comment les sources et les scores de benchmark sont normalisés indépendamment des données télémétriques de Gateway.
Dernière modification le 2 octobre 2026