Skip to main content
Usa esta guía para comparar costes y velocidad entre rutas, entender las métricas que muestra Phaseo y diseñar un estudio de carga antes de trasladar tráfico de producción.

Empieza por la decisión

Elige la métrica que corresponda a la experiencia de usuario que quieres preservar. Ninguna puntuación demuestra por sí sola que un modelo sea la mejor opción para todas las cargas de trabajo.

Comparar precios

Las listas de precios de los proveedores usan distintas unidades: por token, por millón de tokens, por imagen, por segundo, por minuto o por solicitud. Phaseo conserva la unidad original y normaliza los precios comparables para el catálogo y la calculadora de precios. En modelos de texto, compara por separado las tarifas de entrada, entrada en caché, escritura en caché, razonamiento y salida cuando estén disponibles. En modelos multimedia, muestra la unidad de facturación original: un precio de video por segundo no debe presentarse como si fuera por token.
Los precios del catálogo sirven para estimar una solicitud, no son una cotización para cualquier carga útil. Los niveles del proveedor, las ofertas regionales, los precios por lotes, el comportamiento de la caché y los medidores específicos de cada solicitud pueden cambiar el importe final.
Usa la calculadora de precios con una carga útil representativa y, después de probar, confirma el importe cobrado en el uso de Gateway.

Entender las métricas de rendimiento

Phaseo registra los tiempos operativos de las solicitudes que pasan por Gateway. TTFT, la velocidad de salida, TPOT e ITL requieren una respuesta en streaming cuya primera salida contenga contenido. Los fragmentos del flujo que solo contienen metadatos no cuentan. Las respuestas que no son de streaming pueden aportar datos de duración del proveedor, Gateway E2E y rendimiento efectivo sin inventar un TTFT. La sobrecarga de Phaseo separa el tiempo que transcurre fuera de la llamada al proveedor seleccionado. Puede incluir el procesamiento de Gateway, el enrutamiento, los reintentos y los efectos de red. No es un valor fijo de la plataforma; debe interpretarse como una distribución dentro de un intervalo definido.

Interpretar correctamente los datos operativos

Las páginas de rendimiento resumen el tráfico en vivo de Gateway. Son mediciones observacionales, no pruebas de benchmark controladas ni propiedades intrínsecas del modelo. Los resultados pueden variar debido a:
  • la selección del proveedor y la ruta
  • la ubicación de ejecución de Cloudflare y la ruta de red
  • la cola del proveedor o la carga regional
  • la longitud del prompt y de la salida
  • el comportamiento en streaming frente al modo sin streaming
  • los reintentos, las cancelaciones y las llamadas a herramientas
  • las actualizaciones del modelo o del proveedor durante el intervalo seleccionado
Los gráficos públicos pueden mostrar percentiles como P50, P90, P95 y P99. En latencia, cuanto menor, mejor. En rendimiento, cuanto mayor, mejor; por eso, un percentil bajo de rendimiento representa la parte más lenta. Anota siempre junto al resultado el intervalo elegido, la ruta, la región, los filtros de muestra y el percentil. No compares capturas de pantalla de intervalos distintos como si fueran el mismo estudio.

Realizar un estudio de carga reproducible

Usa la telemetría pública para reducir las opciones y valida los finalistas con tu propia combinación de prompts.
  1. Elige dos o tres modelos disponibles para el enrutamiento en la respuesta predeterminada de GET /v1/models.
  2. Crea un conjunto de prompts depurado que represente solicitudes cortas, habituales y largas.
  3. Fija el endpoint, la región, el modo de streaming, las restricciones de proveedor y la concurrencia.
  4. Repite las solicitudes de cada prompt en lugar de basarte en una sola muestra.
  5. Registra el ID de solicitud, el proveedor seleccionado, el éxito o error, los tokens de salida, Gateway TTFT, la duración del proveedor, Gateway E2E, la sobrecarga de Phaseo y el coste.
  6. Compara las distribuciones y los modos de fallo y conserva los resultados sin procesar junto con la configuración de prueba.
Esquema de resultado de ejemplo:
Los valores cero son marcadores de posición. Publica valores medidos solo junto con la definición de la carga de trabajo, el número de muestras, el intervalo temporal y el permiso para divulgar los datos.

Lo que Phaseo no afirma

  • Que un modelo aparezca en el catálogo no significa que se pueda enrutar. Usa el filtro predeterminado de disponibilidad activa.
  • La telemetría operativa pública no garantiza la latencia ni el tiempo de actividad futuros.
  • Una puntuación de benchmark no demuestra la calidad en producción para tu combinación de prompts.
  • Un perfil de UI ilustrativo no es una medición real del modelo.
  • No publiques citas, logotipos ni resultados de cargas de trabajo de clientes sin permiso y pruebas que los respalden.

Siguientes pasos

Consultar fiabilidad y estado

Consulta incidencias, disponibilidad actual de enrutamiento de modelos, definiciones de métricas y diagnóstico de fallos.

Comparar modelos

Compara precios, metadatos y señales de rendimiento disponibles en paralelo.

Inspeccionar rutas de modelos

Consulta las rutas de proveedores, capacidades, disponibilidad y precios de un modelo.

Revisar la metodología de benchmarks

Descubre cómo se normalizan las fuentes y puntuaciones de benchmarks de forma independiente de la telemetría de Gateway.
Última modificación el 2 de octubre de 2026