Empieza por la decisión
Elige la métrica que corresponda a la experiencia de usuario que quieres preservar.
Ninguna puntuación demuestra por sí sola que un modelo sea la mejor opción para todas las cargas de trabajo.
Comparar precios
Las listas de precios de los proveedores usan distintas unidades: por token, por millón de tokens, por imagen, por segundo, por minuto o por solicitud. Phaseo conserva la unidad original y normaliza los precios comparables para el catálogo y la calculadora de precios. En modelos de texto, compara por separado las tarifas de entrada, entrada en caché, escritura en caché, razonamiento y salida cuando estén disponibles. En modelos multimedia, muestra la unidad de facturación original: un precio de video por segundo no debe presentarse como si fuera por token.Los precios del catálogo sirven para estimar una solicitud, no son una cotización para cualquier carga útil. Los niveles del proveedor, las ofertas regionales, los precios por lotes, el comportamiento de la caché y los medidores específicos de cada solicitud pueden cambiar el importe final.
Entender las métricas de rendimiento
Phaseo registra los tiempos operativos de las solicitudes que pasan por Gateway.
TTFT, la velocidad de salida, TPOT e ITL requieren una respuesta en streaming cuya primera salida contenga contenido. Los fragmentos del flujo que solo contienen metadatos no cuentan. Las respuestas que no son de streaming pueden aportar datos de duración del proveedor, Gateway E2E y rendimiento efectivo sin inventar un TTFT.
La sobrecarga de Phaseo separa el tiempo que transcurre fuera de la llamada al proveedor seleccionado. Puede incluir el procesamiento de Gateway, el enrutamiento, los reintentos y los efectos de red. No es un valor fijo de la plataforma; debe interpretarse como una distribución dentro de un intervalo definido.
Interpretar correctamente los datos operativos
Las páginas de rendimiento resumen el tráfico en vivo de Gateway. Son mediciones observacionales, no pruebas de benchmark controladas ni propiedades intrínsecas del modelo. Los resultados pueden variar debido a:- la selección del proveedor y la ruta
- la ubicación de ejecución de Cloudflare y la ruta de red
- la cola del proveedor o la carga regional
- la longitud del prompt y de la salida
- el comportamiento en streaming frente al modo sin streaming
- los reintentos, las cancelaciones y las llamadas a herramientas
- las actualizaciones del modelo o del proveedor durante el intervalo seleccionado
Realizar un estudio de carga reproducible
Usa la telemetría pública para reducir las opciones y valida los finalistas con tu propia combinación de prompts.- Elige dos o tres modelos disponibles para el enrutamiento en la respuesta predeterminada de
GET /v1/models. - Crea un conjunto de prompts depurado que represente solicitudes cortas, habituales y largas.
- Fija el endpoint, la región, el modo de streaming, las restricciones de proveedor y la concurrencia.
- Repite las solicitudes de cada prompt en lugar de basarte en una sola muestra.
- Registra el ID de solicitud, el proveedor seleccionado, el éxito o error, los tokens de salida, Gateway TTFT, la duración del proveedor, Gateway E2E, la sobrecarga de Phaseo y el coste.
- Compara las distribuciones y los modos de fallo y conserva los resultados sin procesar junto con la configuración de prueba.
Lo que Phaseo no afirma
- Que un modelo aparezca en el catálogo no significa que se pueda enrutar. Usa el filtro predeterminado de disponibilidad activa.
- La telemetría operativa pública no garantiza la latencia ni el tiempo de actividad futuros.
- Una puntuación de benchmark no demuestra la calidad en producción para tu combinación de prompts.
- Un perfil de UI ilustrativo no es una medición real del modelo.
- No publiques citas, logotipos ni resultados de cargas de trabajo de clientes sin permiso y pruebas que los respalden.
Siguientes pasos
Consultar fiabilidad y estado
Consulta incidencias, disponibilidad actual de enrutamiento de modelos, definiciones de métricas y diagnóstico de fallos.
Comparar modelos
Compara precios, metadatos y señales de rendimiento disponibles en paralelo.
Inspeccionar rutas de modelos
Consulta las rutas de proveedores, capacidades, disponibilidad y precios de un modelo.
Revisar la metodología de benchmarks
Descubre cómo se normalizan las fuentes y puntuaciones de benchmarks de forma independiente de la telemetría de Gateway.