El caché de prompts depende del proveedor y del modelo. Los proveedores no compatibles ignoran las indicaciones de caché o enrutan la solicitud sin precios de caché. Consulta la tabla de precios de la página del modelo para ver las tarifas de lectura y escritura del caché.
Qué almacenar en caché
Almacena en caché el contenido que permanece estable entre solicitudes:- instrucciones largas del sistema
- documentos RAG reutilizados
- ejemplos few-shot
- definiciones de herramientas
- resultados extensos de herramientas que se reutilizan en el siguiente turno
Controles de caché
Phaseo acepta una indicación de compatibilidadcache_control de nivel superior en las solicitudes de Chat Completions, Responses y Anthropic Messages:
ttl: "5m" para contextos compartidos de corta duración y ttl: "1h" cuando el proveedor y el modelo admitan entradas de caché de prompts de mayor duración. Los proveedores compatibles tratan el control de caché de nivel superior como una política automática o predeterminada.
También puedes colocar cache_control directamente en bloques compatibles de texto, imagen, resultados de herramientas y definiciones de herramientas para crear puntos de corte explícitos en la caché:
provider_options:
scope:
El
cache_control de cada bloque prevalece sobre la política predeterminada.
Chat Completions
Usa/v1/chat/completions si utilizas clientes de chat compatibles con OpenAI.
Responses
Usa/v1/responses para nuevas integraciones de texto compatibles con OpenAI y flujos de agentes.
provider_options.google.cached_content:
Anthropic Messages
Usa/v1/messages si tu cliente es compatible con Anthropic.
- bloques de texto
system - bloques de texto e imagen de los mensajes
- bloques de resultados de herramientas
- definiciones de herramientas
Campos de uso y precios
Cuando un proveedor devuelve datos de uso del caché, Phaseo los normaliza en campos de uso comunes.
Las escrituras en caché suelen costar más que los tokens de entrada normales. Las lecturas suelen ser más baratas. El precio exacto depende del proveedor, el modelo y el TTL.
Comprobaciones prácticas
Después de añadir el caché de prompts:- Envía una solicitud para crear o preparar el caché.
- Envía una segunda solicitud con el mismo contenido apto para caché.
- Revisa el uso de la respuesta y los detalles de la solicitud para ver los campos de lectura y escritura del caché.
- Compara la latencia y el coste tras varias llamadas, no solo en la primera.
Afinidad con el proveedor
Por defecto, Phaseo utiliza el uso del caché de prompts del proveedor como señal de enrutamiento. Cuando un proveedor devuelve tokens de entrada en caché, las solicitudes con la misma clave de caché o un contexto inicial prefieren ese proveedor durante 15 minutos. Así se evita pagar a otro proveedor para reconstruir la misma caché de prompts. Si incluyessession_id, una lectura de caché detectada también crea afinidad de sesión.
Phaseo conserva esa afinidad durante la ventana activa de la sesión y sigue
permitiendo el failover si el proveedor no está sano o deja de cumplir los requisitos de la política.
Establece provider.cache_aware_routing en false para excluir una solicitud. Establece
routing.session_affinity en false cuando la solicitud incluya session_id
pero deba usar únicamente el enrutamiento normal basado en contexto.