O cache de prompts depende do provedor e do modelo. Provedores sem suporte ignoram as indicações de cache ou roteiam sem preços de cache. Consulte a tabela de preços na página do modelo para ver as tarifas de leitura e gravação do cache.
O que armazenar em cache
Armazene em cache o conteúdo que permanece estável entre solicitações:- instruções longas do sistema
- documentos RAG reutilizados
- exemplos few-shot
- definições de ferramentas
- resultados extensos de ferramentas reutilizados no próximo turno
Controles de cache
O Phaseo aceita a indicação de compatibilidadecache_control no nível superior em solicitações de Chat Completions, Responses e Anthropic Messages:
ttl: "5m" para contexto compartilhado de curta duração e ttl: "1h" quando o provedor e o modelo oferecerem suporte a entradas de cache de prompts mais duradouras. Provedores compatíveis tratam o controle de cache no nível superior como uma política automática ou padrão.
Você também pode colocar cache_control diretamente em blocos compatíveis de texto, imagem, resultado de ferramenta e definição de ferramenta para criar pontos explícitos de divisão do cache:
provider_options:
scope compatíveis:
O
cache_control definido por bloco prevalece sobre a política padrão.
Chat Completions
Use/v1/chat/completions com clientes de chat compatíveis com OpenAI.
Responses
Use/v1/responses para novas integrações de texto compatíveis com OpenAI e fluxos de agentes.
provider_options.google.cached_content:
Anthropic Messages
Use/v1/messages quando seu cliente for compatível com Anthropic.
- blocos de texto
system - blocos de texto e imagem das mensagens
- blocos de resultado de ferramentas
- definições de ferramentas
Campos de uso e preços
Quando um provedor retorna dados de uso do cache, o Phaseo os normaliza em campos de uso comuns.
Gravações no cache geralmente custam mais que tokens de entrada comuns. Leituras costumam ser mais baratas. O preço exato depende do provedor, do modelo e do TTL.
Verificações práticas
Depois de adicionar o cache de prompts:- Envie uma solicitação para criar ou aquecer o cache.
- Envie uma segunda solicitação com o mesmo conteúdo elegível para cache.
- Confira os campos de leitura e gravação do cache nos dados de uso da resposta e nos detalhes da solicitação.
- Compare a latência e o custo em várias chamadas, não apenas na primeira.
Afinidade com o provedor
Por padrão, o Phaseo usa o uso do cache de prompts do provedor como sinal de roteamento. Quando um provedor retorna tokens de entrada em cache, solicitações com a mesma chave de cache ou contexto inicial preferem esse provedor por 15 minutos. Assim, você evita pagar outro provedor para reconstruir o mesmo cache de prompts. Se você incluirsession_id, uma leitura de cache observada também cria afinidade de sessão.
Além disso, o Phaseo mantém essa afinidade durante a janela ativa da sessão, mas ainda
permite failover quando o provedor está indisponível ou deixa de cumprir os requisitos da política.
Defina provider.cache_aware_routing como false para desativar esse comportamento em uma solicitação. Defina
routing.session_affinity como false quando a solicitação incluir um session_id
mas deve usar apenas o roteamento normal baseado em contexto.