1. Comece com um preset, não com solicitações avulsas
Crie um preset para manter estáveis:- o modelo de destino
- as preferências de provedor
- a temperatura e outros parâmetros de geração
- as configurações de raciocínio
- o prompt do sistema
2. Ative o cache de respostas no preset
Configure:response_caching.enabled = true- um valor adequado para
ttl_seconds
- TTL curto para prompts factuais que mudam rapidamente
- TTL mais longo para saídas estruturadas estáveis
3. Mantenha a solicitação determinística
O cache de respostas funciona melhor quando você evita alterações desnecessárias nas solicitações. Evite alterar:- o texto do prompt do sistema
- a temperatura
- as substituições de provedor
- a configuração de raciocínio
- as listas de ferramentas
4. Confira o comportamento do cache nos detalhes da solicitação
Os detalhes de solicitações que passam pelo cache devem mostrar informações sobre ele. Verifique:- acertos e falhas de cache
- comportamento do TTL
- contexto do provedor quando uma resposta em cache é retornada
5. Combine cache e roteamento de forma intencional
Padrões recomendados:- use um preset com cache ativado para saídas estruturadas determinísticas
- use outro preset sem cache para solicitações exploratórias ou com temperatura mais alta
6. Investigue falhas antes de aumentar o TTL
Se você espera acertos, mas continua tendo falhas, compare:- o texto do prompt
- o ID do modelo
- as opções do provedor
- o formato da resposta
- as ferramentas e a seleção de ferramentas
- o slug e a configuração do preset
7. Quando evitar o cache
Não ative o cache de respostas por padrão para:- prompts que dependem de estado externo em tempo real
- respostas específicas de usuários cujo contexto muda rapidamente
- solicitações com saídas variáveis de ferramentas
- gerações muito estocásticas em que a reprodução exata não seja desejável