O que muda
Antes de começar
- A configuração atual do endpoint e da chave de API do LLM Gateway.
PHASEO_API_KEYdisponível nos ambientes local, staging e produção.- Uma amostra de referência da qualidade das respostas, latência e taxa de erros.
1) Faça o inventário dos pontos de integração
Identifique os arquivos exatos que criam e configuram o cliente do LLM Gateway.- Localize todos os usos de variáveis de ambiente
LLM_GATEWAY_*. - Encontre todas as referências à URL base na configuração de execução.
- Registre os IDs dos modelos ativos e as cadeias de fallback.
- Anote padrões compartilhados de prompts, regras de permissão ou bloqueio de provedores e presets de parâmetros que devem migrar para os presets do Gateway.
2) Troque o endpoint e as credenciais
Mantenha o conteúdo das solicitações inalterado no início. Troque somente o endpoint e a chave para reduzir o risco.3) Valide a compatibilidade dos modelos
Consulte o catálogo de modelos do Phaseo e verifique cada modelo usado em produção. Se sua configuração atual usa aliases sem prefixo, comogpt-4o, normalize-os em um único limite em vez de alterar cada cliente.
Se a camada atual do gateway também centraliza padrões de solicitação ou restrições de provedores, mapeie esse comportamento para Presets e Roteamento e fallbacks durante a migração, em vez de reimplementá-lo para cada cliente.
4) Lista de verificação da migração do LLMGateway
- Todas as variáveis
LLM_GATEWAY_*foram mapeadas ou removidas. - A URL base foi atualizada para
https://api.phaseo.app/v1. PHASEO_API_KEYestá configurada em todos os ambientes de implantação.- Os IDs dos modelos de produção foram verificados em
/v1/models. - Uma solicitação com streaming e outra sem streaming foram validadas no staging.
- O tratamento de falhas para chaves e modelos inválidos foi revisado.
- Padrões compartilhados de prompts e roteamento foram movidos para presets quando adequado.
- As consultas de gerações foram verificadas novamente por meio de
GET /v1/generations?id=<request_id>, para permitir a reprodução de solicitações com falha usando o conteúdo armazenado dereplay_requestquandoreplay_supported=true.
5) Valide e faça o rollout
- Execute sua suíte de prompts de referência e compare qualidade, latência e custo com a linha de base.
- Confirme que solicitações com falha no staging podem ser recuperadas pelo conteúdo de replay retornado por
GET /v1/generations. - Faça a implantação com uma flag canário e aumente o tráfego gradualmente depois que os resultados estiverem estáveis.
- Observe as métricas de produção por pelo menos um ciclo de lançamento antes de remover a configuração antiga.
Comandos de validação
- Faça uma solicitação com streaming e outra sem streaming no staging.
- Reproduza seus prompts de referência e compare com a linha de base.