Was sich ändert
Vor dem Start
- Die aktuelle LLM-Gateway-Endpunkt- und API-Schlüsselkonfiguration.
PHASEO_API_KEYin lokalen, Staging- und Produktionsumgebungen.- Eine Referenzstichprobe zu Ausgabequalität, Latenz und Fehlerrate.
1) Erfasse die Integrationspunkte
Finde die genauen Dateien, die den LLM-Gateway-Client erstellen und konfigurieren.- Suche nach der Verwendung von
LLM_GATEWAY_*-Umgebungsvariablen. - Finde alle Basis-URL-Angaben in der Laufzeitkonfiguration.
- Erfasse aktive Modell-IDs und Fallback-Ketten.
- Notiere gemeinsam genutzte Prompt-Standards, Anbieter-Zulassungs- oder Sperrregeln und Parameter-Presets, die in Gateway-Presets verschoben werden sollten.
2) Ändere Endpunkt und Zugangsdaten
Lass die Anfrageinhalte zunächst unverändert. Ändere zuerst nur Endpunkt und Schlüssel, um das Risiko zu verringern.3) Prüfe die Modellkompatibilität
Rufe den Phaseo-Modellkatalog ab und überprüfe jedes Modell, das in der Produktion verwendet wird. Wenn deine aktuelle Konfiguration nicht präfixierte Aliase wiegpt-4o nutzt, normalisiere sie an einer zentralen Stelle, statt jeden Aufrufer zu ändern.
Wenn deine bisherige Gateway-Schicht auch Anfrage-Standards oder Anbietereinschränkungen zentralisiert, ordne dieses Verhalten während der Migration den Presets und Routing und Fallbacks zu, statt es für jeden Aufrufer neu zu implementieren.
4) LLMGateway-Migrations-Checkliste
- Alle
LLM_GATEWAY_*-Variablen wurden zugeordnet oder entfernt. - Die Basis-URL wurde auf
https://api.phaseo.app/v1geändert. PHASEO_API_KEYist in allen Deployment-Umgebungen konfiguriert.- Produktionsmodell-IDs wurden mit
/v1/modelsüberprüft. - Je eine Anfrage mit und ohne Streaming wurde in Staging geprüft.
- Fehlerbehandlung für ungültige Schlüssel und Modelle wurde erneut geprüft.
- Gemeinsame Prompt- und Routing-Standards wurden bei Bedarf in Presets verschoben.
- Generierungsabfragen über
GET /v1/generations?id=<request_id>wurden erneut geprüft, damit fehlgeschlagene Anfragen beireplay_supported=truemit dem gespeichertenreplay_request-Inhalt wiedergegeben werden können.
5) Prüfe und rolle aus
- Führe deine Golden-Prompt-Suite aus und vergleiche Qualität, Latenz und Kosten mit der Basislinie.
- Stelle sicher, dass fehlgeschlagene Staging-Anfragen über den von
GET /v1/generationszurückgegebenen Replay-Inhalt wiederhergestellt werden können. - Veröffentliche hinter einem Canary-Schalter und erhöhe den Verkehrsanteil schrittweise, sobald die Ergebnisse stabil sind.
- Beobachte Produktionsmetriken mindestens einen Release-Zyklus lang, bevor du die alte Konfiguration entfernst.
Validierungsbefehle
- Führe in Staging je eine Anfrage mit und ohne Streaming aus.
- Spiele deine Golden Prompts erneut ab und vergleiche sie mit der Basislinie.