क्या बदलता है
शुरू करने से पहले
- Vercel AI Gateway का मौजूदा base URL और key कॉन्फ़िगरेशन।
- स्थानीय, staging और production परिवेशों में
PHASEO_API_KEYउपलब्ध हो। - prompts या integration tests का छोटा सेट, जो बिना streaming, streaming और इस्तेमाल किए जाने वाले tool-calling paths को कवर करे।
1) Gateway से जुड़ने की मौजूदा जगह दर्ज करें
वह साझा जगह खोजें जहाँ ऐप model providers या API clients बनाता है। माइग्रेशन वहीं से करें।- इस्तेमाल होने वाली provider/client factory खोजें।
- production में चल रही model IDs की सूची बनाएँ।
- retries, timeouts और fallbacks के default मान दर्ज करें।
- नोट करें कि edge और server runtimes में एक ही config बदलाव चाहिए या नहीं।
- साझा prompt या parameter defaults पहचानें जिन्हें हर AI SDK call में रखने के बजाय Gateway presets बनाया जाना चाहिए।
2) endpoint और key बदलें
ज़्यादातर OpenAI-संगत clients में सिर्फ़ base URL और key बदलनी होती है।3) व्यवहार की समानता की पुष्टि करें
पुराने और नए रास्तों पर वही prompts चलाएँ, फिर latency, output format और token usage की तुलना करें।- बिना streaming वाले text generation की जाँच करें।
- production में इस्तेमाल होने वाले उसी code path से streaming chunks की जाँच करें।
- ऐप निर्भर करता हो तो tool-calling paths जाँचें।
- पुष्टि करें कि ऐप-स्तर पर errors की mapping नहीं बदली है।
- routing defaults और provider restrictions को हर model factory में दोहराने के बजाय Presets या Routing और fallbacks में ले जाएँ।
4) Vercel AI SDK और Gateway की जाँच-सूची
ट्रैफ़िक बढ़ाने से पहले यह सूची पूरी करें:- Base URL को
https://api.phaseo.app/v1पर अपडेट किया गया है। - जिन सभी runtimes में Vercel Gateway key थी, उनमें
PHASEO_API_KEYकॉन्फ़िगर है। - ऐप सीधे Vercel AI SDK इस्तेमाल करता है तो आधिकारिक provider
@phaseo/ai-sdk-providerजोड़ा गया है। - AI SDK का मुख्य text-generation path staging में सफल है।
- ऐप-स्तर का streaming test बिना बदलाव के सफल है।
- इस्तेमाल होने पर tool-calling और structured-output flows की दोबारा जाँच हुई है।
- prompts के छोटे सेट के लिए पुराने और नए outputs की तुलना हुई है।
- केवल config या feature flag से rollback करना संभव है।
- साझा prompt/routing defaults जहाँ उपयुक्त हों, presets में ले जाए गए हैं।
GET /v1/generations?id=<request_id>से generation lookup जाँचा गया है, ताकिreplay_supported=trueहोने पर संग्रहितreplay_requestpayload से असफल requests दोबारा चलाई जा सकें।
5) कम जोखिम वाली रिलीज़ योजना
- feature flag के पीछे या चरणबद्ध प्रतिशत rollout से बदलाव जारी करें।
- आंतरिक ट्रैफ़िक या production के छोटे हिस्से से शुरू करें।
- latency, error rate और tokens/cost के बदलाव की निगरानी करें।
- कम-से-कम एक release window तक दोनों configs रखें।
सत्यापन कमांड
- ऐप का मुख्य text-generation integration test चलाएँ।
- staging में एक streaming test चलाएँ।
- पूरे rollout से पहले प्रमुख prompts के पुराने और नए outputs की तुलना करें।