Skip to main content
जब मॉडल वही रखना हो, लेकिन किसी एक अनुरोध के लिए गेटवे से प्रदाता ऑफ़र अलग क्रम में रैंक कराने हों, तब यह रेसिपी उपयोग करें।

लक्ष्य

  • किसी अनुरोध के लिए सबसे सस्ते प्रदाता को प्राथमिकता दें।
  • इंटरैक्टिव पाथ के लिए सबसे कम लेटेंसी वाले प्रदाता को प्राथमिकता दें।
  • बल्क जनरेशन के लिए सबसे अधिक थ्रूपुट वाले प्रदाता को प्राथमिकता दें।

1. अनुरोध में provider.sort जोड़ें

टेक्स्ट अनुरोधों के लिए, इच्छित सॉर्ट सीधे provider ऑब्जेक्ट पर सेट करें।
इस फ़्लो में ये रूटिंग सॉर्ट उपलब्ध हैं:
  • price
  • latency
  • throughput

2. वर्कलोड के अनुसार सॉर्ट चुनें

इसे इस तरह चुनें:
  • जब लागत टेल लेटेंसी से अधिक महत्वपूर्ण हो, तब price
  • चैट, कोपायलट और मानव-सहभागिता वाले टूल के लिए latency
  • अधिक मात्रा में जनरेशन या बैकफ़िल के लिए throughput

3. समझें कि गेटवे किन चीज़ों की तुलना करता है

अनुरोध-स्तरीय सॉर्ट स्पष्ट करने पर, गेटवे सामान्य संतुलित भारित शफ़ल के बजाय उम्मीदवारों को नियतात्मक ढंग से रैंक करता है। टेक्स्ट मॉडल के लिए:
  • price योग्य प्रदाताओं में समान मूल्य आधार की तुलना करता है
  • साझा टेक्स्ट मीटर उपलब्ध होने पर गेटवे input_text_tokens और output_text_tokens से मेल खाने वाले विकल्पों को प्राथमिकता देता है
  • latency प्रदाता के नवीनतम लेटेंसी डेटा का उपयोग करता है
  • throughput नवीनतम थ्रूपुट माप का उपयोग करता है

4. प्रदाताओं का समूह व्यावहारिक रखें

ज़रूरत पड़ने पर पहले उम्मीदवारों का दायरा सीमित करने से सॉर्ट बेहतर काम करता है। उदाहरण के लिए, केवल स्वीकृत प्रदाताओं के समूह में सॉर्ट करें:

5. रैंक किए गए परिणाम की पुष्टि करें

debugging करते समय Gateway -> उपयोग में request देखें और यह खोजें:
  • विचार किए गए प्रदाता
  • रैंक किए गए प्रदाता
  • कीमत, लेटेंसी या थ्रूपुट के रूटिंग स्कोर कारक
इससे आसानी से पुष्टि हो जाती है कि गेटवे ने अपेक्षा के अनुसार सॉर्ट किया या नहीं।

संबंधित गाइड

अंतिम संशोधन 2 अक्टूबर 2026