लक्ष्य
- किसी अनुरोध के लिए सबसे सस्ते प्रदाता को प्राथमिकता दें।
- इंटरैक्टिव पाथ के लिए सबसे कम लेटेंसी वाले प्रदाता को प्राथमिकता दें।
- बल्क जनरेशन के लिए सबसे अधिक थ्रूपुट वाले प्रदाता को प्राथमिकता दें।
1. अनुरोध में provider.sort जोड़ें
टेक्स्ट अनुरोधों के लिए, इच्छित सॉर्ट सीधे provider ऑब्जेक्ट पर सेट करें।
pricelatencythroughput
2. वर्कलोड के अनुसार सॉर्ट चुनें
इसे इस तरह चुनें:- जब लागत टेल लेटेंसी से अधिक महत्वपूर्ण हो, तब
price - चैट, कोपायलट और मानव-सहभागिता वाले टूल के लिए
latency - अधिक मात्रा में जनरेशन या बैकफ़िल के लिए
throughput
3. समझें कि गेटवे किन चीज़ों की तुलना करता है
अनुरोध-स्तरीय सॉर्ट स्पष्ट करने पर, गेटवे सामान्य संतुलित भारित शफ़ल के बजाय उम्मीदवारों को नियतात्मक ढंग से रैंक करता है। टेक्स्ट मॉडल के लिए:priceयोग्य प्रदाताओं में समान मूल्य आधार की तुलना करता है- साझा टेक्स्ट मीटर उपलब्ध होने पर गेटवे
input_text_tokensऔरoutput_text_tokensसे मेल खाने वाले विकल्पों को प्राथमिकता देता है latencyप्रदाता के नवीनतम लेटेंसी डेटा का उपयोग करता हैthroughputनवीनतम थ्रूपुट माप का उपयोग करता है
4. प्रदाताओं का समूह व्यावहारिक रखें
ज़रूरत पड़ने पर पहले उम्मीदवारों का दायरा सीमित करने से सॉर्ट बेहतर काम करता है। उदाहरण के लिए, केवल स्वीकृत प्रदाताओं के समूह में सॉर्ट करें:5. रैंक किए गए परिणाम की पुष्टि करें
debugging करते समय Gateway -> उपयोग में request देखें और यह खोजें:- विचार किए गए प्रदाता
- रैंक किए गए प्रदाता
- कीमत, लेटेंसी या थ्रूपुट के रूटिंग स्कोर कारक