Skip to main content
क्वांटाइज़ेशन मॉडल के व्यवहार का एक हिस्सा तय करता है।
दूसरा हिस्सा इन्फ़रेंस पैरामीटर तय करते हैं।

मुख्य पैरामीटर

जिन संयोजनों पर ध्यान दें

  • temperature और top_p दोनों यादृच्छिकता को प्रभावित करते हैं। ट्यून करते समय एक बार में केवल एक बदलें।
  • कम बिट वाली आक्रामक क्वांटाइज़ेशन और अधिक यादृच्छिकता आउटपुट की अस्थिरता बढ़ा सकती है।
  • कम max_tokens मॉडल की विफलता जैसा लग सकता है, जबकि उत्तर केवल कट गया हो।

सुझाए गए शुरुआती मान

  • temperature: ज़रूरी रचनात्मकता के अनुसार 0.2 से 0.7
  • top_p: 0.9 से 1.0
  • max_tokens: हर स्थिति के लिए बहुत बड़ा मान रखने के बजाय अपेक्षित आउटपुट के अनुसार चुनें

ट्यूनिंग प्रक्रिया

  1. पहले क्वांटाइज़ेशन तय करें।
  2. मूल्यांकन सेट तय करें।
  3. एक बार में एक पैरामीटर बदलें।
  4. गुणवत्ता, विलंबता और टोकन उपयोग की तुलना करें।
  5. अलग-अलग endpoint और उपयोग के लिए अलग प्रीसेट रखें।
अंतिम संशोधन 2 अक्टूबर 2026