> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# इन्फ़रेंस पैरामीटर

> मुख्य अनुरोध पैरामीटर गुणवत्ता, नियतात्मकता, विलंबता और लागत को कैसे प्रभावित करते हैं।

क्वांटाइज़ेशन मॉडल के व्यवहार का एक हिस्सा तय करता है।\
दूसरा हिस्सा इन्फ़रेंस पैरामीटर तय करते हैं।

## मुख्य पैरामीटर

| पैरामीटर | यह क्या नियंत्रित करता है | आम प्रभाव |
| - | - | - |
| `temperature` | टोकन चुनने में यादृच्छिकता | अधिक मान से उत्तर अधिक रचनात्मक और परिवर्तनशील होते हैं; कम मान से अधिक नियतात्मक |
| `top_p` | न्यूक्लियस सैंपलिंग की सीमा | कम मान से अधिक सुरक्षित और केंद्रित आउटपुट मिलता है |
| `top_k` | उम्मीदवार टोकन समूह का आकार (जहाँ समर्थित हो) | कम मान से अधिक सीमित और अनुमानित आउटपुट मिलता है |
| `max_tokens` / `max_output_tokens` | जनरेट किए गए आउटपुट की अधिकतम लंबाई | लागत और विलंबता सीमित करता है, लेकिन उत्तर छोटा कर सकता है |
| `stop` | स्पष्ट स्टॉप सीक्वेंस | आउटपुट की संरचना और पार्सर की विश्वसनीयता बेहतर करता है |
| `seed` | यादृच्छिक seed (जहाँ समर्थित हो) | डीबगिंग और परीक्षण में दोहराए जा सकने वाले परिणाम बेहतर करता है |

## जिन संयोजनों पर ध्यान दें

* `temperature` और `top_p` दोनों यादृच्छिकता को प्रभावित करते हैं। ट्यून करते समय एक बार में केवल एक बदलें।
* कम बिट वाली आक्रामक क्वांटाइज़ेशन और अधिक यादृच्छिकता आउटपुट की अस्थिरता बढ़ा सकती है।
* कम `max_tokens` मॉडल की विफलता जैसा लग सकता है, जबकि उत्तर केवल कट गया हो।

## सुझाए गए शुरुआती मान

* `temperature`: ज़रूरी रचनात्मकता के अनुसार `0.2` से `0.7`
* `top_p`: `0.9` से `1.0`
* `max_tokens`: हर स्थिति के लिए बहुत बड़ा मान रखने के बजाय अपेक्षित आउटपुट के अनुसार चुनें

## ट्यूनिंग प्रक्रिया

1. पहले क्वांटाइज़ेशन तय करें।
2. मूल्यांकन सेट तय करें।
3. एक बार में एक पैरामीटर बदलें।
4. गुणवत्ता, विलंबता और टोकन उपयोग की तुलना करें।
5. अलग-अलग endpoint और उपयोग के लिए अलग प्रीसेट रखें।


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.