> ## Documentation Index
> Fetch the complete documentation index at: https://phaseo.app/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# बेंचमार्क देखें

> जानें कि Phaseo पर AI मॉडल बेंचमार्क कैसे एकत्र, मानकीकृत और दृश्य रूप में प्रस्तुत किए जाते हैं।

बेंचमार्क, Phaseo द्वारा मॉडल की गुणवत्ता और प्रगति मापने का आधार हैं।
ये **वस्तुनिष्ठ और दोहराए जा सकने वाले मेट्रिक्स** देते हैं, जिनसे तर्क, कोडिंग, भाषा समझ और छवि पहचान जैसे अलग-अलग कामों, क्षेत्रों और प्रदाताओं में मॉडल के प्रदर्शन की तुलना की जा सकती है।

***

## बेंचमार्क क्या हैं?

**बेंचमार्क** ऐसा डेटासेट या मूल्यांकन है जिसे किसी खास काम पर मॉडल का प्रदर्शन जाँचने के लिए बनाया गया है।
एक ही डेटासेट पर कई मॉडल चलाकर उनकी सापेक्ष खूबियों और कमियों को मापा जा सकता है।

आम उदाहरण:

* 🧠 **MMLU (Massive Multitask Language Understanding)** — सामान्य ज्ञान और तर्क क्षमता जाँचता है।
* 🔢 **GSM8K** — गणितीय तर्क और समस्या-समाधान जाँचता है।
* 💬 **HellaSwag** — सामान्य समझ और संदर्भ की समझ जाँचता है।
* 🧮 **ARC-Challenge** — वैज्ञानिक तर्क और लॉजिक मापता है।
* 💡 **HumanEval** — प्रोग्रामिंग और कोड जनरेशन कौशल का आकलन करता है।

***

## Phaseo बेंचमार्क को कैसे संभालता है

Phaseo **कई सार्वजनिक स्रोतों** और **आधिकारिक रिपोर्टों** से बेंचमार्क डेटा एकत्र करके उसे एक समान फ़ॉर्मेट में मानकीकृत करता है।

हर मॉडल के बेंचमार्क अनुभाग में ये जानकारी होती है:

* **स्कोर मान** — आमतौर पर प्रतिशत या सामान्यीकृत पैमाने में व्यक्त होता है।
* **डेटासेट स्रोत** — जैसे MMLU, GSM8K आदि।
* **मूल्यांकन विधि** — बताती है कि स्कोर कैसे प्राप्त किया गया (आधिकारिक रिपोर्ट, तृतीय-पक्ष मूल्यांकन या समुदाय का योगदान)।
* **अंतिम अपडेट** — बताता है कि बेंचमार्क डेटा आख़िरी बार कब रीफ़्रेश किया गया था।

***

## बेंचमार्क पेज का उदाहरण

***

## बेंचमार्क श्रेणियाँ

बेंचमार्क को जाँची जा रही क्षमता के अनुसार श्रेणियों में बाँटा गया है:

| श्रेणी | उदाहरण | विवरण |
| - | - | - |
| **तर्क** | MMLU, GSM8K, ARC | सामान्य तर्क, कई चरणों वाले विचार और समस्या-समाधान जाँचता है। |
| **भाषा की समझ** | HellaSwag, BoolQ, PIQA | पठन समझ, सामान्य ज्ञान और भाषाई क्षमता मापता है। |
| **कोड जनरेशन** | HumanEval, MBPP | प्रोग्रामिंग और कोड संश्लेषण की सटीकता का आकलन करता है। |
| **गणित और विज्ञान** | GSM8K, MATH, SciQ | संख्यात्मक और वैज्ञानिक तर्क पर केंद्रित है। |
| **मल्टीमोडल** | MathVista, MMMU | टेक्स्ट और दृश्य सामग्री को समझने वाले कार्यों को जोड़ता है। |

***

## स्कोर की व्याख्या कैसे करें

| मान की सीमा | व्याख्या |
| - | - |
| **90-100%** | असाधारण — अत्याधुनिक प्रदर्शन के करीब। |
| **80-89%** | बेहतरीन — अधिकांश प्रोडक्शन उपयोगों के लिए सक्षम। |
| **60-79%** | अच्छा — सामान्य कामों के लिए भरोसेमंद, लेकिन असामान्य मामलों में कठिनाई हो सकती है। |
| **\< 60%** | विकासशील — प्रयोगात्मक या शोध स्थितियों के लिए बेहतर। |

ध्यान रखें कि कुछ बेंचमार्क में **अलग-अलग स्कोरिंग सिस्टम** होते हैं।
तुलना को अधिक सार्थक बनाने के लिए Phaseo जहाँ संभव हो इन्हें सामान्यीकृत करता है।

***

## Phaseo पर बेंचमार्क को विज़ुअलाइज़ करना

बेंचमार्क नतीजों को इन तरीकों से दिखाया जाता है:

* 📊 एक ही डेटासेट के मॉडलों की तुलना के लिए **बार चार्ट**।
* 📈 समय के साथ मॉडल में सुधार दिखाने वाले **ट्रेंड चार्ट**।
* 🧮 कई डेटासेट में प्रदर्शन का सार देने वाले **कुल स्कोर**।

Phaseo के हर बेंचमार्क डेटासेट में ये फ़िल्टर होते हैं:

* मॉडल का प्रकार (chat, code, embedding आदि)
* प्रदाता
* रिलीज़ वर्ष
* डेटासेट की श्रेणी

इससे आप जल्दी पैटर्न पहचान सकते हैं—जैसे तर्क या कोडिंग टास्क में कौन से मॉडल परिवार आगे हैं।

***

## डेटा स्रोत और कार्यप्रणाली

Phaseo इन स्रोतों से बेंचमार्क डेटा एकत्र करता है:

* आधिकारिक शोध पत्र और मॉडल रिपोर्ट।
* प्रदाताओं के मूल्यांकन पेज (OpenAI Evals, Anthropic Reports आदि)।
* खुले समुदाय डेटासेट (जैसे Hugging Face लीडरबोर्ड)।
* GitHub के ज़रिए उपयोगकर्ताओं के सीधे सबमिशन।

प्रकाशित करने से पहले सभी डेटा को मानकीकृत और सत्यापित किया जाता है।
विस्तार के लिए [शोध और कार्यप्रणाली → बेंचमार्क कार्यप्रणाली](../research/benchmark-methodology.mdx) देखें।

***

## उपयोग के उदाहरण

| लक्ष्य | उदाहरण |
| - | - |
| तर्क मॉडल की तुलना करें | “GSM8K पर किस मॉडल का स्कोर सबसे अधिक है?” |
| लागत और प्रदर्शन के बीच संतुलन का मूल्यांकन करें | “क्या GPT-4o की अधिक लागत Claude 3.5 Sonnet की तुलना में उचित है?” |
| साल-दर-साल प्रगति ट्रैक करें | “2022 से MMLU की सटीकता में कितना सुधार हुआ है?” |
| श्रेणी के अनुसार बेंचमार्क का अध्ययन करें | “मल्टीमॉडल तर्क में कौन से मॉडल सबसे आगे हैं?” |

***

## बेंचमार्क डेटा में योगदान करें

नए या सुधारे गए बेंचमार्क स्कोर के प्रमाण के साथ GitHub पर इश्यू खोलें।
एकरूपता और सटीकता सुनिश्चित करने के लिए हर सबमिशन को शामिल करने से पहले जाँचा जाता है।

<Card title="बेंचमार्क डेटा में योगदान करें" icon="github" href="../research/submitting-scores.mdx" horizontal>
  जानें कि बेंचमार्क इश्यू में कौन से प्रमाण शामिल करने हैं।
</Card>

***

## अगले चरण

बेंचमार्क डेटा कैसे काम करता है, यह समझने के बाद आप उन **API प्रदाताओं** को देख सकते हैं जो प्रोग्राम के ज़रिए इन मॉडलों तक पहुँच देते हैं।

<Card title="API प्रदाता देखें" icon="network" href="./api-providers.mdx" horizontal>
  देखें कि मॉडल कहाँ और कैसे होस्ट किए जाते हैं, उनकी कीमत क्या है और उन तक पहुँच कैसे मिलती है।
</Card>


This documentation is built and hosted on [Mintlify](https://mintlify.com), a developer documentation platform.