यह guide model variants और inference runtimes में दिखने वाले आम precision formats समझाती है।
त्वरित संदर्भ
BF16 बनाम FP16
BF16 बड़ा exponent range बनाए रखता है, जिससे stability बेहतर होती है।
FP16 अब भी आम और अक्सर तेज़ है, लेकिन कुछ workloads में कम stable हो सकता है।
- Quality-critical production paths में उपलब्ध होने पर
BF16 अक्सर अधिक सुरक्षित default है।
FP8 और FP4
FP8 आम तौर पर efficiency में अच्छा सुधार देता है और कई tasks के लिए उपयोगी quality बनाए रखता है।
FP4 efficiency को और बढ़ाता है, लेकिन quality degradation की आशंका भी बढ़ती है (खासकर nuanced reasoning, लंबे contexts और strict structured outputs में)。
पूर्णांक फ़ॉर्मैट (INT8 / INT4)
- आम तौर पर inference throughput और memory के लिए optimize होते हैं।
- Quality quantization method, calibration और model architecture पर काफ़ी निर्भर करती है।
- आम तौर पर
INT8, INT4 की तुलना में सुरक्षित रूप से deploy करना आसान है।
मॉडल लेबल पढ़ें
आपको इस तरह के labels दिख सकते हैं:
bf16, fp16, fp8, int8, q4, 4bit, 8bit
Providers के बीच naming पूरी तरह standardized नहीं है। Variant के सटीक विवरण की पुष्टि हमेशा model/provider documentation में करें। अंतिम संशोधन 2 अक्टूबर 2026