Skip to main content
यह guide model variants और inference runtimes में दिखने वाले आम precision formats समझाती है।

त्वरित संदर्भ

BF16 बनाम FP16

  • BF16 बड़ा exponent range बनाए रखता है, जिससे stability बेहतर होती है।
  • FP16 अब भी आम और अक्सर तेज़ है, लेकिन कुछ workloads में कम stable हो सकता है।
  • Quality-critical production paths में उपलब्ध होने पर BF16 अक्सर अधिक सुरक्षित default है।

FP8 और FP4

  • FP8 आम तौर पर efficiency में अच्छा सुधार देता है और कई tasks के लिए उपयोगी quality बनाए रखता है।
  • FP4 efficiency को और बढ़ाता है, लेकिन quality degradation की आशंका भी बढ़ती है (खासकर nuanced reasoning, लंबे contexts और strict structured outputs में)。

पूर्णांक फ़ॉर्मैट (INT8 / INT4)

  • आम तौर पर inference throughput और memory के लिए optimize होते हैं।
  • Quality quantization method, calibration और model architecture पर काफ़ी निर्भर करती है।
  • आम तौर पर INT8, INT4 की तुलना में सुरक्षित रूप से deploy करना आसान है।

मॉडल लेबल पढ़ें

आपको इस तरह के labels दिख सकते हैं:
  • bf16, fp16, fp8, int8, q4, 4bit, 8bit
Providers के बीच naming पूरी तरह standardized नहीं है। Variant के सटीक विवरण की पुष्टि हमेशा model/provider documentation में करें।
अंतिम संशोधन 2 अक्टूबर 2026