Skip to main content
Diese Anleitung erklärt gängige Präzisionsformate, die bei Modellvarianten und Inferenzlaufzeiten vorkommen.

Kurzreferenz

BF16 gegenüber FP16

  • BF16 behält einen größeren Exponentenbereich bei und sorgt dadurch für mehr Stabilität.
  • FP16 ist weiterhin verbreitet und oft schnell, kann bei manchen Workloads jedoch weniger stabil sein.
  • In qualitätskritischen Produktionspfaden ist BF16 meist die sicherere Standardeinstellung, sofern verfügbar.

FP8 und FP4

  • FP8 steigert die Effizienz meist deutlich und erhält für viele Aufgaben eine brauchbare Qualität.
  • FP4 steigert die Effizienz weiter, erhöht aber das Risiko von Qualitätseinbußen, besonders bei nuanciertem Reasoning, langen Kontexten und strikten strukturierten Ausgaben.

Ganzzahlige Formate (INT8 / INT4)

  • Meist auf Inferenzdurchsatz und Speicherbedarf optimiert.
  • Die Qualität hängt stark von Quantisierungsmethode, Kalibrierung und Modellarchitektur ab.
  • INT8 lässt sich in der Regel sicherer bereitstellen als INT4.

Modellbezeichnungen lesen

Mögliche Bezeichnungen sind beispielsweise:
  • bf16, fp16, fp8, int8, q4, 4bit, 8bit
Die Bezeichnungen sind nicht über alle Provider hinweg vollständig standardisiert. Prüfe genaue Varianten daher immer in der Modell- oder Provider-Dokumentation.
Zuletzt geändert am 2. Oktober 2026