Diese Anleitung erklärt gängige Präzisionsformate, die bei Modellvarianten und Inferenzlaufzeiten vorkommen.
Kurzreferenz
BF16 gegenüber FP16
BF16 behält einen größeren Exponentenbereich bei und sorgt dadurch für mehr Stabilität.
FP16 ist weiterhin verbreitet und oft schnell, kann bei manchen Workloads jedoch weniger stabil sein.
- In qualitätskritischen Produktionspfaden ist
BF16 meist die sicherere Standardeinstellung, sofern verfügbar.
FP8 und FP4
FP8 steigert die Effizienz meist deutlich und erhält für viele Aufgaben eine brauchbare Qualität.
FP4 steigert die Effizienz weiter, erhöht aber das Risiko von Qualitätseinbußen, besonders bei nuanciertem Reasoning, langen Kontexten und strikten strukturierten Ausgaben.
- Meist auf Inferenzdurchsatz und Speicherbedarf optimiert.
- Die Qualität hängt stark von Quantisierungsmethode, Kalibrierung und Modellarchitektur ab.
INT8 lässt sich in der Regel sicherer bereitstellen als INT4.
Modellbezeichnungen lesen
Mögliche Bezeichnungen sind beispielsweise:
bf16, fp16, fp8, int8, q4, 4bit, 8bit
Die Bezeichnungen sind nicht über alle Provider hinweg vollständig standardisiert. Prüfe genaue Varianten daher immer in der Modell- oder Provider-Dokumentation. Zuletzt geändert am 2. Oktober 2026