Skip to main content
Ce guide présente les formats de précision courants dans les variantes de modèles et les environnements d’inférence.

Référence rapide

BF16 ou FP16

  • BF16 conserve une plage d’exposants plus étendue, ce qui améliore la stabilité.
  • FP16 reste courant et souvent rapide, mais peut être moins stable pour certaines charges de travail.
  • Pour les traitements de production où la qualité est critique, BF16 est souvent le choix par défaut le plus sûr lorsqu’il est disponible.

FP8 et FP4

  • FP8 offre généralement un gain d’efficacité important tout en conservant une qualité exploitable pour de nombreuses tâches.
  • FP4 améliore encore l’efficacité, mais le risque de dégradation augmente, notamment pour le raisonnement nuancé, les longs contextes et les sorties structurées strictes.

Formats entiers (INT8 / INT4)

  • Généralement optimisés pour le débit d’inférence et l’utilisation mémoire.
  • La qualité dépend fortement de la méthode de quantification, de l’étalonnage et de l’architecture du modèle.
  • En général, INT8 est plus facile à déployer en toute sécurité que INT4.

Lire les libellés des modèles

Vous pouvez rencontrer des libellés comme :
  • bf16, fp16, fp8, int8, q4, 4bit, 8bit
La nomenclature n’est pas entièrement normalisée entre les fournisseurs. Vérifiez toujours les détails précis de chaque variante dans la documentation du modèle ou du fournisseur.
Dernière modification le 2 octobre 2026