Skip to main content
La quantification représente une moitié du comportement du modèle.
Les paramètres d’inférence en représentent l’autre moitié.

Paramètres principaux

Interactions à surveiller

  • temperature et top_p influent tous deux sur l’aléatoire. Ne modifiez qu’un paramètre à la fois pendant le réglage.
  • Une quantification agressive à faible nombre de bits combinée à un aléatoire élevé peut amplifier l’instabilité des réponses.
  • Une valeur faible de max_tokens peut donner l’impression d’un échec du modèle alors que la réponse est simplement tronquée.

Valeurs de départ recommandées

  • temperature : de 0.2 à 0.7, selon le niveau de créativité recherché
  • top_p : de 0.9 à 1.0
  • max_tokens : dimensionnez-le selon la longueur de sortie attendue, plutôt que d’utiliser une valeur énorme partout

Processus de réglage

  1. Réglez d’abord la quantification.
  2. Figez un jeu d’évaluation.
  3. Faites varier un paramètre à la fois.
  4. Comparez la qualité, la latence et l’utilisation des tokens.
  5. Utilisez des préréglages distincts par endpoint et par cas d’usage.
Dernière modification le 2 octobre 2026