Les paramètres d’inférence en représentent l’autre moitié.
Paramètres principaux
Interactions à surveiller
temperatureettop_pinfluent tous deux sur l’aléatoire. Ne modifiez qu’un paramètre à la fois pendant le réglage.- Une quantification agressive à faible nombre de bits combinée à un aléatoire élevé peut amplifier l’instabilité des réponses.
- Une valeur faible de
max_tokenspeut donner l’impression d’un échec du modèle alors que la réponse est simplement tronquée.
Valeurs de départ recommandées
temperature: de0.2à0.7, selon le niveau de créativité recherchétop_p: de0.9à1.0max_tokens: dimensionnez-le selon la longueur de sortie attendue, plutôt que d’utiliser une valeur énorme partout
Processus de réglage
- Réglez d’abord la quantification.
- Figez un jeu d’évaluation.
- Faites varier un paramètre à la fois.
- Comparez la qualité, la latence et l’utilisation des tokens.
- Utilisez des préréglages distincts par endpoint et par cas d’usage.