Os parâmetros de inferência são a outra metade.
Parâmetros principais
Interações a observar
temperatureetop_pafetam a aleatoriedade. Altere um parâmetro por vez durante o ajuste.- A quantização agressiva com poucos bits, combinada com alta aleatoriedade, pode aumentar a instabilidade da saída.
- Um valor baixo de
max_tokenspode parecer uma falha do modelo quando a resposta foi apenas truncada.
Valores iniciais recomendados
temperature: de0.2a0.7, conforme a criatividade necessáriatop_p: de0.9a1.0max_tokens: dimensione conforme o tamanho esperado da resposta, em vez de usar um valor enorme para tudo
Fluxo de ajuste
- Ajuste primeiro a quantização.
- Fixe um conjunto de avaliação.
- Varie um parâmetro por vez.
- Compare qualidade, latência e uso de tokens.
- Mantenha predefinições separadas por endpoint e caso de uso.