Skip to main content
A quantização é uma metade do comportamento do modelo.
Os parâmetros de inferência são a outra metade.

Parâmetros principais

Interações a observar

  • temperature e top_p afetam a aleatoriedade. Altere um parâmetro por vez durante o ajuste.
  • A quantização agressiva com poucos bits, combinada com alta aleatoriedade, pode aumentar a instabilidade da saída.
  • Um valor baixo de max_tokens pode parecer uma falha do modelo quando a resposta foi apenas truncada.

Valores iniciais recomendados

  • temperature: de 0.2 a 0.7, conforme a criatividade necessária
  • top_p: de 0.9 a 1.0
  • max_tokens: dimensione conforme o tamanho esperado da resposta, em vez de usar um valor enorme para tudo

Fluxo de ajuste

  1. Ajuste primeiro a quantização.
  2. Fixe um conjunto de avaliação.
  3. Varie um parâmetro por vez.
  4. Compare qualidade, latência e uso de tokens.
  5. Mantenha predefinições separadas por endpoint e caso de uso.
Última modificação em 2 de outubro de 2026