Los parámetros de inferencia son la otra mitad.
Parámetros principales
Interacciones que conviene vigilar
temperatureytop_pafectan a la aleatoriedad. Cambia un parámetro cada vez al ajustar el resultado.- La cuantización agresiva a pocos bits junto con una aleatoriedad alta puede aumentar la inestabilidad de la salida.
- Un valor bajo de
max_tokenspuede parecer un fallo del modelo cuando solo se ha truncado la respuesta.
Valores iniciales recomendados
temperature: entre0.2y0.7, según el nivel de creatividad que necesitestop_p: entre0.9y1.0max_tokens: ajústalo a la longitud esperada de la respuesta; evita un valor enorme para todos los casos
Flujo de ajuste
- Ajusta primero la cuantización.
- Fija un conjunto de evaluación.
- Varía un parámetro cada vez.
- Compara la calidad, la latencia y el uso de tokens.
- Mantén preajustes distintos para cada endpoint o caso de uso.