Inferenzparameter sind die andere Hälfte.
Zentrale Parameter
Zu beachtende Wechselwirkungen
- Sowohl
temperatureals auchtop_pbeeinflussen die Zufälligkeit. Ändere beim Abstimmen jeweils nur einen Wert. - Aggressive Quantisierung mit wenigen Bits und hohe Zufälligkeit können die Instabilität der Ausgabe verstärken.
- Ein niedriger Wert für
max_tokenskann wie ein Modellfehler wirken, obwohl die Antwort nur abgeschnitten wurde.
Empfohlene Ausgangswerte
temperature:0.2bis0.7, je nach gewünschter Kreativitättop_p:0.9bis1.0max_tokens: passend zur erwarteten Ausgabelänge statt als pauschal sehr hoher Wert
Abstimmungsablauf
- Lege zuerst die Quantisierung fest.
- Fixiere einen Evaluierungssatz.
- Variiere jeweils nur einen Parameter.
- Vergleiche Qualität, Latenz und Token-Verbrauch.
- Verwende getrennte Presets für unterschiedliche Endpoints und Anwendungsfälle.