Skip to main content
Quantisierung ist eine Hälfte des Modellverhaltens.
Inferenzparameter sind die andere Hälfte.

Zentrale Parameter

Zu beachtende Wechselwirkungen

  • Sowohl temperature als auch top_p beeinflussen die Zufälligkeit. Ändere beim Abstimmen jeweils nur einen Wert.
  • Aggressive Quantisierung mit wenigen Bits und hohe Zufälligkeit können die Instabilität der Ausgabe verstärken.
  • Ein niedriger Wert für max_tokens kann wie ein Modellfehler wirken, obwohl die Antwort nur abgeschnitten wurde.

Empfohlene Ausgangswerte

  • temperature: 0.2 bis 0.7, je nach gewünschter Kreativität
  • top_p: 0.9 bis 1.0
  • max_tokens: passend zur erwarteten Ausgabelänge statt als pauschal sehr hoher Wert

Abstimmungsablauf

  1. Lege zuerst die Quantisierung fest.
  2. Fixiere einen Evaluierungssatz.
  3. Variiere jeweils nur einen Parameter.
  4. Vergleiche Qualität, Latenz und Token-Verbrauch.
  5. Verwende getrennte Presets für unterschiedliche Endpoints und Anwendungsfälle.
Zuletzt geändert am 2. Oktober 2026