Temperatur

Einsteiger

Wie Temperature die Wahrscheinlichkeiten und die Vielfalt gezogener Token verändert.

Zuletzt aktualisiert: 13. Sept. 2026

Was ist Temperatur?

In LLMs ist Temperatur ein Hyperparameter, der die "Logits" (Rohwerte) der nächsten Token-Vorhersagen skaliert, bevor sie in Wahrscheinlichkeiten umgewandelt werden. Er steuert im Wesentlichen, wie stark das Modell die wahrscheinlichsten Optionen gegenüber weniger wahrscheinlichen bevorzugt.

Niedrige Temperatur

Konzentriert Wahrscheinlichkeit auf hohe Logits. Die Auswahl variiert weniger; falsche Informationen werden dadurch nicht richtig.

Hohe Temperatur

Flacht die Verteilung ab und gibt Token mit niedrigeren Logits mehr Wahrscheinlichkeit. Der Einfluss auf Qualität hängt von Modell und Aufgabe ab.

🎛️

Interaktive Verteilung

Stelle die Temperatur ein, um den Effekt zu sehen

Vergleiche die berechnete Verteilung mit tatsächlichen Ziehungen aus fünf Beispiel-Logits. Bei einer anderen Temperature werden die alten Zähler geleert.

Fünf Beispiel-Token mit festen Logits [3, 2, 1, 0, -1]. Die Ziehungen stammen aus genau der angezeigten Verteilung. Die Übung misst die Auswahlhäufigkeit, nicht die Qualität ganzer Antworten.

Matte (3)63.6% · 0 / 0
Decke (2)23.4% · 0 / 0
Wiese (1)8.6% · 0 / 0
Treppe (0)3.2% · 0 / 0
Couch (-1)1.2% · 0 / 0

Violett: berechnete Wahrscheinlichkeit. Türkis: beobachteter Anteil der Ziehungen. Endliche Stichproben schwanken. Bei T = 0 verwenden wir Greedy Decoding.

Wie es mathematisch funktioniert

Das Modell generiert einen Score für jedes mögliche Token. Um Wahrscheinlichkeiten zu erhalten, verwenden wir die Softmax-Funktion, modifiziert durch die Temperatur:

P(xi)=ezi/T∑jezj/TP(x_i) = \frac{e^{z_i / T}}{\sum_{j} e^{z_j / T}}
Wenn T → 0Niedrig

Division durch ein kleines T verstärkt die Unterschiede zwischen den Scores. Der höchste Logit dominiert exponentiell.

lim⁡T→0P(xmax)=1\lim_{T \to 0} P(x_{\text{max}}) = 1
Wenn T → ∞Hoch

Division durch ein großes T komprimiert alle Scores gegen Null, wodurch sie nach der Exponentialfunktion nahezu gleich werden.

lim⁡T→∞P(xi)=1N\lim_{T \to \infty} P(x_i) = \frac{1}{N}

Praktische Richtlinien

Beginne mit der Empfehlung für dein konkretes Modell und deinen Modus. Vergleiche danach Einstellungen anhand derselben Aufgaben, Referenzantworten und mehrerer Läufe. Fakten brauchen Quellen, Code braucht Tests; Temperature ersetzt diese Prüfung nicht.

Beispiel: Qwen3 empfiehlt für Thinking T = 0,6 und warnt vor Greedy Decoding. Ein allgemeines Rezept wie "Mathe immer mit T = 0" wäre damit unpassend.

Qwen3-32B: Best practices

Wichtige Erkenntnisse

  • 1T = 0 wählt häufig Greedy Decoding. Wiederholte API-Aufrufe können wegen anderer Einflüsse trotzdem abweichen.
  • 2Temperature verändert die Verteilung, nicht das gespeicherte Modellwissen.
  • 3Es gibt keine universelle Temperature-Grenze für Wahrheit, Kreativität oder Unverständlichkeit.
  • 4Vergleiche Aufgabenergebnisse und beachte modellabhängige Empfehlungen, besonders für Reasoning-Modi.