Next-Token Prediction

Einsteiger

Was ein LLM tatsächlich ausgibt: Logits über das Vokabular, die Token für Token zu Text decodiert werden.

Zuletzt aktualisiert: 13. Sept. 2026

Vom Score zum nächsten Token

Zwei Schritte mit je fünf lesbaren Beispiel-Token und frei gesetzten Logits. Die Wahrscheinlichkeiten werden tatsächlich berechnet. Es läuft kein trainiertes Sprachmodell; die zweite Verteilung ist ebenfalls vorgegeben.

Bisheriger Kontext

Die Katze schläft auf der ▌

Softmax: exp(logit / T), geteilt durch die Summe. Top-p behält die wahrscheinlichsten Token bis mindestens p und normiert erneut.

Schritt 1: Logits → Softmax → Top-p
TokenLogitSoftmaxTop-p
Matte3.252,1%57,4%
Decke2.525,9%28,5%
Wiese1.812,8%14,1%
Treppe1.16,4%0%
Couch0.32,9%0%

Aus einer gemeinsamen Verteilung ziehen

u ist eine Zahl zwischen 0 und 1. Das Intervall, in das u fällt, bestimmt das Token. Du kannst dieselbe Zahl für Vergleiche behalten oder neu ziehen.

u
01

Auswahl: Decke · Intervall (Grenzen gerundet) ≈ [0.574, 0.859)

Logits über das Vokabular

Am Ende des Netzwerks wird der finale Hidden-Vektor auf einen Score pro Token im Vokabular projiziert. Diese rohen Scores heißen Logits.

  • Ein Logit ist kein Wort, sondern ein Score für eine Token-ID.
  • Softmax verwandelt Logits in eine Wahrscheinlichkeitsverteilung über nächste Tokens.

Decoding-Entscheidungen

Generierung hängt davon ab, wie das Modell aus diesen Wahrscheinlichkeiten auswählt. Greedy Decoding nimmt das Top-Token, Sampling bringt kontrollierte Zufälligkeit hinein.

  • Temperature formt die Verteilung um.
  • Top-k behält nur die k wahrscheinlichsten Tokens.
  • Top-p behält die kleinste Menge der wahrscheinlichsten Token mit insgesamt mindestens p Wahrscheinlichkeitsmasse.

Die Generierungsschleife

Das gewählte Token wird an den Kontext gehängt. Das Modell läuft erneut, sagt das nächste Token voraus, hängt es an und wiederholt das.

  • Training kann viele Positionen parallel mit Causal Masking vorhersagen.
  • Inference ist sequenziell, weil jedes neue Token vom vorherigen abhängt.
  • Hohe Wahrscheinlichkeit heißt plausible Fortsetzung, nicht Wahrheit.

Kernaussagen

  • LLMs geben Next-Token-Wahrscheinlichkeiten aus, keine direkten Wahrheitsbehauptungen.
  • Die Decoding-Strategie verändert Stil, Determinismus und Fehlerprofil.
  • Text entsteht durch wiederholtes predict → choose → append.