Vom Score zum nächsten Token
Zwei Schritte mit je fünf lesbaren Beispiel-Token und frei gesetzten Logits. Die Wahrscheinlichkeiten werden tatsächlich berechnet. Es läuft kein trainiertes Sprachmodell; die zweite Verteilung ist ebenfalls vorgegeben.
Bisheriger Kontext
Die Katze schläft auf der ▌
Softmax: exp(logit / T), geteilt durch die Summe. Top-p behält die wahrscheinlichsten Token bis mindestens p und normiert erneut.
| Token | Logit | Softmax | Top-p |
|---|---|---|---|
| Matte | 3.2 | 52,1% | 57,4% |
| Decke | 2.5 | 25,9% | 28,5% |
| Wiese | 1.8 | 12,8% | 14,1% |
| Treppe | 1.1 | 6,4% | 0% |
| Couch | 0.3 | 2,9% | 0% |
Aus einer gemeinsamen Verteilung ziehen
u ist eine Zahl zwischen 0 und 1. Das Intervall, in das u fällt, bestimmt das Token. Du kannst dieselbe Zahl für Vergleiche behalten oder neu ziehen.
Auswahl: Decke · Intervall (Grenzen gerundet) ≈ [0.574, 0.859)
Logits über das Vokabular
Am Ende des Netzwerks wird der finale Hidden-Vektor auf einen Score pro Token im Vokabular projiziert. Diese rohen Scores heißen Logits.
- Ein Logit ist kein Wort, sondern ein Score für eine Token-ID.
- Softmax verwandelt Logits in eine Wahrscheinlichkeitsverteilung über nächste Tokens.
Decoding-Entscheidungen
Generierung hängt davon ab, wie das Modell aus diesen Wahrscheinlichkeiten auswählt. Greedy Decoding nimmt das Top-Token, Sampling bringt kontrollierte Zufälligkeit hinein.
- Temperature formt die Verteilung um.
- Top-k behält nur die k wahrscheinlichsten Tokens.
- Top-p behält die kleinste Menge der wahrscheinlichsten Token mit insgesamt mindestens p Wahrscheinlichkeitsmasse.
Die Generierungsschleife
Das gewählte Token wird an den Kontext gehängt. Das Modell läuft erneut, sagt das nächste Token voraus, hängt es an und wiederholt das.
- Training kann viele Positionen parallel mit Causal Masking vorhersagen.
- Inference ist sequenziell, weil jedes neue Token vom vorherigen abhängt.
- Hohe Wahrscheinlichkeit heißt plausible Fortsetzung, nicht Wahrheit.
Kernaussagen
- LLMs geben Next-Token-Wahrscheinlichkeiten aus, keine direkten Wahrheitsbehauptungen.
- Die Decoding-Strategie verändert Stil, Determinismus und Fehlerprofil.
- Text entsteht durch wiederholtes predict → choose → append.