Residual Stream & LayerNorm
Der laufende Arbeitsbereich, aus dem Transformer-Schichten lesen und in den sie schreiben, plus Normalisierung für trainierbare tiefe Stacks.
Den Residualpfad nachrechnen
Ein Spielzeugblock mit vier Dimensionen und festen Gewichten. Die Vektoren werden tatsächlich berechnet; Trainingsstabilität wird hier nicht simuliert. Die Kanäle haben keine festgelegte sprachliche Bedeutung.
y = x + F(Norm(x))
| x | 0 | 1 | 2 | 3 |
|---|---|---|---|---|
| Residual-Eingabe x | 1.000 | -1.000 | 2.000 | 0.000 |
| Eingabe von F | 0.447 | -1.342 | 1.342 | -0.447 |
| Zweig-Update F | -0.107 | -0.306 | 0.468 | -0.107 |
| Residualsumme | 0.893 | -1.306 | 2.468 | -0.107 |
| Blockausgabe | 0.893 | -1.306 | 2.468 | -0.107 |
Vektor vor der Normalisierung: Mittelwert = 0.500; Varianz = 1.250.
LayerNorm zieht den Kanalmittelwert ab und teilt durch √(Varianz + ε). Hier gilt γ = 1, β = 0 und ε = 0,00001.
F(v)ᵢ = Stärke × tanh(0,6vᵢ + 0,3v₍ᵢ₊₁₎ mod 4). Dieser feste Beispielzweig steht für Attention oder ein MLP.
Pre-Norm erhält einen direkten Residualpfad um die Normalisierung. Post-Norm normalisiert die Residualsumme. Das Trainingsverhalten hängt von Initialisierung, Tiefe und Optimierung ab; diese Zahlen belegen keine allgemeine Überlegenheit.
Schichten addieren Updates
Eine Transformer-Schicht ersetzt die Token-Repräsentation nicht komplett. Attention- und MLP-Blöcke berechnen Updates, die zum gemeinsamen Residual Stream addiert werden.
- Der Residual Stream trägt die aktuelle Repräsentation für jedes Token.
- Jeder Block liest daraus, berechnet ein Update und schreibt per Addition zurück.
Warum Residual Connections wichtig sind
Residual Connections machen sehr tiefe Netze trainierbarer, weil Gradienten und Information durch viele Schichten fließen können, ohne dass jeder Block alles perfekt erhalten muss.
- Darum können Transformer-Stacks dutzende oder hunderte Schichten tief sein.
- Der Stream ist ein Vektor-Arbeitsbereich, keine wörtliche Datenbank.
LayerNorm und Pre-Norm
Layer Normalization hält Aktivierungen in einem stabilen Bereich. Moderne decoder-only LLMs nutzen oft Pre-Norm: erst normalisieren, dann Attention oder MLP, danach residual addieren.
- Pre-Norm verbessert Trainingsstabilität in tiefen Modellen.
- Modellfamilien unterscheiden sich in Details, etwa RMSNorm.
Kernaussagen
- Der Residual Stream ist der laufende Vektor-Arbeitsbereich des Modells.
- Transformer-Blöcke addieren Updates, statt Repräsentationen zu ersetzen.
- LayerNorm/RMSNorm hält tiefe Stacks numerisch stabil.