Residual Stream & LayerNorm

Fortgeschritten

Der laufende Arbeitsbereich, aus dem Transformer-Schichten lesen und in den sie schreiben, plus Normalisierung für trainierbare tiefe Stacks.

Zuletzt aktualisiert: 13. Sept. 2026

Residual Stream & LayerNorm

Der laufende Arbeitsbereich, aus dem Transformer-Schichten lesen und in den sie schreiben, plus Normalisierung für trainierbare tiefe Stacks.

Den Residualpfad nachrechnen

Ein Spielzeugblock mit vier Dimensionen und festen Gewichten. Die Vektoren werden tatsächlich berechnet; Trainingsstabilität wird hier nicht simuliert. Die Kanäle haben keine festgelegte sprachliche Bedeutung.

y = x + F(Norm(x))

x0123
Residual-Eingabe x1.000-1.0002.0000.000
Eingabe von F0.447-1.3421.342-0.447
Zweig-Update F-0.107-0.3060.468-0.107
Residualsumme0.893-1.3062.468-0.107
Blockausgabe0.893-1.3062.468-0.107

Vektor vor der Normalisierung: Mittelwert = 0.500; Varianz = 1.250.

LayerNorm zieht den Kanalmittelwert ab und teilt durch √(Varianz + ε). Hier gilt γ = 1, β = 0 und ε = 0,00001.

F(v)ᵢ = Stärke × tanh(0,6vᵢ + 0,3v₍ᵢ₊₁₎ mod 4). Dieser feste Beispielzweig steht für Attention oder ein MLP.

Pre-Norm erhält einen direkten Residualpfad um die Normalisierung. Post-Norm normalisiert die Residualsumme. Das Trainingsverhalten hängt von Initialisierung, Tiefe und Optimierung ab; diese Zahlen belegen keine allgemeine Überlegenheit.

Schichten addieren Updates

Eine Transformer-Schicht ersetzt die Token-Repräsentation nicht komplett. Attention- und MLP-Blöcke berechnen Updates, die zum gemeinsamen Residual Stream addiert werden.

  • Der Residual Stream trägt die aktuelle Repräsentation für jedes Token.
  • Jeder Block liest daraus, berechnet ein Update und schreibt per Addition zurück.

Warum Residual Connections wichtig sind

Residual Connections machen sehr tiefe Netze trainierbarer, weil Gradienten und Information durch viele Schichten fließen können, ohne dass jeder Block alles perfekt erhalten muss.

  • Darum können Transformer-Stacks dutzende oder hunderte Schichten tief sein.
  • Der Stream ist ein Vektor-Arbeitsbereich, keine wörtliche Datenbank.

LayerNorm und Pre-Norm

Layer Normalization hält Aktivierungen in einem stabilen Bereich. Moderne decoder-only LLMs nutzen oft Pre-Norm: erst normalisieren, dann Attention oder MLP, danach residual addieren.

  • Pre-Norm verbessert Trainingsstabilität in tiefen Modellen.
  • Modellfamilien unterscheiden sich in Details, etwa RMSNorm.

Kernaussagen

  • Der Residual Stream ist der laufende Vektor-Arbeitsbereich des Modells.
  • Transformer-Blöcke addieren Updates, statt Repräsentationen zu ersetzen.
  • LayerNorm/RMSNorm hält tiefe Stacks numerisch stabil.