Feed-Forward Networks

Fortgeschritten

Wie ein Token-Vektor expandiert, eine Nichtlinearität durchläuft und auf Modellbreite zurückprojiziert wird.

Zuletzt aktualisiert: 13. Sept. 2026

Feed-Forward Networks

Wie ein Token-Vektor expandiert, eine Nichtlinearität durchläuft und auf Modellbreite zurückprojiziert wird.

Ein Token durch einen Feed-Forward-Block

Eine echte 2 → 4 → 2-Rechnung mit festen Beispielgewichten ohne Bias. Dieselbe Funktion wird unabhängig auf jedes Token angewendet. Dieser Block mischt keine Tokens.

Expandierter Vektor xWup

[0.650, -0.900, 0.840, -0.190]

Nach Aktivierung / Gate

[0.482, -0.166, 0.672, -0.081]

Ausgabe-Update

[-0.160, -0.144]

Feste Matrizen ansehen (Zeilenvektoren)

Wup

[1.000, -0.500, 0.800, 0.200]

[0.300, 1.000, -0.400, 0.700]

Wgate

[0.500, 1.000, -1.000, 0.200]

[1.000, -0.200, 0.400, 0.800]

Wdown

[0.500, -0.200]

[0.300, 0.400]

[-0.500, 0.100]

[0.200, 0.600]

GELU nutzt die übliche tanh-Näherung. SwiGLU berechnet hier SiLU(xWgate) ⊙ (xWup), danach Wdown. Echte Modelle lernen diese Matrizen; breitere Aktivierungen haben keine fest zugewiesenen Bedeutungen.

Das tokenweise MLP

Nachdem Attention Informationen zwischen Tokens mischt, verarbeitet das Feed-Forward Network jedes Token unabhängig. Es expandiert den Hidden-Vektor, wendet eine Nichtlinearität an und komprimiert zurück.

  • Expansion schafft Platz für viele Features.
  • Die Nichtlinearität verhindert, dass alles zu einer linearen Abbildung kollabiert.
  • Die Kompression schreibt ein nützliches Update zurück auf Modellbreite.
  • Viele Parameter stecken in diesen Blöcken; Fakten- und Bedeutungsstrukturen sind über Gewichte und Aktivierungen verteilt, nicht in einer sauberen Lookup-Tabelle.

GELU, SwiGLU und Gates

Moderne LLMs nutzen oft gated Activations wie SwiGLU. Ein gelernter Pfad steuert einen anderen und entscheidet, welche Features durchkommen.

  • Der originale Transformer nutzte einfachere Aktivierungen wie ReLU.
  • Viele GPT-Ära-Modelle nutzten GELU.
  • LLaMA-artige Modelle nutzen häufig SwiGLU-Varianten.
Vertiefung: Wie MoE mehrere FFNs pro Layer auswählt →

Kernaussagen

  • FFNs verarbeiten Tokens unabhängig, nachdem Attention Kontext gemischt hat.
  • SwiGLU-artige gated MLPs sind in modernen LLMs verbreitet.
  • MoE ist viele MLP-Experts plus gelerntes Routing, keine magischen Themen-Schubladen.