Ein sparsamer MoE-Layer ersetzt einen dichten Feed-Forward-Block durch mehrere Expertenblöcke und einen Router. Der Router verarbeitet die aktuelle Token-Repräsentation dieses Layers und wählt eine Teilmenge aus. Ihre gewichteten Ausgaben liefern ein Update für den Residual Stream. Routing kann sich am nächsten Layer oder an der nächsten Position ändern; es wählt kein vollständiges Modell für den gesamten Prompt.
Eine aktuelle Repräsentation routen
Vier künstliche Experten, zwei Dimensionen, ein MoE-Layer. x ist die Hidden-Repräsentation eines bereits vorhandenen Tokens. Die festen Gewichte sind Beispiele ohne benannte Fachgebiete. Es wird kein zukünftiges Token an den Router übergeben.
E0
logit = [1.000, 0.200] · x = 0.720
softmax: 0.395
Mischgewicht: 0.500
[0.617, -0.508]
E1
logit = [-0.500, 1.000] · x = -0.800
softmax: 0.086
Mischgewicht: 0.000
Nicht ausgeführt
E2
logit = [0.400, -1.000] · x = 0.720
softmax: 0.395
Mischgewicht: 0.500
[0.565, 0.000]
E3
logit = [-0.700, -0.300] · x = -0.440
softmax: 0.124
Mischgewicht: 0.000
Nicht ausgeführt
Hier werden die Top-k-Softmaxwerte auf Summe 1 normiert. Nur ausgewählte Experten berechnen tanh(Mᵢx). Deren gewichtete Summe ergibt das FFN-Update dieser Position. Andere MoE-Rezepte nutzen andere Router-Normalisierungen.
Σᵢ gᵢ Eᵢ(x) = [0.591, -0.254]
Feste Expertenmatrizen Mᵢ ansehen
[1.000, 0.200]
[-0.300, 0.800]
[-0.500, 0.700]
[1.000, 0.200]
[0.400, -0.800]
[0.500, 1.000]
[0.800, 0.300]
[0.100, -0.700]
Routing und Spezialisierung
Top-k aktiviert pro Token nur wenige Experten. Ein Router kann mit zusätzlichen Balancing-Losses oder anderen Strategien trainiert werden, etwa dem biasbasierten Balancing von DeepSeek-V3. Experten können Spezialisierungsmuster entwickeln, sind aber keine zuverlässig beschrifteten Code-, Fakten- oder Grammatikmodule. Solche Zuordnungen brauchen gemessenes Routing.
Verfügbare Gewichte sind nicht gleich GPU-residente Gewichte
Alle Experten müssen irgendwo verfügbar sein. Sie müssen nicht vollständig im GPU-Speicher liegen: Implementierungen können Gewichte auf der CPU halten oder Daten zwischen Geräten bewegen. Vollständige GPU-Residenz kann Transfers vermeiden. Offloading tauscht Speicherplatzierung gegen Bandbreite und Latenz. Aktive Parameter allein bestimmen daher weder Gesamtspeicher noch End-to-End-Geschwindigkeit.
Top-k hält nicht jeden Aufwand konstant
Bei gleicher Expertengröße und gleichem k kann die ausgewählte Expertenrechnung ähnlich bleiben, wenn die Expertenzahl wächst. Routerarbeit, Gewichtsspeicher, Gerätekommunikation und ungleiche Auslastung können trotzdem zunehmen. Batchgröße und Token-Verteilung zählen mit, weil unterschiedliche Tokens verschiedene Experten aktivieren können.
Eine konkrete Referenz: Mixtral 8x7B
Das Mixtral-Paper (2024) beschreibt acht Feed-Forward-Experten pro Layer, von denen pro Token zwei ausgewählt werden. Es nennt 46,7B Gesamtparameter und 12,9B aktive Parameter pro Token. Das sind Eigenschaften dieser Architektur, keine allgemeine Formel für jedes Modell mit acht Experten.