Mixture of Experts

Expertenniveau

Gelerntes Routing zwischen mehreren Feed-Forward-Netzen: Welche Parameter aktiv sind, welche gespeichert werden müssen und wo Aufwand entsteht.

Zuletzt aktualisiert: 13. Sept. 2026

Ein sparsamer MoE-Layer ersetzt einen dichten Feed-Forward-Block durch mehrere Expertenblöcke und einen Router. Der Router verarbeitet die aktuelle Token-Repräsentation dieses Layers und wählt eine Teilmenge aus. Ihre gewichteten Ausgaben liefern ein Update für den Residual Stream. Routing kann sich am nächsten Layer oder an der nächsten Position ändern; es wählt kein vollständiges Modell für den gesamten Prompt.

Eine aktuelle Repräsentation routen

Vier künstliche Experten, zwei Dimensionen, ein MoE-Layer. x ist die Hidden-Repräsentation eines bereits vorhandenen Tokens. Die festen Gewichte sind Beispiele ohne benannte Fachgebiete. Es wird kein zukünftiges Token an den Router übergeben.

E0

logit = [1.000, 0.200] · x = 0.720

softmax: 0.395

Mischgewicht: 0.500

[0.617, -0.508]

E1

logit = [-0.500, 1.000] · x = -0.800

softmax: 0.086

Mischgewicht: 0.000

Nicht ausgeführt

E2

logit = [0.400, -1.000] · x = 0.720

softmax: 0.395

Mischgewicht: 0.500

[0.565, 0.000]

E3

logit = [-0.700, -0.300] · x = -0.440

softmax: 0.124

Mischgewicht: 0.000

Nicht ausgeführt

Hier werden die Top-k-Softmaxwerte auf Summe 1 normiert. Nur ausgewählte Experten berechnen tanh(Mᵢx). Deren gewichtete Summe ergibt das FFN-Update dieser Position. Andere MoE-Rezepte nutzen andere Router-Normalisierungen.

Σᵢ gᵢ Eᵢ(x) = [0.591, -0.254]

Feste Expertenmatrizen Mᵢ ansehen
E0

[1.000, 0.200]

[-0.300, 0.800]

E1

[-0.500, 0.700]

[1.000, 0.200]

E2

[0.400, -0.800]

[0.500, 1.000]

E3

[0.800, 0.300]

[0.100, -0.700]

Routing und Spezialisierung

Top-k aktiviert pro Token nur wenige Experten. Ein Router kann mit zusätzlichen Balancing-Losses oder anderen Strategien trainiert werden, etwa dem biasbasierten Balancing von DeepSeek-V3. Experten können Spezialisierungsmuster entwickeln, sind aber keine zuverlässig beschrifteten Code-, Fakten- oder Grammatikmodule. Solche Zuordnungen brauchen gemessenes Routing.

Verfügbare Gewichte sind nicht gleich GPU-residente Gewichte

Alle Experten müssen irgendwo verfügbar sein. Sie müssen nicht vollständig im GPU-Speicher liegen: Implementierungen können Gewichte auf der CPU halten oder Daten zwischen Geräten bewegen. Vollständige GPU-Residenz kann Transfers vermeiden. Offloading tauscht Speicherplatzierung gegen Bandbreite und Latenz. Aktive Parameter allein bestimmen daher weder Gesamtspeicher noch End-to-End-Geschwindigkeit.

Top-k hält nicht jeden Aufwand konstant

Bei gleicher Expertengröße und gleichem k kann die ausgewählte Expertenrechnung ähnlich bleiben, wenn die Expertenzahl wächst. Routerarbeit, Gewichtsspeicher, Gerätekommunikation und ungleiche Auslastung können trotzdem zunehmen. Batchgröße und Token-Verteilung zählen mit, weil unterschiedliche Tokens verschiedene Experten aktivieren können.

Eine konkrete Referenz: Mixtral 8x7B

Das Mixtral-Paper (2024) beschreibt acht Feed-Forward-Experten pro Layer, von denen pro Token zwei ausgewählt werden. Es nennt 46,7B Gesamtparameter und 12,9B aktive Parameter pro Token. Das sind Eigenschaften dieser Architektur, keine allgemeine Formel für jedes Modell mit acht Experten.

Primärquellen

Zur dichten Feed-Forward-Rechnung →