Was ist Multi-Token Prediction?
Klassisches Sprachmodell-Training lässt das Modell nur das nächste Token vorhersagen. Multi-Token Prediction ergänzt Hilfsköpfe oder Ziele für mehrere nächste Tokens, sodass das Modell nicht nur den unmittelbaren nächsten Schritt lernt, sondern auch, wie sich die nahe Zukunft entfaltet.
Standard-LM: x[t+1] vorhersagen. MTP: x[t+1], x[t+2], x[t+3] ... x[t+k] vorhersagen.
Warum das wichtig ist
Dichteres Lernsignal
Jede Trainingsposition liefert mehrere zukünftige Zielwerte. Dadurch können knappe oder teure Trainingstokens mehr lehren als nur ein einzelnes Next-Token-Label.
Besseres Zukunftsbewusstsein
Mehrere Schritte vorauszusagen zwingt die Repräsentation, Struktur zu kodieren, die über das unmittelbar nächste Wort hinaus Bestand hat.
Neue Decoding-Möglichkeiten
Wenn das Modell bereits Zukunfts-Token-Köpfe besitzt, können Systeme Blockgenerierung, Verifikation und spekulative Decoding-Varianten ausnutzen.
Next-Token vs. Multi-Token Learning
Next-Token-Ziel
Input: Die Hauptstadt von Frankreich ist
→ Paris
Multi-Token-Ziel
Input: Die Hauptstadt von Frankreich ist
→ Paris · und · sie · ist
Das Modell konsumiert weiterhin denselben Prefix, aber die Loss-Funktion stellt mehr Fragen zur Fortsetzung. In der Praxis teilen Implementierungen oft den Transformer-Rumpf und ergänzen mehrere leichte Vorhersageköpfe oder trainieren mit verschobenen Zielen für mehrere Zukunftsoffsets.
Kleiner Loss-Visualizer
Dieses Beispiel summiert Cross-Entropy über drei zukünftige Ziele. Gleiche Gewichte entsprechen dem grundlegenden Multi-Head-Beispiel; die optional abnehmenden Gewichte sind eine bewusst gewählte Alternative, keine Definition von MTP.
Spielmodell: Die Regler setzen die Wahrscheinlichkeit des richtigen Tokens an drei zukünftigen Positionen. Berechnet wird die Summe ihrer gewichteten Cross-Entropy-Terme in Nats. Kein Sprachmodell wird ausgeführt.
−λ log(p) = 0.357
−λ log(p) = 0.916
−λ log(p) = 1.609
L = 2.882 nats
Balkenskala: 0 bis −log(0,01), für alle Positionen gleich. Das MTP-Paper von Gloeckle et al. summiert die Kopfverluste gleichgewichtet. Andere Architekturen wie DeepSeek-V3 verwenden eigene MTP-Module und Lossgewichte.
Wie es meist implementiert wird
Geteilter Rumpf
Der Transformer-Body erzeugt für jede Position einen Hidden State, genau wie bei einem normalen Sprachmodell.
Mehrere Zukunftsköpfe
Zusätzliche Köpfe sagen Token t+2, t+3 und so weiter voraus. Ihre Verluste werden mit dem normalen Next-Token-Loss kombiniert.
Gewichtetes Ziel
Lossgewichte und Abhängigkeiten zwischen Vorhersageköpfen sind architekturspezifisch. Das konkrete Ziel im jeweiligen Paper vergleichen, statt abnehmende Gewichte für spätere Positionen vorauszusetzen.
MTP vs. spekulatives Decoding
Spekulatives Decoding
Ein Inferenz-Trick: Ein kleineres Draft-Modell schlägt Tokens vor, ein größeres Modell verifiziert sie. Das kann Serving beschleunigen, ohne das Training des großen Modells zu ändern.
Multi-Token Prediction
Ein Trainingsziel: Das Modell selbst lernt, mehrere Zukunftsoffsets vorherzusagen. Das kann Block-Inferenz ermöglichen, aber nur wenn die Runtime diese Köpfe auch nutzt.
Vorteile
- Mehr Supervision pro Kontext-Token im Training.
- Repräsentationen können weniger kurzsichtig und stärker sequenzbewusst werden.
- Passt gut zu Blockgenerierung und Verifikationsmethoden.
Einschränkungen
- Zusätzliche Köpfe und Losses erhöhen Trainingskomplexität und Tuning-Aufwand.
- Weiter entfernte Tokens sind schwerer und verrauschter vorherzusagen; Loss-Gewichtung ist wichtig.
- MTP macht Inferenz nicht automatisch schneller, solange der Serving-Stack es nicht nutzt.
Wo das auftaucht
Aktuelle Frontier-Model-Paper und Open-Model-Reports diskutieren MTP-artige Ziele als Weg, Trainingssignale dichter zu machen und Generierungsverhalten zu verbessern. Die Implementierungsdetails unterscheiden sich, also behandle MTP eher als Familie von Zielen, nicht als eine feste Architektur.
Wichtigste Punkte
- 1MTP erweitert das Next-Token-Ziel auf mehrere zukünftige Offsets.
- 2Der Hauptnutzen ist ein reichhaltigeres Trainingssignal und weniger kurzsichtige Repräsentationen.
- 3Es kann Blockgenerierung ermöglichen, aber nur mit passender Inferenz-Infrastruktur.
- 4Denk an MTP als Training, bei dem das Modell die Straße vor sich sieht, nicht nur den nächsten Schritt.