Multi-Token Prediction (MTP)

Expertenniveau

Wie Training auf mehrere zukünftige Tokens gleichzeitig Repräsentationen, Planung und Inferenzoptionen verbessern kann.

Zuletzt aktualisiert: 13. Sept. 2026

Was ist Multi-Token Prediction?

Klassisches Sprachmodell-Training lässt das Modell nur das nächste Token vorhersagen. Multi-Token Prediction ergänzt Hilfsköpfe oder Ziele für mehrere nächste Tokens, sodass das Modell nicht nur den unmittelbaren nächsten Schritt lernt, sondern auch, wie sich die nahe Zukunft entfaltet.

Standard-LM: x[t+1] vorhersagen. MTP: x[t+1], x[t+2], x[t+3] ... x[t+k] vorhersagen.

Warum das wichtig ist

Dichteres Lernsignal

Jede Trainingsposition liefert mehrere zukünftige Zielwerte. Dadurch können knappe oder teure Trainingstokens mehr lehren als nur ein einzelnes Next-Token-Label.

Besseres Zukunftsbewusstsein

Mehrere Schritte vorauszusagen zwingt die Repräsentation, Struktur zu kodieren, die über das unmittelbar nächste Wort hinaus Bestand hat.

Neue Decoding-Möglichkeiten

Wenn das Modell bereits Zukunfts-Token-Köpfe besitzt, können Systeme Blockgenerierung, Verifikation und spekulative Decoding-Varianten ausnutzen.

Next-Token vs. Multi-Token Learning

Next-Token-Ziel

Input: Die Hauptstadt von Frankreich ist

→ Paris

Multi-Token-Ziel

Input: Die Hauptstadt von Frankreich ist

→ Paris · und · sie · ist

Das Modell konsumiert weiterhin denselben Prefix, aber die Loss-Funktion stellt mehr Fragen zur Fortsetzung. In der Praxis teilen Implementierungen oft den Transformer-Rumpf und ergänzen mehrere leichte Vorhersageköpfe oder trainieren mit verschobenen Zielen für mehrere Zukunftsoffsets.

Kleiner Loss-Visualizer

Dieses Beispiel summiert Cross-Entropy über drei zukünftige Ziele. Gleiche Gewichte entsprechen dem grundlegenden Multi-Head-Beispiel; die optional abnehmenden Gewichte sind eine bewusst gewählte Alternative, keine Definition von MTP.

Spielmodell: Die Regler setzen die Wahrscheinlichkeit des richtigen Tokens an drei zukünftigen Positionen. Berechnet wird die Summe ihrer gewichteten Cross-Entropy-Terme in Nats. Kein Sprachmodell wird ausgeführt.

−λ log(p) = 0.357

−λ log(p) = 0.916

−λ log(p) = 1.609

L = 2.882 nats

Balkenskala: 0 bis −log(0,01), für alle Positionen gleich. Das MTP-Paper von Gloeckle et al. summiert die Kopfverluste gleichgewichtet. Andere Architekturen wie DeepSeek-V3 verwenden eigene MTP-Module und Lossgewichte.

Wie es meist implementiert wird

1

Geteilter Rumpf

Der Transformer-Body erzeugt für jede Position einen Hidden State, genau wie bei einem normalen Sprachmodell.

2

Mehrere Zukunftsköpfe

Zusätzliche Köpfe sagen Token t+2, t+3 und so weiter voraus. Ihre Verluste werden mit dem normalen Next-Token-Loss kombiniert.

3

Gewichtetes Ziel

Lossgewichte und Abhängigkeiten zwischen Vorhersageköpfen sind architekturspezifisch. Das konkrete Ziel im jeweiligen Paper vergleichen, statt abnehmende Gewichte für spätere Positionen vorauszusetzen.

MTP vs. spekulatives Decoding

Spekulatives Decoding

Ein Inferenz-Trick: Ein kleineres Draft-Modell schlägt Tokens vor, ein größeres Modell verifiziert sie. Das kann Serving beschleunigen, ohne das Training des großen Modells zu ändern.

Multi-Token Prediction

Ein Trainingsziel: Das Modell selbst lernt, mehrere Zukunftsoffsets vorherzusagen. Das kann Block-Inferenz ermöglichen, aber nur wenn die Runtime diese Köpfe auch nutzt.

Vorteile

  • Mehr Supervision pro Kontext-Token im Training.
  • Repräsentationen können weniger kurzsichtig und stärker sequenzbewusst werden.
  • Passt gut zu Blockgenerierung und Verifikationsmethoden.

Einschränkungen

  • Zusätzliche Köpfe und Losses erhöhen Trainingskomplexität und Tuning-Aufwand.
  • Weiter entfernte Tokens sind schwerer und verrauschter vorherzusagen; Loss-Gewichtung ist wichtig.
  • MTP macht Inferenz nicht automatisch schneller, solange der Serving-Stack es nicht nutzt.

Wo das auftaucht

Aktuelle Frontier-Model-Paper und Open-Model-Reports diskutieren MTP-artige Ziele als Weg, Trainingssignale dichter zu machen und Generierungsverhalten zu verbessern. Die Implementierungsdetails unterscheiden sich, also behandle MTP eher als Familie von Zielen, nicht als eine feste Architektur.

Wichtigste Punkte

  • 1MTP erweitert das Next-Token-Ziel auf mehrere zukünftige Offsets.
  • 2Der Hauptnutzen ist ein reichhaltigeres Trainingssignal und weniger kurzsichtige Repräsentationen.
  • 3Es kann Blockgenerierung ermöglichen, aber nur mit passender Inferenz-Infrastruktur.
  • 4Denk an MTP als Training, bei dem das Modell die Straße vor sich sieht, nicht nur den nächsten Schritt.