Text-Diffusion

Fortgeschritten

Verstehe, wie Diffusionsideen auf diskrete Sprach-Tokens und iterative Maskenverfeinerung angepasst werden.

Zuletzt aktualisiert: 13. Sept. 2026

Diskrete vs kontinuierliche Formulierungen

Sprache ist grundsätzlich diskret, daher nutzen Text-Diffusionsmodelle oft Token-Maskierung und Ersetzung. Manche Ansätze diffundieren in kontinuierlichen Embedding-Räumen und projizieren danach zurück.

Mask-and-Predict-Paradigma

Text-Diffusion startet oft mit stark maskierten Sequenzen und sagt fehlende Tokens wiederholt voraus. Konfidenzbasiertes Remasking und Verfeinerung verbessern häufig die Kohärenz.

MDLM-ähnliche Modelle

Masked Diffusion Language Models entrauschen Token-Raster iterativ statt links-nach-rechts zu dekodieren.

SEDD-ähnliche Modelle

Score-Entropy-Varianten übertragen scorebasierte Ideen auf diskrete Vokabulare mit probabilistisch fundierten Zielen.

Padding-Tokens und feste Länge

Batches mit fester Länge können PAD-Positionen und eine Attention-Maske verwenden, um ungenutzte Positionen auszuschließen. Die genauen Maskierungsregeln hängen von Architektur und Implementierung ab.

Unterschiede zu autoregressiven LMs

Autoregressive Modelle sagen das nächste Token auf Basis vorheriger Tokens voraus. Diffusionsbasierte Textmodelle verfeinern viele Positionen parallel über mehrere Entrauschungsiterationen.

Diffusionsbasierte Dekodierung

Parallele Token-Verfeinerung, wiederholte Entrauschung und optionales Remasking zur Fehlerkorrektur.

Autoregressive Dekodierung

Strikte Links-nach-rechts-Generierung mit kausaler Abhängigkeit und finaler Token-Festlegung pro Schritt.

Maskenverfeinerungs-Demo

Vergleiche vorgegebene Kandidatenwahrscheinlichkeiten, übernimm die sichersten maskierten Positionen und schließe PAD-Positionen aus.

Maskieren nach Konfidenz: ein Rechenbeispiel

Eine vorgegebene Kandidatentabelle steht für den Denoiser. Jeder Schritt berechnet diese Tabelle anhand des sichtbaren Kontexts neu und übernimmt die zwei sichersten maskierten Positionen. Die Konfidenz bestimmt die Auswahl. PAD-Positionen liegen außerhalb der Sequenz und nehmen nie teil.

[MASK]
Maskiert
[MASK]
Maskiert
[MASK]
Maskiert
[MASK]
Maskiert
[MASK]
Maskiert
[MASK]
Maskiert
[MASK]
Maskiert
[MASK]
Maskiert
[PAD]
Padding, ausgeschlossen
[PAD]
Padding, ausgeschlossen
PositionKandidatKandidatenwahrscheinlichkeit
1Die92%
5der91%
4auf88%
3sitzt62%
8still60%
2Katze59%
6warmen56%
7Fensterbank53%

Dieses Beispiel verwendet unumkehrbares Aufdecken. Andere Sampler können Tokens erneut ändern. Die Wahrscheinlichkeiten sind vorgegebene Lernbeispiele und stammen nicht aus einem Sprachmodell.

Masked Diffusion Language Models (2024)

Wichtige Erkenntnisse

  • Text-Diffusion passt Entrauschung an diskrete Tokenräume an.
  • Mask-and-Predict ermöglicht parallele Verfeinerung statt strikter Links-nach-rechts-Generierung.
  • [PAD] plus Attention-Masking ist zentral für effizientes Batching fester Länge.
  • Gegenüber autoregressiven LMs tauscht Text-Diffusion mehr Schritte gegen iterative Korrektur.