Diskrete vs kontinuierliche Formulierungen
Sprache ist grundsätzlich diskret, daher nutzen Text-Diffusionsmodelle oft Token-Maskierung und Ersetzung. Manche Ansätze diffundieren in kontinuierlichen Embedding-Räumen und projizieren danach zurück.
Mask-and-Predict-Paradigma
Text-Diffusion startet oft mit stark maskierten Sequenzen und sagt fehlende Tokens wiederholt voraus. Konfidenzbasiertes Remasking und Verfeinerung verbessern häufig die Kohärenz.
MDLM-ähnliche Modelle
Masked Diffusion Language Models entrauschen Token-Raster iterativ statt links-nach-rechts zu dekodieren.
SEDD-ähnliche Modelle
Score-Entropy-Varianten übertragen scorebasierte Ideen auf diskrete Vokabulare mit probabilistisch fundierten Zielen.
Padding-Tokens und feste Länge
Batches mit fester Länge können PAD-Positionen und eine Attention-Maske verwenden, um ungenutzte Positionen auszuschließen. Die genauen Maskierungsregeln hängen von Architektur und Implementierung ab.
Unterschiede zu autoregressiven LMs
Autoregressive Modelle sagen das nächste Token auf Basis vorheriger Tokens voraus. Diffusionsbasierte Textmodelle verfeinern viele Positionen parallel über mehrere Entrauschungsiterationen.
Diffusionsbasierte Dekodierung
Parallele Token-Verfeinerung, wiederholte Entrauschung und optionales Remasking zur Fehlerkorrektur.
Autoregressive Dekodierung
Strikte Links-nach-rechts-Generierung mit kausaler Abhängigkeit und finaler Token-Festlegung pro Schritt.
Maskenverfeinerungs-Demo
Vergleiche vorgegebene Kandidatenwahrscheinlichkeiten, übernimm die sichersten maskierten Positionen und schließe PAD-Positionen aus.
Maskieren nach Konfidenz: ein Rechenbeispiel
Eine vorgegebene Kandidatentabelle steht für den Denoiser. Jeder Schritt berechnet diese Tabelle anhand des sichtbaren Kontexts neu und übernimmt die zwei sichersten maskierten Positionen. Die Konfidenz bestimmt die Auswahl. PAD-Positionen liegen außerhalb der Sequenz und nehmen nie teil.
| Position | Kandidat | Kandidatenwahrscheinlichkeit |
|---|---|---|
| 1 | Die | 92% |
| 5 | der | 91% |
| 4 | auf | 88% |
| 3 | sitzt | 62% |
| 8 | still | 60% |
| 2 | Katze | 59% |
| 6 | warmen | 56% |
| 7 | Fensterbank | 53% |
Dieses Beispiel verwendet unumkehrbares Aufdecken. Andere Sampler können Tokens erneut ändern. Die Wahrscheinlichkeiten sind vorgegebene Lernbeispiele und stammen nicht aus einem Sprachmodell.
Masked Diffusion Language Models (2024)Wichtige Erkenntnisse
- Text-Diffusion passt Entrauschung an diskrete Tokenräume an.
- Mask-and-Predict ermöglicht parallele Verfeinerung statt strikter Links-nach-rechts-Generierung.
- [PAD] plus Attention-Masking ist zentral für effizientes Batching fester Länge.
- Gegenüber autoregressiven LMs tauscht Text-Diffusion mehr Schritte gegen iterative Korrektur.