Wie Diffusion funktioniert

Fortgeschritten

Baue Intuition für Vorwärtskorruption, Rückwärts-Entrauschen, Scheduler und scorebasiertes Lernen auf.

Zuletzt aktualisiert: 13. Sept. 2026

Vorwärtsprozess (Korruption)

Der Vorwärtsprozess injiziert schrittweise Rauschen in saubere Samples, bis die Struktur weitgehend zerstört ist. So entstehen Trainingspaare, die zeigen, welches Rauschen pro Schritt hinzugefügt wurde.

Start mit sauberen Daten

Ziehe x0 aus echten Daten (Bild, Text-Embedding oder Latent).

Schrittweise Rauschen addieren

Jeder Zeitschritt fügt kontrolliertes gaußsches oder diskretes Rauschen hinzu.

Nahezu zufälligen Zustand erreichen

Nach vielen Schritten nähert sich xT einer einfachen Priorverteilung an.

Rückwärtsprozess (Generierung)

Die Generierung startet aus Rauschen und wendet gelernte Entrauschungsschritte an. Das Modell sagt einen saubereren Zustand (oder das Rauschresiduum) voraus und bewegt sich iterativ zu realistischen Samples.

Intuition der Rauschvorhersage

Rauschen zu schätzen ist oft leichter, als direkt das saubere Sample zu prognostizieren. Sobald das Rauschen geschätzt ist, kann es subtrahiert und Struktur progressiv wiederhergestellt werden.

Scheduler: Linear vs Cosine

Scheduler legen fest, wie viel Rauschen pro Schritt hinzugefügt oder entfernt wird. Sie beeinflussen Stabilität, Qualität und Geschwindigkeit stark.

Linearer Scheduler

Rauschen ändert sich pro Schritt mit konstanter Rate. Einfach, vorhersehbar und leicht zu implementieren.

Cosine-Scheduler

Verteilt den Entrauschungsaufwand nichtlinear, behält oft länger nützliches Signal und verbessert die wahrgenommene Qualität.

Score-Matching-Intuition

Eine Score-Funktion schätzt den Gradienten der Log-Dichte und zeigt in Richtung wahrscheinlicher Datenbereiche. Entrauschungsupdates folgen dieser Richtung und bewegen verrauschte Zustände zurück auf den Datenmanifold.

Vorwärtsprozess mit Gauß-Rauschen

Verändere die Signalstärke in der Diffusionsgleichung. Der Rückwärtsprozess wird getrennt erklärt, da ein gelernter Sampler das Originalbild nicht kennt.

Vorwärtsprozess mit berechnetem Rauschen

xₜ = √ᾱ·x₀ + √(1−ᾱ)·ε, mit festem Seed und Gauß-Rauschen ε. Die Anzeige begrenzt die Zahlen auf den darstellbaren Farbbereich. Derselbe Seed macht Rauschstufen vergleichbar.

x₀=1, ε=-1.0392 → xₜ=1.0000

Zurückschieben blendet das gespeicherte Original ein. Das ist kein gelernter Rückwärts-Sampler. Bei der Generierung ist das Original unbekannt. Das Modell muss eine Entrauschungsrichtung aus dem verrauschten Zustand und der Konditionierung vorhersagen.

DDPM (2020)

Wichtige Erkenntnisse

  • Diffusionstraining lernt die Umkehrung eines bekannten Korruptionsprozesses.
  • Rückwärts-Sampling verwendet eine gelernte Vorhersage. Die Schrittzahl hängt vom Sampler und möglicher Destillation ab.
  • Scheduler steuern, wo Modellkapazität über Zeitstufen investiert wird.
  • Score-Schätzung liefert eine geometrische Sicht auf die Entrauschungsrichtung.