Vorwärtsprozess (Korruption)
Der Vorwärtsprozess injiziert schrittweise Rauschen in saubere Samples, bis die Struktur weitgehend zerstört ist. So entstehen Trainingspaare, die zeigen, welches Rauschen pro Schritt hinzugefügt wurde.
Start mit sauberen Daten
Ziehe x0 aus echten Daten (Bild, Text-Embedding oder Latent).
Schrittweise Rauschen addieren
Jeder Zeitschritt fügt kontrolliertes gaußsches oder diskretes Rauschen hinzu.
Nahezu zufälligen Zustand erreichen
Nach vielen Schritten nähert sich xT einer einfachen Priorverteilung an.
Rückwärtsprozess (Generierung)
Die Generierung startet aus Rauschen und wendet gelernte Entrauschungsschritte an. Das Modell sagt einen saubereren Zustand (oder das Rauschresiduum) voraus und bewegt sich iterativ zu realistischen Samples.
Intuition der Rauschvorhersage
Rauschen zu schätzen ist oft leichter, als direkt das saubere Sample zu prognostizieren. Sobald das Rauschen geschätzt ist, kann es subtrahiert und Struktur progressiv wiederhergestellt werden.
Scheduler: Linear vs Cosine
Scheduler legen fest, wie viel Rauschen pro Schritt hinzugefügt oder entfernt wird. Sie beeinflussen Stabilität, Qualität und Geschwindigkeit stark.
Linearer Scheduler
Rauschen ändert sich pro Schritt mit konstanter Rate. Einfach, vorhersehbar und leicht zu implementieren.
Cosine-Scheduler
Verteilt den Entrauschungsaufwand nichtlinear, behält oft länger nützliches Signal und verbessert die wahrgenommene Qualität.
Score-Matching-Intuition
Eine Score-Funktion schätzt den Gradienten der Log-Dichte und zeigt in Richtung wahrscheinlicher Datenbereiche. Entrauschungsupdates folgen dieser Richtung und bewegen verrauschte Zustände zurück auf den Datenmanifold.
Vorwärtsprozess mit Gauß-Rauschen
Verändere die Signalstärke in der Diffusionsgleichung. Der Rückwärtsprozess wird getrennt erklärt, da ein gelernter Sampler das Originalbild nicht kennt.
Vorwärtsprozess mit berechnetem Rauschen
xₜ = √ᾱ·x₀ + √(1−ᾱ)·ε, mit festem Seed und Gauß-Rauschen ε. Die Anzeige begrenzt die Zahlen auf den darstellbaren Farbbereich. Derselbe Seed macht Rauschstufen vergleichbar.
x₀=1, ε=-1.0392 → xₜ=1.0000Zurückschieben blendet das gespeicherte Original ein. Das ist kein gelernter Rückwärts-Sampler. Bei der Generierung ist das Original unbekannt. Das Modell muss eine Entrauschungsrichtung aus dem verrauschten Zustand und der Konditionierung vorhersagen.
DDPM (2020)Wichtige Erkenntnisse
- Diffusionstraining lernt die Umkehrung eines bekannten Korruptionsprozesses.
- Rückwärts-Sampling verwendet eine gelernte Vorhersage. Die Schrittzahl hängt vom Sampler und möglicher Destillation ab.
- Scheduler steuern, wo Modellkapazität über Zeitstufen investiert wird.
- Score-Schätzung liefert eine geometrische Sicht auf die Entrauschungsrichtung.