Bild-Diffusion

Fortgeschritten

Verstehe die latente Diffusionspipeline, Architekturentscheidungen, Konditionierung und Sampling-Trade-offs.

Zuletzt aktualisiert: 13. Sept. 2026

Latente Diffusionspipeline

Latente Diffusion entrauscht eine komprimierte Darstellung. Training, Text-zu-Bild-Sampling und Bild-zu-Bild-Eingaben haben unterschiedliche Einstiegspunkte.

Text-zu-Bild-Inferenz beginnt mit gezogenem latentem Rauschen. Ein VAE-Encoder wird bei der Vorbereitung von Bildlatenten für das Training oder für Bild-zu-Bild-Eingaben verwendet. Der VAE-Decoder übersetzt den fertig erzeugten Latent in Pixel.

  1. 1. Text → Konditionierung
  2. 2. Seed → latentes Rauschen
  3. 3. Denoiser + Scheduler → neuer Latent
  4. 4. VAE-Decoder → Pixel

U-Net vs DiT Backbones

U-Nets prägten frühe Diffusionsmodelle mit starken räumlichen Induktionsbiases. DiTs ersetzen Faltungen durch Transformer-Blöcke und skalieren oft besser mit Daten und Rechenbudget.

U-Net

Konvolutionaler Encoder-Decoder mit Skip-Connections für mehrskalige räumliche Rekonstruktion.

DiT (Diffusion Transformer)

Transformer-Backbone über patchifizierte Latente, oft stark bei grosser Skalierung und grossen Trainingsbudgets.

Textkonditionierung (CLIP/T5 + Cross-Attn)

Prompts werden kodiert (z. B. durch CLIP oder T5) und per Cross-Attention in Entrauschungsschichten eingespeist, damit Bildinhalte semantisch zum Text passen.

Classifier-Free Guidance (CFG)

CFG mischt konditionierte und unkonditionierte Vorhersagen. Höhere Guidance stärkt Prompttreue, kann aber Vielfalt reduzieren und Artefakte verstärken.

Schritte vs Qualität Trade-off

Mehr Entrauschungsschritte verbessern häufig die Qualität, erhöhen aber Latenz. In der Praxis werden Schrittzahl, Scheduler und Guidance auf Qualität pro Sekunde abgestimmt.

Classifier-free Guidance ausrechnen

Kombiniere zwei vorgegebene Rauschvorhersagen und prüfe, wie die Guidance-Stärke den resultierenden Vektor verändert.

Das ist ein Abhängigkeitsdiagramm und kein erzeugtes Bild. Halte Seed, Prompt, Auflösung, Modell und Scheduler fest, wenn du Guidance oder Schrittzahl vergleichst. Mehr Schritte verbessern die Qualität nicht zwangsläufig.

εᵤ = [0.2, −0.4] · ε꜀ = [0.6, −0.1]
ε = εᵤ + s(ε꜀ − εᵤ)
ε = [0.60, -0.10]

Berechnetes Guidance-Beispiel mit vorgegebenen Rauschvektoren. Bei s=0 ist das Ergebnis unkonditioniert, bei s=1 entspricht es der konditionierten Vorhersage. Größeres s extrapoliert darüber hinaus. Die Vektoren sind Beispiele, keine Modellausgaben oder Qualitätswerte. Der Scheduler muss aus der Vorhersage noch das nächste Sample berechnen.

Classifier-Free Diffusion Guidance (2022)

Wichtige Erkenntnisse

  • Text-zu-Bild-Sampling beginnt mit latentem Rauschen. VAE-Encoding wird für Bildeingaben und vorbereitete Trainingslatente verwendet.
  • U-Net und DiT haben unterschiedliche Induktionsbias- und Skalierungs-Trade-offs.
  • Textkonditionierung und CFG steuern die Stärke der Promptausrichtung.
  • Bildqualität hängt von gemeinsamer Abstimmung aus Schritten, Scheduler und Guidance ab.