Latent Diffusion

Eine Variante von Diffusionsmodellen, die im komprimierten latenten Raum arbeitet statt auf Pixel-Ebene – die Grundlage von Stable Diffusion und deutlich effizienter.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Diffusion findet im komprimierten VAE-Latent-Raum statt
  2. 64× weniger Rechenaufwand als Pixel-Diffusion
  3. Grundlage von Stable Diffusion, SDXL, Flux

Sofortantwort

Latent Diffusion einfach erklärt

Diffusion im komprimierten latenten Raum statt auf Pixeln.

Kurz gesagt
Diffusion findet im komprimierten VAE-Latent-Raum statt
Typischer Einsatz
Text-to-Image, Image-to-Image, Inpainting
Wichtig zu wissen
Grundlage von Stable Diffusion, SDXL, Flux

Latent Diffusion im Überblick

Latent Diffusion Models (LDMs) sind die Architektur hinter Stable Diffusion und dem Großteil moderner Bildgenerierungssysteme. Die entscheidende Innovation gegenüber klassischen Diffusionsmodellen: Die Diffusion findet nicht auf Pixel-Ebene statt, sondern im komprimierten latenten Raum eines Variational Autoencoders (VAE). Das macht LDMs etwa 64-mal effizienter als Pixel-Diffusion – und ermöglicht hochauflösende Bildgenerierung auf Consumer-Hardware.

Latent Diffusion ist eine effizientere Version von Diffusionsmodellen. Statt auf dem vollen Bild (512×512 Pixel) zu arbeiten, wird erst komprimiert (64×64 latent), dann diffundiert, dann wieder dekomprimiert.

Der Trick:

Normale Diffusion:
Noise (512×512) → [50 Diffusion Steps] → Bild (512×512)
= 786.432 Werte pro Step 😰

Latent Diffusion:
Noise (64×64×4) → [50 Diffusion Steps] → Latent → [VAE Decoder] → Bild
= 16.384 Werte pro Step 🚀

Ergebnis: ~50× schneller bei vergleichbarer Qualität.

Technisch betrachtet

Architektur

Text Prompt

[CLIP Text Encoder] → Text Embeddings

[Cross-Attention]

Noise → [U-Net in Latent Space] → Denoised Latent

                                  [VAE Decoder]

                                   Final Image

Komponenten

KomponenteFunktionGröße (SD 1.5)
VAEBild ↔ Latent Kompression~80MB
U-NetDiffusion/Denoising~3.4GB
Text EncoderText → Embeddings~500MB

Stable Diffusion Pipeline

from diffusers import StableDiffusionPipeline

pipe = StableDiffusionPipeline.from_pretrained(
    "runwayml/stable-diffusion-v1-5"
)

image = pipe(
    prompt="A cat wearing a space suit",
    num_inference_steps=50,
    guidance_scale=7.5
).images[0]

Guidance Scale (CFG)

output = uncond_output + guidance_scale × (cond_output - uncond_output)

guidance_scale = 1: Ignoriert den Prompt
guidance_scale = 7-8: Guter Kompromiss
guidance_scale = 20+: Übertrieben, Artefakte

Vorteile von Latent Diffusion

  • Geschwindigkeit: 50× weniger Compute
  • VRAM: Läuft auf Consumer-GPUs (8GB+)
  • Qualität: Vergleichbar mit Pixel-Diffusion
  • Flexibilität: Einfache Erweiterungen (ControlNet, LoRA)

01Einsatzbereiche

Wann ist Latent Diffusion sinnvoll?

Geeignet für

  • Text-to-ImageStable Diffusion, DALL-E 3, Midjourney
  • Image-to-ImageBildbearbeitung und Stil-Transfer
  • InpaintingTeile von Bildern neu generieren

↑ Inhalt

02Werkzeuge

Womit Latent Diffusion umgesetzt wird

↑ Inhalt

Merksatz

Latent Diffusion ist wie ein Architekt, der erst einen kompakten Bauplan zeichnet (latenter Raum) und diesen dann zum fertigen Gebäude (Bild) ausbaut – statt jeden einzelnen Ziegelstein (Pixel) von Anfang an zu planen.

  1. Diffusion findet im komprimierten VAE-Latent-Raum statt
  2. 64× weniger Rechenaufwand als Pixel-Diffusion
  3. Grundlage von Stable Diffusion, SDXL, Flux

04Anwenden

Latent Diffusion praktisch anwenden

  • KI-Bilder erstellen

    Verstehen, wie Diffusionsmodelle Bilder aus Text generieren

    Guide · 12 MinEinsteiger

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Latent Diffusion

Warum ist Latent Diffusion schneller als normale Diffusion?

Ein 512×512 Bild hat 786.432 Pixel. Der latente Raum ist nur 64×64×4 = 16.384 Werte. Die Diffusion arbeitet auf 48× weniger Daten – das macht sie viel schneller.

Was ist der Unterschied zwischen Stable Diffusion und Latent Diffusion?

Latent Diffusion ist die Architektur/Technik. Stable Diffusion ist ein spezifisches Modell, das Latent Diffusion verwendet – trainiert von Stability AI auf großen Bilddatensätzen.

Verliert man Qualität durch die Kompression?

Minimal. Der VAE ist so trainiert, dass er die wichtigsten visuellen Informationen erhält. Die Qualität von Latent Diffusion ist vergleichbar mit Pixel-Diffusion, bei einem Bruchteil der Rechenzeit.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Diffusionsmodell

    Ein Modell, das Bilder durch Rauschreduzierung generiert.

  • Technisch vertiefen

    VAE (Variational Autoencoder)

    Generatives Modell, das Daten komprimiert und neu generiert.

  • In der Praxis anwenden

    KI-Bilder erstellen

    Von Diffusionsmodellen bis Prompt-Technik – so erstellst du professionelle KI-Bilder mit Midjourney, Flux, DALL-E und Stable Diffusion.

↑ Inhalt