Sofortantwort
GAN einfach erklärt
Zwei neuronale Netze konkurrieren zur Datengenerierung.
- Kurz gesagt
- Zwei Netze im Wettbewerb: Generator erzeugt, Discriminator bewertet
- Typischer Einsatz
- Bildgenerierung, Deepfakes, Super-Resolution
- Wichtig zu wissen
- Weitgehend durch Diffusionsmodelle abgelöst, aber konzeptionell wichtig
Generative Adversarial Network im Überblick
Generative Adversarial Networks (GANs) waren von 2014 bis ca. 2022 die führende Technologie für die Generierung realistischer Bilder. Ian Goodfellow erfand das Konzept 2014 und es ermöglichte erstmals fotorealistische KI-Gesichter (StyleGAN), Super-Resolution und Deepfakes. Heute wurden GANs für die meisten Anwendungen durch Diffusionsmodelle abgelöst, die stabiler trainierbar sind und vielfältigere Ausgaben produzieren. Das GAN-Konzept bleibt aber konzeptionell wichtig.
Ein GAN besteht aus zwei neuronalen Netzen im Wettbewerb:
- Generator: Erzeugt neue Daten (z.B. Bilder) aus zufälligem Rauschen
- Discriminator: Versucht zu unterscheiden, ob ein Bild echt oder generiert ist
Durch diesen Wettbewerb werden beide Netze immer besser – wie ein Fälscher und ein Detektiv, die sich gegenseitig verbessern.
Der Trainingsprozess:
Zufälliges Rauschen → Generator → Fake-Bild ─┐
├→ Discriminator → Echt/Fake?
Echte Trainingsdaten ─────────────→ Echtes Bild ──┘
Heute: GANs wurden weitgehend durch Diffusionsmodelle (Stable Diffusion) ersetzt, die stabiler trainieren und vielfältigere Ergebnisse liefern.
Technisch betrachtet
Verlustfunktion
Das GAN-Training ist ein Minimax-Spiel:
min_G max_D V(D,G) = E[log D(x)] + E[log(1 - D(G(z)))]
Der Discriminator maximiert seine Fähigkeit, echt von fake zu unterscheiden. Der Generator minimiert die Fähigkeit des Discriminators.
Bekannte GAN-Varianten
- DCGAN (2015): Erste stabile CNN-basierte GAN-Architektur
- StyleGAN (2019): Kontrolle über Stil und Details generierter Bilder
- CycleGAN: Bild-zu-Bild-Übersetzung ohne gepaarte Daten
- Pix2Pix: Bild-zu-Bild-Übersetzung mit gepaarten Daten
- WGAN: Wasserstein-Distanz für stabileres Training
Herausforderungen
- Mode Collapse: Generator erzeugt nur wenige Varianten
- Training Instability: Schwieriges Gleichgewicht zwischen Generator und Discriminator
- Evaluation: Schwer zu messen, wie gut generierte Bilder sind (FID, IS)
- Steuerbarkeit: Schwieriger zu kontrollieren als Diffusionsmodelle