Die wichtigsten Erkenntnisse
- Diffusionsmodelle lernen Rauschen zu entfernen – kein Kopieren, sondern statistisches Neuerschaffen
- Prompt-Qualität entscheidet: Stil + Motiv + Komposition + Beleuchtung + Qualitäts-Tags
- Toolwahl hängt vom Use Case ab: Ästhetik, Prompt-Treue, lokale Kontrolle, Kosten und Rechtssicherheit zählen unterschiedlich stark
- Negative Prompts sind genauso wichtig wie positive – was du nicht willst, explizit ausschließen
- Kommerzielle Nutzung: AGBs prüfen – Midjourney Pro erlaubt es, kostenlose Pläne meist nicht
Wie KI-Bildgenerierung funktioniert
KI-Bilder entstehen nicht durch Kopieren – das Modell hat keine Bilddatenbank, aus der es schöpft. Stattdessen lernt es statistische Muster: Wie sieht ein Hund aus? Wie fühlt sich “golden hour” visuell an? Was macht ein Foto “cinematic”?
Der Mechanismus dahinter heißt Diffusion: Das Modell lernt, aus reinem Rauschen schrittweise ein Bild zu rekonstruieren – geleitet durch deinen Text-Prompt.
Diffusionsmodelle: Der Mechanismus
Rauschen → Schritt 1 → Schritt 2 → ... → Schritt N → Bild
Training
Das Modell sieht Millionen Bilder, zu denen schrittweise Rauschen hinzugefügt wird. Es lernt, diesen Prozess umzukehren – Rauschen zu entfernen.
Inferenz (Bildgenerierung)
- Start mit reinem Rauschen (zufällige Pixel)
- Text-Prompt wird via CLIP in Vektoren umgewandelt
- Modell entfernt in ~20–50 Schritten das Rauschen, geleitet durch den Prompt
- Ergebnis: Ein Bild, das zum Prompt passt
Der Guidance Scale (CFG) steuert, wie stark der Prompt das Ergebnis beeinflusst: Niedrig = kreativ/zufällig, Hoch = prompt-treu aber manchmal übersättigt.
Die wichtigsten Tool-Kategorien
Sehr starke ästhetische Qualität und Komposition. Geeignet für Markenlooks, Moodboards, Illustrationen und visuell konsistente Kampagnen.
Einfacher Einstieg direkt im Chat-Workflow. Stark, wenn du Bilder iterativ per natürlicher Sprache beschreiben, korrigieren und variieren willst.
Stark für Teams, die Modellkontrolle, lokale Ausführung, eigene Pipelines oder API-Integration brauchen. Qualität, Geschwindigkeit und Lizenz hängen vom konkreten Modell und Setup ab.
Prompts schreiben: Die Formel
Ein guter Bild-Prompt folgt einer klaren Struktur:
[Motiv] + [Stil] + [Komposition] + [Beleuchtung] + [Qualität]
Beispiel: Schlechter vs. guter Prompt
Stil-Keywords
- Fotografie:
cinematic photography,DSLR,85mm lens,bokeh,golden hour - Illustration:
digital art,concept art,artstation,detailed illustration - Gemälde:
oil painting,watercolor,impressionist,brushstrokes - 3D:
3D render,octane render,unreal engine,volumetric lighting
Komposition
close-up portrait/wide angle/aerial view/eye levelrule of thirds/centered composition/symmetricalforeground blur/depth of field
Beleuchtung
golden hour/blue hour/dramatic shadowsstudio lighting/soft box/rim lightingnatural light/overcast/neon lights
Negative Prompts
Was du nicht im Bild willst, explizit ausschließen:
Negativ: blurry, low quality, distorted, deformed hands, extra fingers,
watermark, text, logo, ugly, bad anatomy, bad proportions,
duplicate, morbid, mutilated, out of frame
Negative Prompts sind genauso wichtig wie positive – besonders für Hände, Gesichter und Hintergründe.
Tool-Vergleich nach Use Case
| Tool-Kategorie | Stärke | Typische Einschränkung | Lokal |
|---|---|---|---|
| Midjourney | Ästhetik, Komposition, Stil-Konsistenz | Weniger technische Kontrolle | ✗ |
| DALL-E / ChatGPT | Einfache Bedienung, iterative Prompts, Textverständnis | Anbieter- und Tarifgrenzen | ✗ |
| Flux / Stable Diffusion | Kontrolle, lokale Pipelines, Anpassbarkeit | Technischer Aufwand | ✓ |
| Google Imagen / ähnliche Plattformen | Ökosystem-Integration, schnelle Experimente | Plattformbindung | ✗ |
| Ideogram / Design-Tools | Text in Bildern, Logos, Banner | Spezialisierter Fokus | ✗ |
| Adobe Firefly | Creative-Cloud-Workflow, kommerzielle Nutzung, Inpainting | Abo-/Ökosystembindung | ✗ |
Parameter verstehen
| Parameter | Wert | Effekt |
|---|---|---|
| Guidance Scale (CFG) | 1–20 | Niedrig = kreativ, Hoch = prompt-treu |
| Steps | 20–50 | Mehr = schärfer, aber langsamer |
| Seed | Zahl | Fixiert Zufälligkeit für Reproduzierbarkeit |
| Aspect Ratio | 1:1, 16:9… | Format des Ausgabebildes |
| Strength (img2img) | 0–1 | Wie stark das Ausgangsbild verändert wird |
Fortgeschrittene Techniken
Image-to-Image (img2img)
Statt bei Rauschen zu starten, beginnt der Prozess mit einem bestehenden Bild. Nützlich für:
- Stil auf eigene Fotos übertragen
- Skizzen in realistische Bilder umwandeln
- Variationen eines bestehenden Bildes erstellen
Inpainting
Nur einen bestimmten Bereich des Bildes neu generieren – der Rest bleibt unverändert. Ideal für:
- Hände und Gesichter korrigieren
- Hintergrund austauschen
- Objekte entfernen oder hinzufügen
ControlNet
Gibt dem Modell strukturelle Vorgaben: Pose, Tiefenkarte, Kanten. Das Ergebnis folgt der Struktur, aber mit neuem Stil. Besonders nützlich für konsistente Charaktere und Produktvisualisierungen.
Rechtliche Grundlagen
- Urheberrecht: KI-generierte Bilder sind in Deutschland aktuell nicht urheberrechtlich geschützt (kein menschlicher Schöpfer) – Stand 2026
- Kommerzielle Nutzung: AGBs, Tarif und Lizenz des jeweiligen Tools prüfen
- Transparenzpflicht: EU AI Act schreibt vor, KI-generierte Inhalte als solche zu kennzeichnen
- Trainingsdaten: Einige Modelle wurden auf urheberrechtlich geschützten Werken trainiert – rechtlich noch ungeklärt
- Persönlichkeitsrechte: Realistische Portraits realer Personen ohne Einwilligung problematisch