Text-to-Image
KI-Systeme, die aus natürlichsprachlichen Beschreibungen Bilder generieren – von DALL-E über Midjourney bis Stable Diffusion.
KI-Modelle, die aus Textbeschreibungen Videos generieren – von kurzen Clips bis hin zu komplexen Szenen mit konsistenten Charakteren und Bewegungen.
Text-to-Video (T2V) generiert Videos aus Textbeschreibungen. Du schreibst, was du sehen willst, und die KI erstellt das Video – Bewegung, Kamera, Beleuchtung, alles.
Beispiel-Prompt:
"Eine Drohnenaufnahme über eine neblige Berglandschaft
bei Sonnenaufgang. Die Kamera gleitet langsam über
einen Bergsee, in dem sich die Berge spiegeln."
→ KI generiert ein 10-Sekunden-Video genau dieser Szene.
Wichtige Anbieter und Modellfamilien:
| Modellfamilie | Typische Stärken | Typische Einschränkung |
|---|---|---|
| Sora | Fotorealismus, filmische Szenen | Zugang, Kosten und Limits abhängig vom Produkt |
| Runway | Kreative Kontrolle, Editing-Workflows | Tarif- und Längenlimits |
| Pika | Schneller Einstieg, kurze Social-Clips | Konsistenz bei längeren Szenen |
| Kling | Bewegung, Action, realistische Clips | Verfügbarkeit und Produktgrenzen |
| Veo / Google-Modelle | Multimodale Integration, hohe Qualität | Plattformabhängigkeit |
Was funktioniert gut:
Was noch schwierig ist:
Architektur (vereinfacht):
Text-Prompt
│
▼
┌─────────────────┐
│ Text Encoder │ (CLIP, T5)
│ → Embeddings │
└────────┬────────┘
│
▼
┌─────────────────┐
│ Diffusion Model │
│ (3D U-Net oder │
│ Transformer) │
└────────┬────────┘
│
▼
┌─────────────────┐
│ Video Decoder │
│ → Frames │
└─────────────────┘
Moderner Ansatz mit Video-Transformern:
Struktur eines guten Prompts:
[Kamera] + [Subjekt] + [Aktion] + [Setting] + [Stil] + [Atmosphäre]
"Dolly shot of a golden retriever running through
a wheat field at golden hour, cinematic,
shallow depth of field, warm tones"
Kamera-Begriffe:
Stil-Begriffe:
Image-to-Video:
Eingabe: Startbild + Prompt
Ausgabe: Video, das mit dem Bild beginnt
Video-to-Video:
Eingabe: Referenzvideo + Stil-Prompt
Ausgabe: Transformiertes Video
Motion Control:
Eingabe: Prompt + Bewegungspfad
Ausgabe: Video mit kontrollierter Kamerabewegung
Character Consistency:
Eingabe: Referenzbilder eines Charakters + Prompt
Ausgabe: Video mit konsistentem Charakter
| Problem | Workaround |
|---|---|
| Kurze Clips | Clips aneinanderreihen, Übergänge glätten |
| Inkonsistente Charaktere | Character Reference, mehrere Takes |
| Physik-Fehler | Mehrere Generierungen, beste wählen |
| Text im Video | Nachträglich in Post-Production |
| Spezifische Bewegungen | Motion Control, Keyframes |
1. Konzept & Storyboard
└── Text-Prompts für jede Szene
2. Generierung
└── Mehrere Varianten pro Szene
└── Beste auswählen
3. Post-Production
└── Schnitt in Premiere/DaVinci
└── Color Grading
└── Audio hinzufügen
└── VFX-Korrekturen
4. Finalisierung
└── Export in gewünschtem Format
Kosten und Generierungszeit hängen stark von Anbieter, Tarif, Auflösung, Länge, Qualitätsmodus und Warteschlange ab. Für Produktionsworkflows ist wichtiger als der Einzelpreis: Wie viele Varianten pro Szene nötig sind, wie viel Nachbearbeitung anfällt und ob Rechte, Wasserzeichen und kommerzielle Nutzung zum Tarif passen.
Text-to-Video ist wie ein Regisseur, der dein Drehbuch liest und sofort einen Film dreht – ohne Kamera, Schauspieler oder Set. Du beschreibst die Szene, die KI erschafft sie.
Generiert Videos aus natürlichsprachlichen Beschreibungen
Wichtige Anbieter und Modellfamilien: Sora, Runway, Pika, Kling, Veo und weitere
Herausforderungen: Konsistenz, Physik, längere Clips
Marketing & Werbung
Schnelle Erstellung von Werbe-Clips und Social-Media-Content
Prototyping
Konzeptvideos für Pitches ohne Produktionsaufwand
Content Creation
YouTube-Intros, Erklärvideos, B-Roll-Material
Film & Entertainment
Previsualisierung, Storyboard-Animation, VFX-Konzepte
Die maximale Länge hängt stark vom Anbieter, Tarif, Modell und Qualitätsmodus ab. Viele Workflows erzeugen kurze Clips und setzen längere Videos aus mehreren Szenen zusammen, was Konsistenz-Probleme verursachen kann.
Sehr beeindruckend, aber nicht perfekt. Probleme: Physik (Objekte durchdringen sich), Hände, Text im Video, konsistente Charaktere über längere Zeit.
Zunehmend ja. Image-to-Video, Character Reference und Style Transfer ermöglichen mehr Kontrolle. ControlNet-ähnliche Ansätze kommen.
Nicht vollständig, aber ergänzt sie stark. Gut für Konzepte, B-Roll, Social Content. Für Spielfilme noch nicht ausreichend konsistent.