Sofortantwort
Whisper einfach erklärt
Ein Modell zur Umwandlung gesprochener Sprache in Text.
- Kurz gesagt
- Speech-to-Text: Sprache in Text umwandeln mit hoher Genauigkeit
- Typischer Einsatz
- Transkription, Untertitel, Voice Interfaces
- Wichtig zu wissen
- Open Source: Lokal ausführbar, verschiedene Modellgrößen (tiny bis large)
Whisper im Überblick
Whisper ist OpenAIs Open-Source-Modell für automatische Spracherkennung (ASR – Automatic Speech Recognition). Es wurde auf 680.000 Stunden mehrsprachiger Audio-Daten trainiert und unterstützt 99 Sprachen. Das Besondere: Whisper ist nicht nur für Englisch optimiert, sondern liefert auch für Deutsch, Spanisch und viele andere Sprachen sehr gute Ergebnisse – und kann automatisch zwischen Sprachen wechseln. Whisper ist Open Source und kann lokal betrieben werden – ideal für datenschutzsensible Anwendungen, bei denen Audio nicht in die Cloud gesendet werden darf. Verschiedene Modellgrößen (tiny bis large-v3) ermöglichen den Einsatz von Edge-Geräten bis zu Hochleistungsservern.
Whisper ist OpenAIs Spracherkennungs-Modell – es wandelt gesprochene Sprache in Text um. Das Besondere: Es ist Open Source und funktioniert in 99 Sprachen.
Was kann Whisper?
- Transkription: Audio → Text in der gleichen Sprache
- Übersetzung: Audio in beliebiger Sprache → Englischer Text
- Spracherkennung: Automatisch erkennen, welche Sprache gesprochen wird
- Zeitstempel: Wann wurde was gesagt?
Beispiel:
[Audio: "Künstliche Intelligenz verändert die Welt"]
→ Whisper
→ "Künstliche Intelligenz verändert die Welt."
Welches Modell wählen?
| Modell | Größe | Qualität | Geschwindigkeit |
|---|---|---|---|
| tiny | 39 MB | Okay | Sehr schnell |
| small | 244 MB | Gut | Schnell |
| medium | 769 MB | Sehr gut | Mittel |
| large-v3 | 1.5 GB | Exzellent | Langsam |
Für die meisten Anwendungen ist medium ein guter Kompromiss. Für beste Qualität: large-v3.
Technisch betrachtet
Architektur
Whisper nutzt einen Encoder-Decoder Transformer:
- Audio → Mel-Spektrogramm: Audio in visuelle Frequenz-Darstellung
- Encoder: Verarbeitet das Spektrogramm
- Decoder: Generiert Text Token für Token
Modellgrößen
| Modell | Parameter | VRAM | Geschwindigkeit |
|---|---|---|---|
| tiny | 39M | ~1GB | Sehr schnell |
| base | 74M | ~1GB | Schnell |
| small | 244M | ~2GB | Gut |
| medium | 769M | ~5GB | Langsamer |
| large-v3 | 1.5B | ~10GB | Am genauesten |
Features
- Transkription: Sprache → Text (gleiche Sprache)
- Übersetzung: Sprache → Englischer Text
- Spracherkennung: Automatisch die gesprochene Sprache erkennen
- Timestamps: Wort- oder Segment-Level Zeitstempel
Lokale Installation
# Standard Whisper
pip install openai-whisper
whisper meeting.mp3 --model medium --language German
# Faster Whisper (4x schneller)
pip install faster-whisper
from faster_whisper import WhisperModel
model = WhisperModel("medium", device="cuda")
segments, info = model.transcribe("audio.mp3", language="de")
for segment in segments:
print(f"[{segment.start:.2f}s] {segment.text}")
Optimierungen
Geschwindigkeit:
- Faster Whisper statt Original (4x schneller)
- Kleineres Modell (small statt large)
- GPU statt CPU
- VAD (Voice Activity Detection) zum Filtern von Stille
Qualität:
- Größeres Modell (large-v3)
--initial_promptmit Kontext/Fachbegriffen- Nachbearbeitung mit LLM für Satzzeichen/Formatierung
Whisper vs. Alternativen
| Modell | Qualität | Geschwindigkeit | Lokal? | Kosten |
|---|---|---|---|---|
| Whisper large-v3 | Sehr hoch | Langsam | Ja | Kostenlos |
| Faster Whisper | Sehr hoch | Schnell | Ja | Kostenlos |
| OpenAI Whisper API | Sehr hoch | Schnell | Nein | $0.006/min |
| Google Speech-to-Text | Hoch | Schnell | Nein | $0.016/min |
| AssemblyAI | Sehr hoch | Schnell | Nein | $0.015/min |