Sofortantwort
Text-to-Speech einfach erklärt
Automatische Umwandlung von Text in gesprochene Sprache.
- Kurz gesagt
- Wandelt Text in natürlich klingende Sprache um
- Typischer Einsatz
- Accessibility, Content Creation, Voice Assistants
- Wichtig zu wissen
- Voice Cloning ermöglicht individuelle Stimmen mit wenig Training
Text-to-Speech im Überblick
Text-to-Speech (TTS) wandelt geschriebenen Text in gesprochene Sprache um. Moderne KI-Modelle klingen dabei so natürlich, dass sie kaum von echten Menschen zu unterscheiden sind.
Evolution von TTS:
1990er: "Hal-lo. Ich. Bin. Ein. Com-pu-ter."
→ Roboterhaft, unnatürlich
2010er: "Hallo, ich bin ein Computer."
→ Besser, aber noch erkennbar synthetisch
Heute: "Hallo! Ich bin ein Computer – und das klingt
ziemlich natürlich, oder?"
→ Emotionen, Pausen, natürliche Betonung
Aktuelle TTS-Dienste:
| Dienst | Qualität | Latenz | Voice Cloning | Abrechnung |
|---|---|---|---|---|
| ElevenLabs | ⭐⭐⭐⭐⭐ | Niedrig | Ja | Monatskontingent |
| OpenAI TTS | ⭐⭐⭐⭐ | Niedrig | Nein | pro Zeichen |
| Azure Neural | ⭐⭐⭐⭐ | Niedrig | Ja (Custom) | pro Zeichen |
| Coqui (lokal) | ⭐⭐⭐ | Mittel | Ja | keine Lizenzkosten |
Technisch betrachtet
OpenAI TTS API
from openai import OpenAI
client = OpenAI()
response = client.audio.speech.create(
model="tts-1-hd", # oder "tts-1" für schneller
voice="nova", # alloy, echo, fable, onyx, nova, shimmer
input="Hallo, das ist ein Test der Text-to-Speech API.",
speed=1.0, # 0.25 bis 4.0
)
# Als Datei speichern
response.stream_to_file("output.mp3")
ElevenLabs
from elevenlabs import generate, set_api_key
set_api_key("YOUR_API_KEY")
audio = generate(
text="Willkommen zu unserem Podcast!",
voice="Rachel", # Oder Voice ID
model="eleven_multilingual_v2",
)
with open("output.mp3", "wb") as f:
f.write(audio)
Voice Cloning:
from elevenlabs import clone, generate
# Stimme klonen (braucht Audio-Samples)
voice = clone(
name="Meine Stimme",
files=["sample1.mp3", "sample2.mp3"],
description="Meine geklonte Stimme"
)
# Mit geklonter Stimme generieren
audio = generate(
text="Das bin ich – oder doch nicht?",
voice=voice,
)
Lokale TTS mit Coqui
from TTS.api import TTS
# Modell laden
tts = TTS("tts_models/de/thorsten/tacotron2-DDC")
# Text zu Audio
tts.tts_to_file(
text="Hallo, das ist lokale Sprachsynthese.",
file_path="output.wav"
)
# Mit Voice Cloning
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2")
tts.tts_to_file(
text="Das klingt wie ich!",
speaker_wav="my_voice_sample.wav",
language="de",
file_path="output.wav"
)
SSML für Kontrolle
<speak>
Willkommen!
<break time="500ms"/>
<prosody rate="slow" pitch="+2st">
Das ist langsamer und höher.
</prosody>
<emphasis level="strong">
Das ist wichtig!
</emphasis>
<say-as interpret-as="date">2026-03-11</say-as>
</speak>
Streaming für Echtzeit
from elevenlabs import stream
# Streaming für niedrige Latenz
audio_stream = stream(
text="Dies wird in Echtzeit gestreamt...",
voice="Rachel",
)
# Direkt abspielen
from elevenlabs import play
play(audio_stream)
Qualitätsvergleich
| Aspekt | Alte TTS | Moderne Neural TTS |
|---|---|---|
| Natürlichkeit | Roboterhaft | Menschlich |
| Emotionen | Keine | Ja |
| Pausen | Mechanisch | Natürlich |
| Betonung | Falsch | Kontextabhängig |
| Aussprache | Fehleranfällig | Sehr gut |
Ethische Aspekte
- Consent: Stimmen nur mit Erlaubnis klonen
- Deepfakes: Missbrauchspotenzial für Betrug
- Kennzeichnung: KI-generierte Stimmen markieren
- Rechtlich: Stimmen können geschützt sein
Schritt für Schritt
Text-to-Speech verantwortungsvoll gestalten
Eine gute synthetische Stimme ist verständlich, kontextgerecht und transparent. Bei Stimmen echter Personen sind Zustimmung und klare Grenzen keine technische Nebensache.
Zielgruppe und Hörsituation verstehen
01
Kläre Sprache, Tempo, Ton, Gerät und ob die Ausgabe als Ergänzung, Assistenz oder eigenständiger Inhalt dient.
Zielgruppe → Kontext → VerständlichkeitszielText für Sprache vorbereiten
02
Strukturiere Zahlen, Abkürzungen, Pausen und schwierige Namen so, dass sie beim Hören eindeutig bleiben.
Rohtext → Aussprache / Pausen → sprechbarer TextStimme und Stil auswählen
03
Wähle eine passende Stimme und Sprache nach Verständlichkeit und Konsistenz, nicht nur nach maximalem Realismus.
Stimmprofil → Sprache → Stil → VorschauRechte und Kennzeichnung sichern
04
Stimmen realer Personen werden nur mit nachvollziehbarer Berechtigung verwendet; synthetische Inhalte werden dort kenntlich gemacht, wo es relevant ist.
Berechtigung → Nutzungskontext → TransparenzhinweisHörerlebnis prüfen und verbessern
05
Teste Aussprache, Verständlichkeit und Fehlinterpretationen mit echten Hörsituationen und passe Text oder Stimme an.
Hörprobe → Feedback → Korrektur → Freigabe
Konkretes Beispiel
Beispiel: Audioversion eines Wissensartikels
Ein Portal möchte lange Texte zusätzlich als gut verständliche Hörversion anbieten.
Gestaltungsfrage
Wie bleibt der Inhalt beim Hören verständlich, wenn Tabellen, Fachbegriffe und Links im Originaltext vorkommen?
Barriereärmere Ausgabe
Ein sprachlich aufbereiteter Text, eine konsistente Stimme, klare Kapitelmarken und eine kurze Prüfung von Aussprache und Tempo durch Testhörer.
TTS entfaltet seinen Wert nicht durch eine möglichst menschliche Stimme allein, sondern durch einen Text und Ablauf, die für das Hören gestaltet sind.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Mehr Zugänglichkeit: Inhalte können auch ohne Lesen oder bei parallelen Tätigkeiten genutzt werden.
- Schnelle Produktion: Viele Textvarianten lassen sich ohne wiederholte Studioaufnahme als Entwurf bereitstellen.
- Konsistentes Erlebnis: Ton, Sprache und Tempo können über viele Inhalte hinweg bewusst gestaltet werden.
Das solltest du beachten
- Aussprachefehler: Namen, Fachsprache und Kontext können selbst bei guter Stimme missverstanden werden.
- Täuschungsrisiko: Sehr natürliche Stimmen brauchen Transparenz und klare Regeln gegen Identitätsmissbrauch.
- Nicht jeder Text passt: Komplexe Tabellen oder visuelle Bezüge müssen für Audio neu aufbereitet werden.
Vertiefung · für FortgeschritteneVom Text zur hörbaren Ausgabe
TTS verbindet sprachlich vorbereiteten Inhalt, Stimmsteuerung und eine Qualitätsprüfung in der tatsächlichen Hörsituation.
Synthetische Sprachwiedergabe aus einem bewusst für Audio vorbereiteten Text.