Text-to-Speech

Wie aus Text verständliche Audioausgaben entstehen – mit Gestaltung für Zugänglichkeit, klarer Kennzeichnung und verantwortetem Umgang mit Stimmen.

KI-Technologie zur Umwandlung von geschriebenem Text in natürlich klingende Sprache – von Voiceover bis Echtzeit-Assistenten.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Wandelt Text in natürlich klingende Sprache um
  2. Moderne Modelle sind kaum von echten Stimmen zu unterscheiden
  3. Voice Cloning ermöglicht individuelle Stimmen mit wenig Training

Sofortantwort

Text-to-Speech einfach erklärt

Automatische Umwandlung von Text in gesprochene Sprache.

Kurz gesagt
Wandelt Text in natürlich klingende Sprache um
Typischer Einsatz
Accessibility, Content Creation, Voice Assistants
Wichtig zu wissen
Voice Cloning ermöglicht individuelle Stimmen mit wenig Training

Text-to-Speech im Überblick

Text-to-Speech (TTS) wandelt geschriebenen Text in gesprochene Sprache um. Moderne KI-Modelle klingen dabei so natürlich, dass sie kaum von echten Menschen zu unterscheiden sind.

Evolution von TTS:

1990er: "Hal-lo. Ich. Bin. Ein. Com-pu-ter."
        → Roboterhaft, unnatürlich

2010er: "Hallo, ich bin ein Computer."
        → Besser, aber noch erkennbar synthetisch

Heute:  "Hallo! Ich bin ein Computer – und das klingt 
         ziemlich natürlich, oder?"
        → Emotionen, Pausen, natürliche Betonung

Aktuelle TTS-Dienste:

DienstQualitätLatenzVoice CloningAbrechnung
ElevenLabs⭐⭐⭐⭐⭐NiedrigJaMonatskontingent
OpenAI TTS⭐⭐⭐⭐NiedrigNeinpro Zeichen
Azure Neural⭐⭐⭐⭐NiedrigJa (Custom)pro Zeichen
Coqui (lokal)⭐⭐⭐MittelJakeine Lizenzkosten

Technisch betrachtet

OpenAI TTS API

from openai import OpenAI

client = OpenAI()

response = client.audio.speech.create(
    model="tts-1-hd",  # oder "tts-1" für schneller
    voice="nova",  # alloy, echo, fable, onyx, nova, shimmer
    input="Hallo, das ist ein Test der Text-to-Speech API.",
    speed=1.0,  # 0.25 bis 4.0
)

# Als Datei speichern
response.stream_to_file("output.mp3")

ElevenLabs

from elevenlabs import generate, set_api_key

set_api_key("YOUR_API_KEY")

audio = generate(
    text="Willkommen zu unserem Podcast!",
    voice="Rachel",  # Oder Voice ID
    model="eleven_multilingual_v2",
)

with open("output.mp3", "wb") as f:
    f.write(audio)

Voice Cloning:

from elevenlabs import clone, generate

# Stimme klonen (braucht Audio-Samples)
voice = clone(
    name="Meine Stimme",
    files=["sample1.mp3", "sample2.mp3"],
    description="Meine geklonte Stimme"
)

# Mit geklonter Stimme generieren
audio = generate(
    text="Das bin ich – oder doch nicht?",
    voice=voice,
)

Lokale TTS mit Coqui

from TTS.api import TTS

# Modell laden
tts = TTS("tts_models/de/thorsten/tacotron2-DDC")

# Text zu Audio
tts.tts_to_file(
    text="Hallo, das ist lokale Sprachsynthese.",
    file_path="output.wav"
)

# Mit Voice Cloning
tts = TTS("tts_models/multilingual/multi-dataset/xtts_v2")
tts.tts_to_file(
    text="Das klingt wie ich!",
    speaker_wav="my_voice_sample.wav",
    language="de",
    file_path="output.wav"
)

SSML für Kontrolle

<speak>
  Willkommen! 
  <break time="500ms"/>
  
  <prosody rate="slow" pitch="+2st">
    Das ist langsamer und höher.
  </prosody>
  
  <emphasis level="strong">
    Das ist wichtig!
  </emphasis>
  
  <say-as interpret-as="date">2026-03-11</say-as>
</speak>

Streaming für Echtzeit

from elevenlabs import stream

# Streaming für niedrige Latenz
audio_stream = stream(
    text="Dies wird in Echtzeit gestreamt...",
    voice="Rachel",
)

# Direkt abspielen
from elevenlabs import play
play(audio_stream)

Qualitätsvergleich

AspektAlte TTSModerne Neural TTS
NatürlichkeitRoboterhaftMenschlich
EmotionenKeineJa
PausenMechanischNatürlich
BetonungFalschKontextabhängig
AusspracheFehleranfälligSehr gut

Ethische Aspekte

  • Consent: Stimmen nur mit Erlaubnis klonen
  • Deepfakes: Missbrauchspotenzial für Betrug
  • Kennzeichnung: KI-generierte Stimmen markieren
  • Rechtlich: Stimmen können geschützt sein

Schritt für Schritt

Text-to-Speech verantwortungsvoll gestalten

Eine gute synthetische Stimme ist verständlich, kontextgerecht und transparent. Bei Stimmen echter Personen sind Zustimmung und klare Grenzen keine technische Nebensache.

  1. Zielgruppe und Hörsituation verstehen

    01

    Kläre Sprache, Tempo, Ton, Gerät und ob die Ausgabe als Ergänzung, Assistenz oder eigenständiger Inhalt dient.

    Zielgruppe → Kontext → Verständlichkeitsziel
  2. Text für Sprache vorbereiten

    02

    Strukturiere Zahlen, Abkürzungen, Pausen und schwierige Namen so, dass sie beim Hören eindeutig bleiben.

    Rohtext → Aussprache / Pausen → sprechbarer Text
  3. Stimme und Stil auswählen

    03

    Wähle eine passende Stimme und Sprache nach Verständlichkeit und Konsistenz, nicht nur nach maximalem Realismus.

    Stimmprofil → Sprache → Stil → Vorschau
  4. Rechte und Kennzeichnung sichern

    04

    Stimmen realer Personen werden nur mit nachvollziehbarer Berechtigung verwendet; synthetische Inhalte werden dort kenntlich gemacht, wo es relevant ist.

    Berechtigung → Nutzungskontext → Transparenzhinweis
  5. Hörerlebnis prüfen und verbessern

    05

    Teste Aussprache, Verständlichkeit und Fehlinterpretationen mit echten Hörsituationen und passe Text oder Stimme an.

    Hörprobe → Feedback → Korrektur → Freigabe

Konkretes Beispiel

Beispiel: Audioversion eines Wissensartikels

Ein Portal möchte lange Texte zusätzlich als gut verständliche Hörversion anbieten.

Gestaltungsfrage

Wie bleibt der Inhalt beim Hören verständlich, wenn Tabellen, Fachbegriffe und Links im Originaltext vorkommen?

Barriereärmere Ausgabe

Ein sprachlich aufbereiteter Text, eine konsistente Stimme, klare Kapitelmarken und eine kurze Prüfung von Aussprache und Tempo durch Testhörer.

TTS entfaltet seinen Wert nicht durch eine möglichst menschliche Stimme allein, sondern durch einen Text und Ablauf, die für das Hören gestaltet sind.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Mehr Zugänglichkeit: Inhalte können auch ohne Lesen oder bei parallelen Tätigkeiten genutzt werden.
  • Schnelle Produktion: Viele Textvarianten lassen sich ohne wiederholte Studioaufnahme als Entwurf bereitstellen.
  • Konsistentes Erlebnis: Ton, Sprache und Tempo können über viele Inhalte hinweg bewusst gestaltet werden.

Das solltest du beachten

  • Aussprachefehler: Namen, Fachsprache und Kontext können selbst bei guter Stimme missverstanden werden.
  • Täuschungsrisiko: Sehr natürliche Stimmen brauchen Transparenz und klare Regeln gegen Identitätsmissbrauch.
  • Nicht jeder Text passt: Komplexe Tabellen oder visuelle Bezüge müssen für Audio neu aufbereitet werden.
Vertiefung · für Fortgeschrittene

Vom Text zur hörbaren Ausgabe

TTS verbindet sprachlich vorbereiteten Inhalt, Stimmsteuerung und eine Qualitätsprüfung in der tatsächlichen Hörsituation.

Wissenskarte

Synthetische Sprachwiedergabe aus einem bewusst für Audio vorbereiteten Text.

Eine verantwortete TTS-Ausgabe verbindet technische Qualität mit Verständlichkeit, Transparenz und den Rechten an verwendeten Stimmen. Text-to-Speech gliedert sich in: Textaufbereitung, Aussprache, Stimmprofil, Audioformat, Kennzeichnung, Hörtest.

01Einsatzbereiche

Wann ist Text-to-Speech sinnvoll?

Geeignet für

  • AccessibilityScreenreader für Sehbehinderte
  • Content CreationVoiceover für Videos, Podcasts, Hörbücher
  • Voice AssistantsSiri, Alexa, Google Assistant sprechen
  • Call CenterAutomatisierte Telefonansagen und IVR

↑ Inhalt

02Werkzeuge

Womit Text-to-Speech umgesetzt wird

↑ Inhalt

Merksatz

Text-to-Speech ist wie ein professioneller Sprecher, der jeden Text vorlesen kann

nur dass er nie müde wird, jede Sprache beherrscht und seine Stimme beliebig anpassbar ist.

  1. Wandelt Text in natürlich klingende Sprache um
  2. Moderne Modelle sind kaum von echten Stimmen zu unterscheiden
  3. Voice Cloning ermöglicht individuelle Stimmen mit wenig Training

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

05FAQ

Häufige Fragen zu Text-to-Speech

Wie natürlich klingt TTS heute?

Sehr natürlich. ElevenLabs und ähnliche sind in Blindtests oft nicht von echten Stimmen zu unterscheiden. Emotionen, Pausen, Betonung – alles wird realistisch umgesetzt.

Kann ich meine eigene Stimme klonen?

Ja, mit Voice Cloning. ElevenLabs braucht ~1 Minute Audio, andere Dienste mehr. Qualität variiert. Ethische und rechtliche Aspekte beachten!

Lokal oder Cloud?

Cloud: Beste Qualität (ElevenLabs, OpenAI). Lokal: Coqui TTS, Piper – gut für Datenschutz, aber etwas weniger natürlich.

Wie teuer ist TTS?

Cloud-Dienste rechnen meist pro Zeichen oder über Monatskontingente ab; Einsteigertarife beginnen im niedrigen einstelligen Dollarbereich pro Monat. Lokale Modelle sind nach dem Setup kostenlos, kosten dafür Rechenzeit. Bei großen Textmengen wird Cloud-TTS schnell teuer – aktuelle Preise beim Anbieter prüfen.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt