Sofortantwort
Decoder einfach erklärt
Transformer-Komponente, die Ausgaben Token für Token generiert.
- Kurz gesagt
- Erzeugt Ausgabesequenzen autoregressiv – ein Token nach dem anderen
- Typischer Einsatz
- Textgenerierung, Maschinelle Übersetzung, Code-Vervollständigung
- Wichtig zu wissen
- Reine Decoder-Architekturen sind die Grundlage moderner LLMs wie GPT und Claude
Decoder im Überblick
Der Decoder ist der Teil eines Transformer-Modells, der Ausgaben erzeugt. Während ein Encoder eine Eingabe versteht und in eine interne Repräsentation übersetzt, baut der Decoder daraus – oder aus dem bisher Geschriebenen – Stück für Stück die Ausgabe auf: ein Token nach dem anderen.
Moderne große Sprachmodelle wie GPT und Claude sind Decoder-only-Modelle. Sie bestehen ausschließlich aus gestapelten Decoder-Schichten und erzeugen Text, indem sie immer wieder das wahrscheinlichste nächste Token vorhersagen.
Technisch betrachtet
Autoregressive Generierung
Der Decoder arbeitet autoregressiv: Jedes neu erzeugte Token wird an die Eingabe angehängt und dient als Grundlage für das nächste. So entsteht Text streng von links nach rechts.
"Die Hauptstadt" → "von" → "Deutschland" → "ist" → "Berlin"
Maskierte Self-Attention
Damit das Modell beim Training nicht in die Zukunft blickt, verwendet der Decoder eine kausale Maske: Jedes Token darf nur sich selbst und vorherige Tokens betrachten. Ohne diese Maske könnte das Modell die zu lernende Antwort einfach ablesen.
Architektur-Varianten
| Architektur | Aufbau | Typischer Einsatz |
|---|---|---|
| Encoder-only | nur Encoder | Textverständnis (z. B. BERT) |
| Decoder-only | nur Decoder | Textgenerierung (GPT, Claude) |
| Encoder-Decoder | beides | Übersetzung, Zusammenfassung (T5) |
Der Erfolg der Decoder-only-Architektur liegt in ihrer Einfachheit: Ein einziges Trainingsziel – das nächste Token vorhersagen – reicht aus, um erstaunlich allgemeine Sprachfähigkeiten zu erlernen.