Attention Mechanism

Wie Transformer relevante Beziehungen im Kontext gewichten

Der Kernmechanismus moderner KI-Modelle – ermöglicht es einem Modell, sich auf die relevantesten Teile der Eingabe zu konzentrieren, statt alles gleich zu gewichten.

Experte2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Self-Attention: Jedes Token berechnet seine Beziehung zu allen anderen Tokens im Kontext
  2. Multi-Head Attention: Mehrere parallele Attention-Köpfe erfassen verschiedene Beziehungstypen
  3. Grundlage des Transformer-Papers 'Attention Is All You Need' (2017)

Sofortantwort

Attention Mechanism einfach erklärt

Mechanismus zur Fokussierung auf relevante Eingabeteile.

Kurz gesagt
Self-Attention: Jedes Token berechnet seine Beziehung zu allen anderen Tokens im Kontext
Typischer Einsatz
Maschinelle Übersetzung, Textzusammenfassung, Code-Verständnis
Wichtig zu wissen
Grundlage des Transformer-Papers 'Attention Is All You Need' (2017)

Attention Mechanism im Überblick

Der Attention-Mechanismus ist die technologische Grundlage der Transformer-Revolution. Er ermöglicht es einem Modell, bei der Verarbeitung jedes Tokens zu “schauen”, welche anderen Tokens im Kontext relevant sind – und ihre Information gewichtet einzubeziehen. Das löste das fundamentale Problem von RNNs: Lange Abhängigkeiten gingen verloren, weil Information sequenziell durch das Netz fließen musste. Mit Attention kann jedes Token direkt auf jedes andere Token zugreifen.

Attention ist der Kernmechanismus moderner KI-Modelle. Er beantwortet die Frage: Welche Teile der Eingabe sind für die aktuelle Aufgabe am wichtigsten?

Warum ist das revolutionär?

Vor Attention mussten RNNs Information sequenziell verarbeiten – lange Abhängigkeiten gingen verloren. Attention ermöglicht direkte Verbindungen zwischen beliebigen Positionen.

Beispiel:

Eingabe: "Die Katze saß auf der Matte, weil sie müde war."

Frage: Worauf bezieht sich "sie"?
Attention-Gewichte:
  Die [0.02] Katze [0.85] saß [0.01] auf [0.01] der [0.01] 
  Matte [0.05] weil [0.01] sie [*] müde [0.02] war [0.02]
  
=> "sie" hat hohe Attention auf "Katze" (0.85)

Technisch betrachtet

Self-Attention (Scaled Dot-Product)

Jedes Token wird in drei Vektoren transformiert:

  • Query (Q): “Wonach suche ich?”
  • Key (K): “Was biete ich an?”
  • Value (V): “Welche Information trage ich?”
Attention(Q, K, V) = softmax(QK^T / √d_k) · V

Multi-Head Attention

Statt einer Attention-Berechnung laufen mehrere parallel:

  • Head 1: Lernt syntaktische Beziehungen (Subjekt-Verb)
  • Head 2: Lernt semantische Beziehungen (Synonyme)
  • Head 3: Lernt Positionsbeziehungen (Nachbarwörter)

Komplexität

  • O(n²): Attention skaliert quadratisch mit der Sequenzlänge
  • Das ist der Grund für begrenzte Kontextfenster
  • Lösungen: Flash Attention, Sparse Attention, Ring Attention

Schritt für Schritt

Wie Attention Kontext verbindet

Für jedes Token berechnet Attention, welche anderen Tokens für seine aktuelle Repräsentation wichtig sind.

  1. Token in Rollen projizieren

    QKV

    Aus jedem Token entstehen Query, Key und Value – drei gelernte Sichtweisen auf denselben Inhalt.

    Token → Query, Key, Value
  2. Passung bewerten

    Scores

    Eine Query wird mit allen erlaubten Keys verglichen. Daraus entstehen Gewichte für relevante Beziehungen.

    Query × Key → Relevanz
  3. Information gewichten

    Aggregation

    Die Values werden entsprechend der Gewichte kombiniert. So erhält jedes Token kontextabhängige Information.

    Gewichte × Values → Kontext
  4. Mehrere Perspektiven verbinden

    Multi-Head

    Mehrere Attention Heads können gleichzeitig unterschiedliche Muster wie Syntax, Referenzen oder Themenbezüge lernen.

    mehrere Heads → gemeinsame Repräsentation

Konkretes Beispiel

Beispiel: Eine Referenz im Satz verstehen

Das Modell verarbeitet einen Satz, in dem sich ein Pronomen auf ein zuvor genanntes Objekt bezieht.

Ohne Kontextgewichtung

Alle Wörter würden gleich stark in die Deutung des Pronomens einfließen.

Mit Attention

Das Pronomen kann dem passenden Bezugswort ein höheres Gewicht geben, auch wenn mehrere Wörter dazwischenstehen.

Attention liefert keine feste sprachliche Regel. Die Gewichte werden aus Daten gelernt und können je nach Kopf und Schicht unterschiedliche Beziehungen abbilden.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Verbindet weit auseinanderliegende Informationen direkt im Kontext.
  • Ermöglicht parallele Verarbeitung statt rein sequenzieller Schritte.
  • Multi-Head Attention kann verschiedene Beziehungstypen zugleich erfassen.
  • Bildet die Grundlage moderner Transformer für Text, Bilder und weitere Daten.

Das solltest du beachten

  • Volle Attention wächst mit der Kontextlänge quadratisch.
  • Attention-Gewichte sind keine vollständige Erklärung für Modellentscheidungen.
  • Lange Kontexte erhöhen Speicherbedarf und Inferenzkosten.
  • Das Verhalten hängt von Training, Architektur und Aufgabe ab.
Vertiefung · für Fortgeschrittene

Die Rollen in Self-Attention

Query, Key und Value entstehen aus derselben Eingabe, erfüllen aber unterschiedliche Funktionen in der Berechnung.

Wissenskarte

Relevanz gewichten

Die Berechnung wiederholt sich über viele Schichten und erzeugt schrittweise kontextreichere Repräsentationen. Attention gliedert sich in: Tokens, Queries, Keys, Values, Gewichte, Multi-Head.

01Einsatzbereiche

Wann ist Attention Mechanism sinnvoll?

Geeignet für

  • Maschinelle ÜbersetzungAttention verbindet Quell- und Zielwörter korrekt (z.B. Wortstellung Deutsch→Englisch)
  • TextzusammenfassungModell fokussiert auf die wichtigsten Sätze eines langen Dokuments
  • Code-VerständnisVariablenreferenzen über hunderte Zeilen hinweg verfolgen
  • BildverständnisVision Transformers nutzen Attention auf Bildregionen statt Wörter

↑ Inhalt

02Werkzeuge

Womit Attention Mechanism umgesetzt wird

↑ Inhalt

Merksatz

Attention ist wie Lesen mit einem Textmarker

Statt jeden Satz gleich zu behandeln, markierst du die wichtigsten Stellen. Das Modell lernt automatisch, welche Wörter für die aktuelle Aufgabe am relevantesten sind.

  1. Self-Attention: Jedes Token berechnet seine Beziehung zu allen anderen Tokens im Kontext
  2. Multi-Head Attention: Mehrere parallele Attention-Köpfe erfassen verschiedene Beziehungstypen
  3. Grundlage des Transformer-Papers 'Attention Is All You Need' (2017)

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Attention Mechanism spielt.

↑ Inhalt

04Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

Quellen (1)

↑ Inhalt

05FAQ

Häufige Fragen zu Attention Mechanism

Warum ist Attention so wichtig?

Vor Attention mussten RNNs Information sequentiell verarbeiten – lange Abhängigkeiten gingen verloren. Attention ermöglicht direkte Verbindungen zwischen beliebigen Positionen, egal wie weit entfernt.

Was bedeutet 'Attention Is All You Need'?

Das berühmte Paper von 2017 zeigte, dass man nur Attention braucht (ohne RNNs oder CNNs) um State-of-the-Art-Ergebnisse zu erzielen. Das war die Geburt des Transformers.

Wie funktioniert der Attention Mechanism in der Praxis?

Der Attention Mechanism funktioniert, indem er für jedes Element in der Eingabe ein Gewicht berechnet, das angibt, wie wichtig es für die aktuelle Aufgabe ist. Diese Gewichte werden dann verwendet, um die Eingabe zu gewichten und die relevantesten Informationen hervorzuheben.

Welche Vorteile bietet der Attention Mechanism gegenüber traditionellen Ansätzen?

Der Attention Mechanism ermöglicht es Modellen, kontextuelle Informationen besser zu berücksichtigen und sich auf relevante Teile der Eingabe zu konzentrieren. Dies führt zu einer verbesserten Leistung bei Aufgaben wie maschinellem Übersetzen und Textverständnis.

↑ Inhalt

06Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Parameter

    Werte, die das Wissen eines KI-Modells während des Trainings repräsentieren.

↑ Inhalt