Sofortantwort
Attention Mechanism einfach erklärt
Mechanismus zur Fokussierung auf relevante Eingabeteile.
- Kurz gesagt
- Self-Attention: Jedes Token berechnet seine Beziehung zu allen anderen Tokens im Kontext
- Typischer Einsatz
- Maschinelle Übersetzung, Textzusammenfassung, Code-Verständnis
- Wichtig zu wissen
- Grundlage des Transformer-Papers 'Attention Is All You Need' (2017)
Attention Mechanism im Überblick
Der Attention-Mechanismus ist die technologische Grundlage der Transformer-Revolution. Er ermöglicht es einem Modell, bei der Verarbeitung jedes Tokens zu “schauen”, welche anderen Tokens im Kontext relevant sind – und ihre Information gewichtet einzubeziehen. Das löste das fundamentale Problem von RNNs: Lange Abhängigkeiten gingen verloren, weil Information sequenziell durch das Netz fließen musste. Mit Attention kann jedes Token direkt auf jedes andere Token zugreifen.
Attention ist der Kernmechanismus moderner KI-Modelle. Er beantwortet die Frage: Welche Teile der Eingabe sind für die aktuelle Aufgabe am wichtigsten?
Warum ist das revolutionär?
Vor Attention mussten RNNs Information sequenziell verarbeiten – lange Abhängigkeiten gingen verloren. Attention ermöglicht direkte Verbindungen zwischen beliebigen Positionen.
Beispiel:
Eingabe: "Die Katze saß auf der Matte, weil sie müde war."
Frage: Worauf bezieht sich "sie"?
Attention-Gewichte:
Die [0.02] Katze [0.85] saß [0.01] auf [0.01] der [0.01]
Matte [0.05] weil [0.01] sie [*] müde [0.02] war [0.02]
=> "sie" hat hohe Attention auf "Katze" (0.85)
Technisch betrachtet
Self-Attention (Scaled Dot-Product)
Jedes Token wird in drei Vektoren transformiert:
- Query (Q): “Wonach suche ich?”
- Key (K): “Was biete ich an?”
- Value (V): “Welche Information trage ich?”
Attention(Q, K, V) = softmax(QK^T / √d_k) · V
Multi-Head Attention
Statt einer Attention-Berechnung laufen mehrere parallel:
- Head 1: Lernt syntaktische Beziehungen (Subjekt-Verb)
- Head 2: Lernt semantische Beziehungen (Synonyme)
- Head 3: Lernt Positionsbeziehungen (Nachbarwörter)
Komplexität
- O(n²): Attention skaliert quadratisch mit der Sequenzlänge
- Das ist der Grund für begrenzte Kontextfenster
- Lösungen: Flash Attention, Sparse Attention, Ring Attention
Schritt für Schritt
Wie Attention Kontext verbindet
Für jedes Token berechnet Attention, welche anderen Tokens für seine aktuelle Repräsentation wichtig sind.
Token in Rollen projizieren
QKV
Aus jedem Token entstehen Query, Key und Value – drei gelernte Sichtweisen auf denselben Inhalt.
Token → Query, Key, ValuePassung bewerten
Scores
Eine Query wird mit allen erlaubten Keys verglichen. Daraus entstehen Gewichte für relevante Beziehungen.
Query × Key → RelevanzInformation gewichten
Aggregation
Die Values werden entsprechend der Gewichte kombiniert. So erhält jedes Token kontextabhängige Information.
Gewichte × Values → KontextMehrere Perspektiven verbinden
Multi-Head
Mehrere Attention Heads können gleichzeitig unterschiedliche Muster wie Syntax, Referenzen oder Themenbezüge lernen.
mehrere Heads → gemeinsame Repräsentation
Konkretes Beispiel
Beispiel: Eine Referenz im Satz verstehen
Das Modell verarbeitet einen Satz, in dem sich ein Pronomen auf ein zuvor genanntes Objekt bezieht.
Ohne Kontextgewichtung
Alle Wörter würden gleich stark in die Deutung des Pronomens einfließen.
Mit Attention
Das Pronomen kann dem passenden Bezugswort ein höheres Gewicht geben, auch wenn mehrere Wörter dazwischenstehen.
Attention liefert keine feste sprachliche Regel. Die Gewichte werden aus Daten gelernt und können je nach Kopf und Schicht unterschiedliche Beziehungen abbilden.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Verbindet weit auseinanderliegende Informationen direkt im Kontext.
- Ermöglicht parallele Verarbeitung statt rein sequenzieller Schritte.
- Multi-Head Attention kann verschiedene Beziehungstypen zugleich erfassen.
- Bildet die Grundlage moderner Transformer für Text, Bilder und weitere Daten.
Das solltest du beachten
- Volle Attention wächst mit der Kontextlänge quadratisch.
- Attention-Gewichte sind keine vollständige Erklärung für Modellentscheidungen.
- Lange Kontexte erhöhen Speicherbedarf und Inferenzkosten.
- Das Verhalten hängt von Training, Architektur und Aufgabe ab.
Vertiefung · für FortgeschritteneDie Rollen in Self-Attention
Query, Key und Value entstehen aus derselben Eingabe, erfüllen aber unterschiedliche Funktionen in der Berechnung.
Relevanz gewichten