Sofortantwort
Kontextfenster einfach erklärt
Maximale Textmenge, die ein Sprachmodell verarbeiten kann.
- Kurz gesagt
- Begrenzt die Menge an Text, die ein LLM gleichzeitig 'sehen' kann
- Typischer Einsatz
- Dokumentenanalyse, Chat-Anwendungen, Code-Analyse
- Wichtig zu wissen
- Größere Kontextfenster ermöglichen längere Dokumente und Konversationen
Kontextfenster im Überblick
Das Kontextfenster (Context Window) ist die maximale Textmenge, die ein Sprachmodell auf einmal verarbeiten kann. Alles, was du dem Modell schickst (Anweisungen, Kontext, Frage) und alles, was es antwortet, muss in dieses Fenster passen.
Was zählt zum Kontextfenster?
┌─────────────────────────────────────┐
│ Kontextfenster (z.B. 128K) │
│ │
│ ┌─────────────────────────────┐ │
│ │ System Prompt (~500 Tokens) │ │
│ ├─────────────────────────────┤ │
│ │ Konversationsverlauf │ │
│ │ (~10.000 Tokens) │ │
│ ├─────────────────────────────┤ │
│ │ RAG-Kontext / Dokumente │ │
│ │ (~5.000 Tokens) │ │
│ ├─────────────────────────────┤ │
│ │ Aktuelle Frage (~100 Tokens)│ │
│ ├─────────────────────────────┤ │
│ │ Antwort (~2.000 Tokens) │ │
│ └─────────────────────────────┘ │
│ │
│ Verbleibend: ~110.400 Tokens │
└─────────────────────────────────────┘
Kontextfenster im Vergleich (Stand Juli 2026 – die Werte ändern sich mit jeder Modellgeneration):
| Modell | Kontextfenster | Entspricht ca. |
|---|---|---|
| GPT-5.6 | mehrere 100K Tokens | einige hundert Seiten |
| Claude Sonnet 4.6 | bis 1M Tokens | ~2.350 Seiten |
| Gemini 3.5 Pro | bis 2M Tokens | ~4.700 Seiten |
| Llama 4 Scout | bis 10M Tokens | ~23.500 Seiten |
| Mistral Large 3 | 256K Tokens | ~600 Seiten |
Die angegebenen Maximalwerte sagen wenig über die nutzbare Qualität aus: Viele Modelle verlieren bei sehr langen Kontexten an Präzision (siehe “Lost in the Middle”).
Technisch betrachtet
Warum ist das Kontextfenster begrenzt?
Technische Gründe:
- Quadratische Komplexität: Self-Attention berechnet Beziehungen zwischen allen Token-Paaren → O(n²) Rechenaufwand
- Speicherbedarf: Der KV-Cache wächst linear mit der Kontextlänge
- Trainingskosten: Modelle müssen auf langen Sequenzen trainiert werden
Beispielrechnung:
128K Tokens × 128K Tokens = 16,4 Milliarden Attention-Berechnungen
256K Tokens × 256K Tokens = 65,5 Milliarden (4x mehr!)
Techniken für längere Kontexte
Positional Encoding:
- RoPE (Rotary Position Embedding): Standard in modernen LLMs
- ALiBi: Addiert einen Bias basierend auf der Distanz zwischen Tokens
- YaRN / NTK-Scaling: Erweitert RoPE auf längere Kontexte als trainiert
Effiziente Attention:
- FlashAttention: Optimierte GPU-Speicherzugriffe, keine Approximation
- Sliding Window Attention: Jedes Token achtet nur auf die letzten N Tokens
- Sparse Attention: Nur ausgewählte Token-Paare berechnen
KV-Cache-Optimierung:
- Grouped Query Attention (GQA): Reduziert KV-Cache-Größe
- Multi-Query Attention (MQA): Noch aggressivere Reduktion
- PagedAttention (vLLM): Effiziente Speicherverwaltung für den KV-Cache
Lost in the Middle
Ein bekanntes Problem: LLMs nutzen Informationen am Anfang und Ende des Kontexts besser als in der Mitte.
Auswirkungen:
- Wichtige Informationen in der Mitte langer Kontexte werden übersehen
- Die Qualität der Antworten sinkt bei sehr langen Kontexten
- Besonders relevant für RAG mit vielen Dokumenten
Gegenmaßnahmen:
- Wichtigste Informationen an den Anfang oder das Ende des Kontexts setzen
- Relevanteste Dokumente zuerst platzieren
- Kontext auf das Wesentliche beschränken statt alles einzufügen
- Reranking der Retrieval-Ergebnisse nach Relevanz
Strategien für Kontextmanagement
Sliding Window:
- Nur die letzten N Nachrichten behalten
- Einfach zu implementieren, aber Kontext geht verloren
Zusammenfassung:
- Ältere Konversationsteile zusammenfassen
- Komprimiert den Kontext bei Erhalt der wichtigsten Informationen
- Zusätzlicher LLM-Call nötig
RAG statt langer Kontext:
- Nur relevante Informationen in den Kontext laden
- Effizienter als den gesamten Kontext zu füllen
- Bessere Ergebnisse bei großen Wissensbasen
Hierarchisches Chunking:
- Dokumente auf verschiedenen Abstraktionsebenen speichern
- Erst grobe Zusammenfassung, dann Details bei Bedarf
- Optimale Nutzung des verfügbaren Kontexts
Schritt für Schritt
So füllt sich ein Kontextfenster
Alle Informationen einer Anfrage teilen sich einen begrenzten gemeinsamen Platz. Gute Anwendungen planen dieses Budget bewusst.
Bausteine sammeln
Eingaben
Systemanweisung, Chatverlauf, Nutzereingabe und abgerufene Dokumente werden für die Anfrage zusammengestellt.
System + Verlauf + Kontext + FrageTokenbudget berechnen
Planung
Nicht Zeichen, sondern Tokens zählen. Auch die erwartete Antwort braucht reservierten Platz.
Eingabe-Tokens + Ausgabe-Reserve ≤ KontextfensterRelevanz priorisieren
Auswahl
Aktuelle Anweisungen und passende Quellen bleiben erhalten; ältere oder doppelte Inhalte werden gekürzt.
relevant zuerst · redundant entfernenAntwort erzeugen
Inferenz
Das Modell gewichtet die verfügbaren Tokens gemeinsam und erzeugt daraus die nächste Antwort.
Kontext → Modell → Antwort
Konkretes Beispiel
Beispiel: Ein langer Support-Chat
Ein Assistent soll auf eine neue Frage antworten, obwohl sich über Wochen viele Nachrichten angesammelt haben.
Ohne Kontextstrategie
Der gesamte Verlauf samt alter Themen und vollständiger Anhänge wird in jede neue Anfrage kopiert.
Mit Kontextstrategie
Die Anwendung behält die letzte Unterhaltung, eine kurze Zusammenfassung und nur die zur Frage passenden Wissensartikel.
Ein größeres Fenster hilft, ersetzt aber keine Auswahl. Relevanter Kontext macht Antworten meist besser und günstiger.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Verbindet Anweisungen, Gespräch und Quellen in einer Anfrage.
- Ermöglicht die Arbeit mit längeren Dokumenten und Codebasen.
- Macht aktuelle Informationen ohne Modelltraining nutzbar.
- Lässt sich über Retrieval, Zusammenfassungen und Caching steuern.
Das solltest du beachten
- Eingabe und Ausgabe teilen sich dieselbe begrenzte Kapazität.
- Sehr lange Kontexte erhöhen Kosten und Antwortzeit.
- Wichtige Details in der Mitte können an Aufmerksamkeit verlieren.
- Unpassende Quellen lenken das Modell in die falsche Richtung.
Vertiefung · für FortgeschritteneAufteilung des Kontextbudgets
Die Antwortreserve gehört von Anfang an in die Planung.
Gemeinsames Tokenbudget