Kontextfenster

Wie viel Kontext ein Modell zugleich nutzen kann

Die maximale Menge an Text (gemessen in Tokens), die ein Sprachmodell gleichzeitig verarbeiten kann – bestehend aus Eingabe und Ausgabe zusammen.

Einsteiger3 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Begrenzt die Menge an Text, die ein LLM gleichzeitig 'sehen' kann
  2. Umfasst System Prompt, Konversationsverlauf, Kontext und generierte Antwort
  3. Größere Kontextfenster ermöglichen längere Dokumente und Konversationen

Sofortantwort

Kontextfenster einfach erklärt

Maximale Textmenge, die ein Sprachmodell verarbeiten kann.

Kurz gesagt
Begrenzt die Menge an Text, die ein LLM gleichzeitig 'sehen' kann
Typischer Einsatz
Dokumentenanalyse, Chat-Anwendungen, Code-Analyse
Wichtig zu wissen
Größere Kontextfenster ermöglichen längere Dokumente und Konversationen

Kontextfenster im Überblick

Das Kontextfenster (Context Window) ist die maximale Textmenge, die ein Sprachmodell auf einmal verarbeiten kann. Alles, was du dem Modell schickst (Anweisungen, Kontext, Frage) und alles, was es antwortet, muss in dieses Fenster passen.

Was zählt zum Kontextfenster?

┌─────────────────────────────────────┐
│         Kontextfenster (z.B. 128K)  │
│                                     │
│  ┌─────────────────────────────┐    │
│  │ System Prompt (~500 Tokens) │    │
│  ├─────────────────────────────┤    │
│  │ Konversationsverlauf        │    │
│  │ (~10.000 Tokens)            │    │
│  ├─────────────────────────────┤    │
│  │ RAG-Kontext / Dokumente     │    │
│  │ (~5.000 Tokens)             │    │
│  ├─────────────────────────────┤    │
│  │ Aktuelle Frage (~100 Tokens)│    │
│  ├─────────────────────────────┤    │
│  │ Antwort (~2.000 Tokens)     │    │
│  └─────────────────────────────┘    │
│                                     │
│  Verbleibend: ~110.400 Tokens       │
└─────────────────────────────────────┘

Kontextfenster im Vergleich (Stand Juli 2026 – die Werte ändern sich mit jeder Modellgeneration):

ModellKontextfensterEntspricht ca.
GPT-5.6mehrere 100K Tokenseinige hundert Seiten
Claude Sonnet 4.6bis 1M Tokens~2.350 Seiten
Gemini 3.5 Probis 2M Tokens~4.700 Seiten
Llama 4 Scoutbis 10M Tokens~23.500 Seiten
Mistral Large 3256K Tokens~600 Seiten

Die angegebenen Maximalwerte sagen wenig über die nutzbare Qualität aus: Viele Modelle verlieren bei sehr langen Kontexten an Präzision (siehe “Lost in the Middle”).

Technisch betrachtet

Warum ist das Kontextfenster begrenzt?

Technische Gründe:

  • Quadratische Komplexität: Self-Attention berechnet Beziehungen zwischen allen Token-Paaren → O(n²) Rechenaufwand
  • Speicherbedarf: Der KV-Cache wächst linear mit der Kontextlänge
  • Trainingskosten: Modelle müssen auf langen Sequenzen trainiert werden

Beispielrechnung:

128K Tokens × 128K Tokens = 16,4 Milliarden Attention-Berechnungen
256K Tokens × 256K Tokens = 65,5 Milliarden (4x mehr!)

Techniken für längere Kontexte

Positional Encoding:

  • RoPE (Rotary Position Embedding): Standard in modernen LLMs
  • ALiBi: Addiert einen Bias basierend auf der Distanz zwischen Tokens
  • YaRN / NTK-Scaling: Erweitert RoPE auf längere Kontexte als trainiert

Effiziente Attention:

  • FlashAttention: Optimierte GPU-Speicherzugriffe, keine Approximation
  • Sliding Window Attention: Jedes Token achtet nur auf die letzten N Tokens
  • Sparse Attention: Nur ausgewählte Token-Paare berechnen

KV-Cache-Optimierung:

  • Grouped Query Attention (GQA): Reduziert KV-Cache-Größe
  • Multi-Query Attention (MQA): Noch aggressivere Reduktion
  • PagedAttention (vLLM): Effiziente Speicherverwaltung für den KV-Cache

Lost in the Middle

Ein bekanntes Problem: LLMs nutzen Informationen am Anfang und Ende des Kontexts besser als in der Mitte.

Auswirkungen:

  • Wichtige Informationen in der Mitte langer Kontexte werden übersehen
  • Die Qualität der Antworten sinkt bei sehr langen Kontexten
  • Besonders relevant für RAG mit vielen Dokumenten

Gegenmaßnahmen:

  • Wichtigste Informationen an den Anfang oder das Ende des Kontexts setzen
  • Relevanteste Dokumente zuerst platzieren
  • Kontext auf das Wesentliche beschränken statt alles einzufügen
  • Reranking der Retrieval-Ergebnisse nach Relevanz

Strategien für Kontextmanagement

Sliding Window:

  • Nur die letzten N Nachrichten behalten
  • Einfach zu implementieren, aber Kontext geht verloren

Zusammenfassung:

  • Ältere Konversationsteile zusammenfassen
  • Komprimiert den Kontext bei Erhalt der wichtigsten Informationen
  • Zusätzlicher LLM-Call nötig

RAG statt langer Kontext:

  • Nur relevante Informationen in den Kontext laden
  • Effizienter als den gesamten Kontext zu füllen
  • Bessere Ergebnisse bei großen Wissensbasen

Hierarchisches Chunking:

  • Dokumente auf verschiedenen Abstraktionsebenen speichern
  • Erst grobe Zusammenfassung, dann Details bei Bedarf
  • Optimale Nutzung des verfügbaren Kontexts

Schritt für Schritt

So füllt sich ein Kontextfenster

Alle Informationen einer Anfrage teilen sich einen begrenzten gemeinsamen Platz. Gute Anwendungen planen dieses Budget bewusst.

  1. Bausteine sammeln

    Eingaben

    Systemanweisung, Chatverlauf, Nutzereingabe und abgerufene Dokumente werden für die Anfrage zusammengestellt.

    System + Verlauf + Kontext + Frage
  2. Tokenbudget berechnen

    Planung

    Nicht Zeichen, sondern Tokens zählen. Auch die erwartete Antwort braucht reservierten Platz.

    Eingabe-Tokens + Ausgabe-Reserve ≤ Kontextfenster
  3. Relevanz priorisieren

    Auswahl

    Aktuelle Anweisungen und passende Quellen bleiben erhalten; ältere oder doppelte Inhalte werden gekürzt.

    relevant zuerst · redundant entfernen
  4. Antwort erzeugen

    Inferenz

    Das Modell gewichtet die verfügbaren Tokens gemeinsam und erzeugt daraus die nächste Antwort.

    Kontext → Modell → Antwort

Konkretes Beispiel

Beispiel: Ein langer Support-Chat

Ein Assistent soll auf eine neue Frage antworten, obwohl sich über Wochen viele Nachrichten angesammelt haben.

Ohne Kontextstrategie

Der gesamte Verlauf samt alter Themen und vollständiger Anhänge wird in jede neue Anfrage kopiert.

Mit Kontextstrategie

Die Anwendung behält die letzte Unterhaltung, eine kurze Zusammenfassung und nur die zur Frage passenden Wissensartikel.

Ein größeres Fenster hilft, ersetzt aber keine Auswahl. Relevanter Kontext macht Antworten meist besser und günstiger.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Verbindet Anweisungen, Gespräch und Quellen in einer Anfrage.
  • Ermöglicht die Arbeit mit längeren Dokumenten und Codebasen.
  • Macht aktuelle Informationen ohne Modelltraining nutzbar.
  • Lässt sich über Retrieval, Zusammenfassungen und Caching steuern.

Das solltest du beachten

  • Eingabe und Ausgabe teilen sich dieselbe begrenzte Kapazität.
  • Sehr lange Kontexte erhöhen Kosten und Antwortzeit.
  • Wichtige Details in der Mitte können an Aufmerksamkeit verlieren.
  • Unpassende Quellen lenken das Modell in die falsche Richtung.
Vertiefung · für Fortgeschrittene

Aufteilung des Kontextbudgets

Die Antwortreserve gehört von Anfang an in die Planung.

Wissenskarte

Gemeinsames Tokenbudget

Je nach Aufgabe verteilt die Anwendung das Budget anders – der Mechanismus bleibt derselbe. Kontextfenster gliedert sich in: Systemprompt, Verlauf, Retrieval, Nutzerfrage, Antwortreserve.

01Einsatzbereiche

Wann ist Kontextfenster sinnvoll?

Geeignet für

  • DokumentenanalyseVerarbeitung ganzer Bücher oder langer Berichte in einem einzigen Prompt
  • Chat-AnwendungenLange Konversationen mit Erinnerung an frühere Nachrichten
  • Code-AnalyseVerständnis großer Codebasen durch Einbeziehung vieler Dateien
  • ZusammenfassungenZusammenfassung langer Dokumente ohne Informationsverlust

↑ Inhalt

02Werkzeuge

Womit Kontextfenster umgesetzt wird

↑ Inhalt

Merksatz

Das Kontextfenster ist wie der Schreibtisch eines Sachbearbeiters

Er kann nur eine begrenzte Anzahl an Dokumenten gleichzeitig ausbreiten und überblicken. Alles, was nicht auf den Schreibtisch passt, kann er nicht berücksichtigen.

  1. Begrenzt die Menge an Text, die ein LLM gleichzeitig 'sehen' kann
  2. Umfasst System Prompt, Konversationsverlauf, Kontext und generierte Antwort
  3. Größere Kontextfenster ermöglichen längere Dokumente und Konversationen

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für Kontextfenster spielt.

↑ Inhalt

04Anwenden

Kontextfenster praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Kontextfenster

Was passiert, wenn das Kontextfenster voll ist?

Das Modell kann keine weiteren Tokens verarbeiten. Bei Chat-Anwendungen werden typischerweise die ältesten Nachrichten entfernt. Bei API-Aufrufen gibt es einen Fehler. Entwickler müssen Strategien wie Zusammenfassung oder Sliding Window implementieren.

Ist ein größeres Kontextfenster immer besser?

Nicht unbedingt. Größere Kontextfenster kosten mehr (pro Token), und Modelle können bei sehr langen Kontexten Informationen in der Mitte 'vergessen' (Lost in the Middle Problem). Für viele Aufgaben ist ein gezielter, kürzerer Kontext effektiver.

Wie viel Text sind 128K Tokens?

Ungefähr 96.000 Wörter oder etwa 300 Seiten Text. Das entspricht einem durchschnittlichen Roman. In der Praxis wird ein Teil des Kontextfensters für System Prompt und Antwort benötigt.

Warum nutzt man RAG, wenn es große Kontextfenster gibt?

Selbst 2M Tokens reichen nicht für alle Unternehmensdaten. Außerdem: Gezielte Retrieval-Ergebnisse liefern oft bessere Antworten als das Einfügen aller Dokumente. Und die Kosten steigen linear mit der Kontextlänge.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Transformer

    Neuronale Netzwerk-Architektur, die moderne Sprachmodelle unterstützt.

  • Technisch vertiefen

    Tokens

    Texteinheiten, die ein Sprachmodell verarbeiten kann.

  • In der Praxis anwenden

    ChatGPT Alternativen im Vergleich 2026

    Claude, Gemini, Copilot, Perplexity oder Le Chat – welche ChatGPT-Alternative passt zu dir?

↑ Inhalt