Chunking & Reranking

Dokumente passend teilen und Treffer präzise ordnen

Zwei Schlüsseltechniken für RAG-Systeme: Chunking teilt Dokumente in suchbare Abschnitte, Reranking sortiert die Ergebnisse nach Relevanz.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Chunking: Dokumente in optimale Abschnitte teilen (typisch 256-1024 Tokens)
  2. Reranking: Erste Suchergebnisse mit einem spezialisierten Modell neu sortieren
  3. Beide zusammen verbessern die Qualität von RAG-Systemen erheblich

Sofortantwort

Chunking & Reranking einfach erklärt

Techniken zur Strukturierung und Sortierung von Dokumenten.

Kurz gesagt
Chunking: Dokumente in optimale Abschnitte teilen (typisch 256-1024 Tokens)
Typischer Einsatz
Dokumenten-QA, Knowledge Base, Code-Suche
Wichtig zu wissen
Beide zusammen verbessern die Qualität von RAG-Systemen erheblich

Chunking & Reranking im Überblick

Chunking und Reranking sind zwei unverzichtbare Techniken in RAG-Systemen (Retrieval-Augmented Generation). Chunking löst das Problem, dass Dokumente zu lang für ein einzelnes Embedding sind – sie werden in kleinere, semantisch kohärente Stücke aufgeteilt. Reranking verbessert die Qualität der gefundenen Chunks: Die erste Vektorsuche findet schnell viele Kandidaten, aber nicht immer in der optimalen Reihenfolge. Ein Reranker bewertet die Relevanz jedes Chunks zum Query neu und sortiert die Ergebnisse um.

Chunking löst das Problem: Dokumente sind zu lang für Embeddings. Also teilt man sie in kleinere Stücke.

Reranking löst das Problem: Die erste Suche findet viele Ergebnisse, aber nicht immer in der richtigen Reihenfolge.

Dokument (50 Seiten)
  → Chunking → [Chunk 1] [Chunk 2] ... [Chunk 200]
  → Embedding → Vektordatenbank
  → Suche → Top 20 Chunks
  → Reranking → Top 5 relevanteste Chunks
  → LLM → Antwort basierend auf den 5 besten Chunks

Technisch betrachtet

Chunking-Strategien

  • Fixed Size: Feste Token-Anzahl mit Overlap (einfach, oft gut genug)
  • Recursive: An natürlichen Grenzen splitten (Absätze, Sätze, Wörter)
  • Semantic: Chunks an thematischen Übergängen trennen
  • Document-Aware: Markdown-Headings, Code-Funktionen als Grenzen

Reranking

Zwei Ansätze:

  • Cross-Encoder: Query + Chunk zusammen durch ein Modell → Relevanz-Score
  • ColBERT: Token-Level Interaktion für schnelleres Reranking

Cross-Encoder ist genauer aber langsamer. Daher: Erst schnelle Vektor-Suche (Top 50), dann Cross-Encoder Reranking (Top 5).

Schritt für Schritt

Vom Dokument zu den besten Kontextstellen

Retrieval wird zuverlässiger, wenn Dokumente sinnvoll zerlegt und die ersten Suchtreffer noch einmal geprüft werden.

  1. Struktur erkennen und teilen

    Chunking

    Überschriften, Absätze und Satzgrenzen helfen, in sich verständliche Abschnitte statt beliebiger Textstücke zu bilden.

    Dokument → überlappende Abschnitte
  2. Abschnitte indexieren

    Index

    Jeder Chunk erhält ein Embedding und Metadaten wie Quelle, Kapitel, Datum oder Berechtigung.

    Chunk + Metadaten → Vektorindex
  3. Breit suchen

    Recall

    Die Anfrage holt zunächst mehrere semantisch passende Kandidaten aus dem Index.

    Frage → Top 20 Kandidaten
  4. Treffer nachordnen

    Precision

    Ein Reranker bewertet Frage und Chunk gemeinsam und bringt die wirklich passenden Stellen nach vorn.

    Top 20 → Top 5 Kontextstellen

Konkretes Beispiel

Beispiel: Eine lange Reiserichtlinie

Eine Mitarbeiterin fragt nach der erlaubten Hotelkategorie bei einer internationalen Reise.

Nur grobe Abschnitte

Ein großer Chunk enthält Regeln zu Flügen, Hotels, Spesen und Freigaben. Die Antwort muss irrelevante Inhalte auseinanderhalten.

Strukturierte Suche mit Reranking

Kleine, zusammenhängende Hotelabschnitte werden gefunden. Der Reranker priorisiert die Regel für internationale Reisen und verlinkt die Quelle.

Chunking erhöht die Auffindbarkeit; Reranking sorgt dafür, dass unter den Kandidaten die präzisesten Belege im Kontext landen.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Macht lange Dokumente gezielt und nachvollziehbar durchsuchbar.
  • Verringert irrelevanten Kontext in der Modellanfrage.
  • Verbessert die Qualität der besten Treffer nach einer breiten Suche.
  • Erlaubt Quellenangaben auf Abschnittsebene.

Das solltest du beachten

  • Zu kleine Chunks verlieren Zusammenhänge und Definitionen.
  • Zu große Chunks verwässern die semantische Suche.
  • Reranking bringt einen zusätzlichen Modellaufruf und Latenz mit sich.
  • Parameter wie Länge, Überlappung und Top-k brauchen Evaluation.
Vertiefung · für Fortgeschrittene

Retrieval-Pipeline für Dokumente

Die erste Suche maximiert Abdeckung, die zweite Stufe maximiert Passung.

Wissenskarte

Kontext auswählen

Welche Chunkgröße passt, hängt von Dokumenttyp, Fragearten und dem verwendeten Modell ab. Retrieval gliedert sich in: Dokumente, Chunks, Embeddings, Vektorsuche, Reranker, LLM.

01Einsatzbereiche

Wann ist Chunking & Reranking sinnvoll?

Geeignet für

  • Dokumenten-QALange PDFs chunken und die relevantesten Abschnitte für Antworten nutzen
  • Knowledge BaseUnternehmens-Wiki in Chunks aufteilen für präzise interne Suche
  • Code-SucheCode-Dateien in Funktionen/Klassen chunken für kontextbezogene Suche

↑ Inhalt

02Werkzeuge

Womit Chunking & Reranking umgesetzt wird

↑ Inhalt

Merksatz

Chunking ist wie ein Buch in Kapitel aufteilen, damit man gezielt nachschlagen kann. Reranking ist wie ein Bibliothekar, der die gefundenen Bücher nach Relevanz für deine Frage sortiert.

  1. Chunking: Dokumente in optimale Abschnitte teilen (typisch 256-1024 Tokens)
  2. Reranking: Erste Suchergebnisse mit einem spezialisierten Modell neu sortieren
  3. Beide zusammen verbessern die Qualität von RAG-Systemen erheblich

04Anwenden

Chunking & Reranking praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Chunking & Reranking

Wie groß sollten Chunks sein?

256-512 Tokens für präzise Suche, 512-1024 für mehr Kontext. Zu klein = fehlender Kontext, zu groß = irrelevante Information. Am besten experimentieren.

Braucht man immer Reranking?

Nicht immer, aber es hilft fast immer. Embedding-basierte Suche ist gut für Recall (viel finden), Reranking verbessert die Precision (das Relevanteste nach oben).

Wie beeinflusst Chunking die Leistung eines RAG-Systems?

Chunking verbessert die Leistung eines RAG-Systems, indem es große Dokumente in kleinere, suchbare Abschnitte unterteilt. Dies ermöglicht eine schnellere und genauere Suche, da das System gezielt relevante Informationen aus den kleineren Chunks extrahieren kann.

Was sind die besten Methoden zur Implementierung von Reranking?

Die besten Methoden zur Implementierung von Reranking umfassen die Verwendung von maschinellen Lernmodellen, die auf Relevanz trainiert sind, sowie die Berücksichtigung von Benutzerfeedback. Eine Kombination aus heuristischen Ansätzen und datengetriebenen Modellen kann die Genauigkeit der Reranking-Resultate erheblich verbessern.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

↑ Inhalt