Sofortantwort
Chunking & Reranking einfach erklärt
Techniken zur Strukturierung und Sortierung von Dokumenten.
- Kurz gesagt
- Chunking: Dokumente in optimale Abschnitte teilen (typisch 256-1024 Tokens)
- Typischer Einsatz
- Dokumenten-QA, Knowledge Base, Code-Suche
- Wichtig zu wissen
- Beide zusammen verbessern die Qualität von RAG-Systemen erheblich
Chunking & Reranking im Überblick
Chunking und Reranking sind zwei unverzichtbare Techniken in RAG-Systemen (Retrieval-Augmented Generation). Chunking löst das Problem, dass Dokumente zu lang für ein einzelnes Embedding sind – sie werden in kleinere, semantisch kohärente Stücke aufgeteilt. Reranking verbessert die Qualität der gefundenen Chunks: Die erste Vektorsuche findet schnell viele Kandidaten, aber nicht immer in der optimalen Reihenfolge. Ein Reranker bewertet die Relevanz jedes Chunks zum Query neu und sortiert die Ergebnisse um.
Chunking löst das Problem: Dokumente sind zu lang für Embeddings. Also teilt man sie in kleinere Stücke.
Reranking löst das Problem: Die erste Suche findet viele Ergebnisse, aber nicht immer in der richtigen Reihenfolge.
Dokument (50 Seiten)
→ Chunking → [Chunk 1] [Chunk 2] ... [Chunk 200]
→ Embedding → Vektordatenbank
→ Suche → Top 20 Chunks
→ Reranking → Top 5 relevanteste Chunks
→ LLM → Antwort basierend auf den 5 besten Chunks
Technisch betrachtet
Chunking-Strategien
- Fixed Size: Feste Token-Anzahl mit Overlap (einfach, oft gut genug)
- Recursive: An natürlichen Grenzen splitten (Absätze, Sätze, Wörter)
- Semantic: Chunks an thematischen Übergängen trennen
- Document-Aware: Markdown-Headings, Code-Funktionen als Grenzen
Reranking
Zwei Ansätze:
- Cross-Encoder: Query + Chunk zusammen durch ein Modell → Relevanz-Score
- ColBERT: Token-Level Interaktion für schnelleres Reranking
Cross-Encoder ist genauer aber langsamer. Daher: Erst schnelle Vektor-Suche (Top 50), dann Cross-Encoder Reranking (Top 5).
Schritt für Schritt
Vom Dokument zu den besten Kontextstellen
Retrieval wird zuverlässiger, wenn Dokumente sinnvoll zerlegt und die ersten Suchtreffer noch einmal geprüft werden.
Struktur erkennen und teilen
Chunking
Überschriften, Absätze und Satzgrenzen helfen, in sich verständliche Abschnitte statt beliebiger Textstücke zu bilden.
Dokument → überlappende AbschnitteAbschnitte indexieren
Index
Jeder Chunk erhält ein Embedding und Metadaten wie Quelle, Kapitel, Datum oder Berechtigung.
Chunk + Metadaten → VektorindexBreit suchen
Recall
Die Anfrage holt zunächst mehrere semantisch passende Kandidaten aus dem Index.
Frage → Top 20 KandidatenTreffer nachordnen
Precision
Ein Reranker bewertet Frage und Chunk gemeinsam und bringt die wirklich passenden Stellen nach vorn.
Top 20 → Top 5 Kontextstellen
Konkretes Beispiel
Beispiel: Eine lange Reiserichtlinie
Eine Mitarbeiterin fragt nach der erlaubten Hotelkategorie bei einer internationalen Reise.
Nur grobe Abschnitte
Ein großer Chunk enthält Regeln zu Flügen, Hotels, Spesen und Freigaben. Die Antwort muss irrelevante Inhalte auseinanderhalten.
Strukturierte Suche mit Reranking
Kleine, zusammenhängende Hotelabschnitte werden gefunden. Der Reranker priorisiert die Regel für internationale Reisen und verlinkt die Quelle.
Chunking erhöht die Auffindbarkeit; Reranking sorgt dafür, dass unter den Kandidaten die präzisesten Belege im Kontext landen.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Macht lange Dokumente gezielt und nachvollziehbar durchsuchbar.
- Verringert irrelevanten Kontext in der Modellanfrage.
- Verbessert die Qualität der besten Treffer nach einer breiten Suche.
- Erlaubt Quellenangaben auf Abschnittsebene.
Das solltest du beachten
- Zu kleine Chunks verlieren Zusammenhänge und Definitionen.
- Zu große Chunks verwässern die semantische Suche.
- Reranking bringt einen zusätzlichen Modellaufruf und Latenz mit sich.
- Parameter wie Länge, Überlappung und Top-k brauchen Evaluation.
Vertiefung · für FortgeschritteneRetrieval-Pipeline für Dokumente
Die erste Suche maximiert Abdeckung, die zweite Stufe maximiert Passung.
Kontext auswählen