Sofortantwort
RAG einfach erklärt
Kombination von LLMs mit externen Wissensdatenbanken für Genauigkeit.
- Kurz gesagt
- Verbindet LLMs mit externen Wissensdatenbanken für aktuelle und präzise Informationen
- Typischer Einsatz
- Unternehmens-Chatbots, Forschungsassistenten, Code-Dokumentation
- Wichtig zu wissen
- Ermöglicht domänenspezifisches Wissen ohne aufwändiges Fine-Tuning
Was ist Retrieval Augmented Generation?
RAG (Retrieval-Augmented Generation) verbindet ein Large Language Model mit einer externen Wissensquelle. Bevor das Modell antwortet, sucht ein Retrieval-System passende Dokumentabschnitte und liefert sie als Kontext mit. Die Antwort stützt sich dadurch nicht allein auf Wissen aus dem Trainingszeitraum.
Das macht RAG besonders nützlich für Informationen, die sich ändern, nur intern verfügbar sind oder mit Quellen belegt werden sollen. Statt ein Modell für jede neue Dokumentversion neu zu trainieren, aktualisierst du den zugrunde liegenden Wissensbestand.
Wann ist RAG sinnvoll?
RAG ist eine gute Wahl, wenn du eine große und wechselnde Wissensbasis durchsuchbar machen willst: etwa Produktdokumentationen, Verträge, Support-Artikel oder Forschungsergebnisse. Es passt auch dann, wenn die Antwort ihre Quellen offenlegen soll.
Die Methode ist kein Ersatz für saubere Inhalte oder Zugriffsrechte. Das System kann nur so zuverlässig antworten wie die Dokumente, die es findet und in den Kontext gibt.
Schritt für Schritt
So funktioniert RAG
RAG ergänzt das Wissen eines Sprachmodells zur Laufzeit. Entscheidend ist nicht nur das Modell, sondern die Qualität der gefundenen Inhalte.
Inhalte vorbereiten
Indexierung
Dokumente werden in sinnvolle Abschnitte geteilt und als Embeddings in einer Vektordatenbank abgelegt.
Dokument → Chunks → Embeddings → VektordatenbankFrage verstehen
Retrieval
Die Anfrage wird ebenfalls als Embedding abgebildet. Die Suche findet die inhaltlich ähnlichsten Dokumentabschnitte.
Frage → Embedding → Ähnlichkeitssuche → relevante ChunksKontext zusammenstellen
Augmentation
Die gefundenen Abschnitte werden zusammen mit der Frage in einen klaren Prompt für das Sprachmodell eingefügt.
Kontext + Frage + Regeln → PromptAntwort mit Belegen erzeugen
Generation
Das Modell antwortet auf Basis des bereitgestellten Kontexts. Gute Systeme nennen die verwendeten Quellen direkt mit.
Prompt → LLM → Antwort + Quellen
Konkretes Beispiel
RAG an einem einfachen Beispiel
Ein Support-Chatbot soll eine Frage zu einer gerade geänderten Produktfunktion beantworten.
Ohne RAG
Das Modell kann nur auf sein Trainingswissen zurückgreifen. Es kennt die neue Funktion möglicherweise nicht oder vermischt sie mit älteren Informationen.
Mit RAG
Die Suche findet die aktuelle Produktdokumentation. Das Modell nutzt genau diese Abschnitte als Kontext und kann die Antwort mit einem Link zur Quelle belegen.
RAG ersetzt kein Sprachmodell – es gibt ihm im Moment der Antwort einen überprüfbaren Wissensstand.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Aktuelle Informationen lassen sich durch neue Dokumente ergänzen, ohne das Modell neu zu trainieren.
- Antworten können auf konkrete Quellen verweisen und dadurch nachvollziehbarer werden.
- Spezialwissen bleibt außerhalb der Modellgewichte und lässt sich gezielt verwalten.
- Ein erster Prototyp ist meist schneller umgesetzt als ein Fine-Tuning-Projekt.
Das solltest du beachten
- Schlechte oder unvollständige Dokumente führen trotz gutem Modell zu schwachen Antworten.
- Retrieval, Embeddings und Vektordatenbank erhöhen Architektur, Latenz und Betriebskosten.
- Der verfügbare Kontext bleibt begrenzt; nicht jeder gefundene Inhalt passt vollständig in den Prompt.
- Zugriffsrechte und vertrauliche Dokumente müssen vor der Suche sauber abgesichert sein.
Vertiefung · für FortgeschritteneTechnische Architektur
Ein RAG-System besteht aus mehreren klar getrennten Bausteinen. Jeder kann die Antwortqualität beeinflussen.
Antwort mit Kontext
- Chunking
- Techniken zur Strukturierung und Sortierung von Dokumenten.
- Embeddings
- Vektoren, die semantische Bedeutung in hochdimensionalen Räumen abbilden.
- Vektordatenbank
- Eine Datenbank für die Speicherung hochdimensionaler Vektoren.
- LLM
- Ein KI-Modell, das menschenähnliche Sprache generiert und versteht.
Entscheidungshilfe
RAG im Vergleich
| Retrieval Augmented Generation | Fine-Tuning | |
|---|---|---|
| Eigenes Wissen einbinden | Dokumente werden zur Laufzeit abgerufen | Wissen wird ins Modell trainiert |
| Aktualität der Daten | Immer aktuell (Dokumente updaten) | Snapshot zum Trainings-Zeitpunkt |
| Kosten | Vektordatenbank + mehr Tokens pro Anfrage | Training + Hosting des eigenen Modells |
| Aufwand | Schnell aufgesetzt (Stunden/Tage) | Aufwändig (Wochen/Monate) |
| Halluzinationen | Reduziert (Quellen werden mitgeliefert) | Kann neue Halluzinationen einführen |
Direkt anwenden
Mit diesem Prompt weiterarbeiten
RAG-System designen
Retrieval-Augmented Generation System für eine spezifische Wissensdomäne konzipieren.
## Rolle
Du bist ein ML-Architekt mit Fokus auf RAG-Systeme.
## Kontext
Anwendungsfall: [BESCHREIBUNG]
Wissensbasis: [ART UND UMFANG DER DOKUMENTE]
Nutzer: [WER STELLT FRAGEN?]
Anforderungen: [GENAUIGKEIT / GESCHWINDIGKEIT / KOSTEN]
## Aufgabe
Designe ein RAG-System für diesen Anwendungsfall.