Retrieval Augmented Generation (RAG)

Sprachmodelle mit externem Wissen erweitern

Eine Technik, die Large Language Models mit externen Wissensdatenbanken verbindet, um präzisere und faktenbasierte Antworten zu generieren.

Fortgeschritten3 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Verbindet LLMs mit externen Wissensdatenbanken für aktuelle und präzise Informationen
  2. Reduziert Halluzinationen durch faktenbasierte Quellenangaben
  3. Ermöglicht domänenspezifisches Wissen ohne aufwändiges Fine-Tuning

Sofortantwort

RAG einfach erklärt

Kombination von LLMs mit externen Wissensdatenbanken für Genauigkeit.

Kurz gesagt
Verbindet LLMs mit externen Wissensdatenbanken für aktuelle und präzise Informationen
Typischer Einsatz
Unternehmens-Chatbots, Forschungsassistenten, Code-Dokumentation
Wichtig zu wissen
Ermöglicht domänenspezifisches Wissen ohne aufwändiges Fine-Tuning

Was ist Retrieval Augmented Generation?

RAG (Retrieval-Augmented Generation) verbindet ein Large Language Model mit einer externen Wissensquelle. Bevor das Modell antwortet, sucht ein Retrieval-System passende Dokumentabschnitte und liefert sie als Kontext mit. Die Antwort stützt sich dadurch nicht allein auf Wissen aus dem Trainingszeitraum.

Das macht RAG besonders nützlich für Informationen, die sich ändern, nur intern verfügbar sind oder mit Quellen belegt werden sollen. Statt ein Modell für jede neue Dokumentversion neu zu trainieren, aktualisierst du den zugrunde liegenden Wissensbestand.

Wann ist RAG sinnvoll?

RAG ist eine gute Wahl, wenn du eine große und wechselnde Wissensbasis durchsuchbar machen willst: etwa Produktdokumentationen, Verträge, Support-Artikel oder Forschungsergebnisse. Es passt auch dann, wenn die Antwort ihre Quellen offenlegen soll.

Die Methode ist kein Ersatz für saubere Inhalte oder Zugriffsrechte. Das System kann nur so zuverlässig antworten wie die Dokumente, die es findet und in den Kontext gibt.

Schritt für Schritt

So funktioniert RAG

RAG ergänzt das Wissen eines Sprachmodells zur Laufzeit. Entscheidend ist nicht nur das Modell, sondern die Qualität der gefundenen Inhalte.

  1. Inhalte vorbereiten

    Indexierung

    Dokumente werden in sinnvolle Abschnitte geteilt und als Embeddings in einer Vektordatenbank abgelegt.

    Dokument → Chunks → Embeddings → Vektordatenbank
  2. Frage verstehen

    Retrieval

    Die Anfrage wird ebenfalls als Embedding abgebildet. Die Suche findet die inhaltlich ähnlichsten Dokumentabschnitte.

    Frage → Embedding → Ähnlichkeitssuche → relevante Chunks
  3. Kontext zusammenstellen

    Augmentation

    Die gefundenen Abschnitte werden zusammen mit der Frage in einen klaren Prompt für das Sprachmodell eingefügt.

    Kontext + Frage + Regeln → Prompt
  4. Antwort mit Belegen erzeugen

    Generation

    Das Modell antwortet auf Basis des bereitgestellten Kontexts. Gute Systeme nennen die verwendeten Quellen direkt mit.

    Prompt → LLM → Antwort + Quellen

Konkretes Beispiel

RAG an einem einfachen Beispiel

Ein Support-Chatbot soll eine Frage zu einer gerade geänderten Produktfunktion beantworten.

Ohne RAG

Das Modell kann nur auf sein Trainingswissen zurückgreifen. Es kennt die neue Funktion möglicherweise nicht oder vermischt sie mit älteren Informationen.

Mit RAG

Die Suche findet die aktuelle Produktdokumentation. Das Modell nutzt genau diese Abschnitte als Kontext und kann die Antwort mit einem Link zur Quelle belegen.

RAG ersetzt kein Sprachmodell – es gibt ihm im Moment der Antwort einen überprüfbaren Wissensstand.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Aktuelle Informationen lassen sich durch neue Dokumente ergänzen, ohne das Modell neu zu trainieren.
  • Antworten können auf konkrete Quellen verweisen und dadurch nachvollziehbarer werden.
  • Spezialwissen bleibt außerhalb der Modellgewichte und lässt sich gezielt verwalten.
  • Ein erster Prototyp ist meist schneller umgesetzt als ein Fine-Tuning-Projekt.

Das solltest du beachten

  • Schlechte oder unvollständige Dokumente führen trotz gutem Modell zu schwachen Antworten.
  • Retrieval, Embeddings und Vektordatenbank erhöhen Architektur, Latenz und Betriebskosten.
  • Der verfügbare Kontext bleibt begrenzt; nicht jeder gefundene Inhalt passt vollständig in den Prompt.
  • Zugriffsrechte und vertrauliche Dokumente müssen vor der Suche sauber abgesichert sein.
Vertiefung · für Fortgeschrittene

Technische Architektur

Ein RAG-System besteht aus mehreren klar getrennten Bausteinen. Jeder kann die Antwortqualität beeinflussen.

Wissenskarte

Antwort mit Kontext

Chunking
Techniken zur Strukturierung und Sortierung von Dokumenten.
Embeddings
Vektoren, die semantische Bedeutung in hochdimensionalen Räumen abbilden.
Vektordatenbank
Eine Datenbank für die Speicherung hochdimensionaler Vektoren.
LLM
Ein KI-Modell, das menschenähnliche Sprache generiert und versteht.
Die Suche liefert relevante Dokumentabschnitte; das LLM formuliert daraus die Antwort. Quellen und Berechtigungen begleiten den gesamten Ablauf. RAG gliedert sich in: Dokumente, Chunking, Embeddings, Vektordatenbank, Retrieval, LLM.

Entscheidungshilfe

RAG im Vergleich

Retrieval Augmented Generation im Vergleich mit Fine-Tuning
Retrieval Augmented GenerationFine-Tuning
Eigenes Wissen einbindenDokumente werden zur Laufzeit abgerufenWissen wird ins Modell trainiert
Aktualität der DatenImmer aktuell (Dokumente updaten)Snapshot zum Trainings-Zeitpunkt
KostenVektordatenbank + mehr Tokens pro AnfrageTraining + Hosting des eigenen Modells
AufwandSchnell aufgesetzt (Stunden/Tage)Aufwändig (Wochen/Monate)
HalluzinationenReduziert (Quellen werden mitgeliefert)Kann neue Halluzinationen einführen

Alle 9 Kriterien im Vergleich

Direkt anwenden

Mit diesem Prompt weiterarbeiten

RAG-System designen

Retrieval-Augmented Generation System für eine spezifische Wissensdomäne konzipieren.

Experte
## Rolle
Du bist ein ML-Architekt mit Fokus auf RAG-Systeme.

## Kontext
Anwendungsfall: [BESCHREIBUNG]
Wissensbasis: [ART UND UMFANG DER DOKUMENTE]
Nutzer: [WER STELLT FRAGEN?]
Anforderungen: [GENAUIGKEIT / GESCHWINDIGKEIT / KOSTEN]

## Aufgabe
Designe ein RAG-System für diesen Anwendungsfall.
Platzhalter in Klammern ersetzenVorlage öffnen

01Einsatzbereiche

Wann ist RAG sinnvoll?

Geeignet für

  • Unternehmens-ChatbotsKundenservice-Bots, die auf aktuelle Produktdokumentationen und interne Wissensdatenbanken zugreifen können
  • ForschungsassistentenKI-Systeme, die wissenschaftliche Paper durchsuchen und zusammenfassen
  • Code-DokumentationEntwickler-Tools, die auf die eigene Codebasis zugreifen und kontextbezogene Hilfe bieten

↑ Inhalt

02Werkzeuge

Womit RAG umgesetzt wird

↑ Inhalt

Merksatz

Stell dir einen Experten vor, der nicht nur aus seinem Gedächtnis antwortet, sondern vor jeder Antwort kurz in einem aktuellen Fachbuch nachschlägt – so kombiniert RAG das Sprachverständnis eines LLMs mit dem Zugriff auf externe, aktuelle Informationen.

  1. Verbindet LLMs mit externen Wissensdatenbanken für aktuelle und präzise Informationen
  2. Reduziert Halluzinationen durch faktenbasierte Quellenangaben
  3. Ermöglicht domänenspezifisches Wissen ohne aufwändiges Fine-Tuning

03Wissensnetz

Diese Begriffe brauchst du ebenfalls

Nicht „ähnliche Artikel", sondern die Rolle, die jeder Begriff für RAG spielt.

↑ Inhalt

04Anwenden

RAG praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu RAG

Was ist der Unterschied zwischen RAG und Fine-Tuning?

RAG greift zur Laufzeit auf externe Daten zu, während Fine-Tuning das Modell selbst mit neuen Daten trainiert. RAG ist flexibler und günstiger für sich häufig ändernde Informationen.

Wie unterscheidet sich RAG von einfachem Prompt Engineering?

Beim reinen Prompt Engineering kopierst du statische Informationen manuell in den Prompt. RAG hingegen sucht dynamisch und semantisch die relevantesten Dokumente aus einer großen Wissensbasis – du musst nicht im Voraus wissen, welche Informationen relevant sind.

Wie funktioniert RAG technisch?

RAG wandelt die Nutzeranfrage in einen Embedding-Vektor um, sucht ähnliche Dokumente in einer Vektordatenbank und fügt diese als Kontext in den Prompt ein, bevor das LLM antwortet.

Welche Kosten entstehen bei RAG?

Hauptkosten sind die Vektordatenbank-Infrastruktur und die API-Calls zum LLM. Im Vergleich zu Fine-Tuning sind die Kosten meist deutlich niedriger.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Large Language Model

    Ein KI-Modell, das menschenähnliche Sprache generiert und versteht.

  • Technisch vertiefen

    Vektordatenbank

    Eine Datenbank für die Speicherung hochdimensionaler Vektoren.

  • Alternative vergleichen

    RAG vs. CAG

    Wissensbasis abrufen oder komplett in den Kontext laden?

↑ Inhalt