Sofortantwort
Semantische Suche einfach erklärt
Die Suche basiert auf dem Verständnis der Anfrage und nicht nur auf Keywords.
- Kurz gesagt
- Versteht die Bedeutung (Semantik) einer Suchanfrage, nicht nur die Wörter
- Typischer Einsatz
- Unternehmenssuche, Marketing, RAG-Systeme
- Wichtig zu wissen
- Findet relevante Ergebnisse auch bei unterschiedlicher Formulierung
Semantische Suche im Überblick
Semantische Suche ist die nächste Evolutionsstufe nach Keyword-Suche. Klassische Suchmaschinen finden Dokumente, die exakt dieselben Wörter enthalten wie die Suchanfrage. Semantische Suche versteht die Bedeutung hinter den Wörtern und findet Dokumente, die dasselbe meinen – auch wenn sie andere Formulierungen verwenden. Die Technologie dahinter sind Embeddings: Text wird in Vektoren umgewandelt, und Ähnlichkeit wird als geometrische Nähe im Vektorraum gemessen.
Semantische Suche versteht, was du meinst – nicht nur, was du tippst. Klassische Keyword-Suche findet Dokumente, die exakt dieselben Wörter enthalten. Semantische Suche findet Dokumente, die dasselbe bedeuten – auch wenn andere Wörter verwendet werden.
Das funktioniert durch Embeddings: Text wird in Vektoren umgewandelt, die die Bedeutung kodieren. Ähnliche Bedeutungen liegen im Vektorraum nah beieinander. Eine Suche nach “Hund” findet dann auch Dokumente über “Haustier” oder “Vierbeiner” – weil diese semantisch verwandt sind. Das ist der Kern moderner KI-Suche, von Google bis RAG-Systemen.
Keyword-Suche vs. Semantische Suche:
| Anfrage | Keyword-Suche | Semantische Suche |
|---|---|---|
| “günstiges Auto” | Nur Treffer mit “günstiges Auto” | Auch “preiswerter Wagen”, “billiges Fahrzeug” |
| “Wie kündige ich?” | Nur Treffer mit “kündigen” | Auch “Vertrag beenden”, “Kündigung einreichen” |
| “Python Fehler beheben” | Nur Treffer mit diesen Wörtern | Auch “Python debugging”, “Bug fixen” |
So funktioniert es:
Anfrage → Embedding → Vektorsuche → Ähnlichste Dokumente → Ergebnisse
"günstiges Auto" → [0.2, 0.8, ...] → Cosine Similarity → Top-k Treffer
Technisch betrachtet
Hybrid Search
Kombination aus semantischer und Keyword-Suche:
- Semantisch (Dense Retrieval): Embedding-basierte Ähnlichkeitssuche
- Keyword (Sparse Retrieval): BM25 oder TF-IDF
- Fusion: Reciprocal Rank Fusion (RRF) kombiniert beide Rankings
Optimierung
- Reranking: Ein Cross-Encoder bewertet die Top-Ergebnisse neu
- Query Expansion: Anfrage mit Synonymen oder Umformulierungen erweitern
- Metadata Filtering: Ergebnisse nach Datum, Kategorie etc. filtern
- Chunk-Strategie: Optimale Dokumentaufteilung für bessere Treffer
Schritt für Schritt
So wird Bedeutung durchsuchbar
Statt Zeichenfolgen direkt zu vergleichen, übersetzt die Suche Anfrage und Inhalte in einen gemeinsamen Bedeutungsraum.
Inhalte vorbereiten
Indexierung
Dokumente werden in passende Abschnitte geteilt, mit Metadaten versehen und als Embeddings gespeichert.
Textabschnitt → Embedding + MetadatenFrage einbetten
Anfrage
Dasselbe Embedding-Modell bildet auch die Suchanfrage als Vektor ab.
Frage → Query-VektorÄhnliche Bedeutungen finden
Retrieval
Eine Vektordatenbank sucht nahe Vektoren und liefert passende Textstellen als Kandidaten.
Query-Vektor → ähnliche ChunksErgebnisse absichern
Ranking
Filter, Keyword-Suche oder Reranking ergänzen die semantische Ähnlichkeit und verbessern die Reihenfolge.
Semantik + Filter + Rangfolge
Konkretes Beispiel
Beispiel: Eine Frage zur Vertragskündigung
Die Wissensbasis verwendet den Begriff Vertragsbeendigung, die Person sucht aber nach Kündigungsfrist.
Reine Keyword-Suche
Sie findet nur Abschnitte, die das exakte Wort Kündigung enthalten, und übersieht verwandte Formulierungen.
Semantische Suche
Sie findet auch Abschnitte zu Vertragsbeendigung, Fristen und Austrittsdatum, weil deren Bedeutung nahe bei der Anfrage liegt.
Semantische Suche erweitert die Trefferbasis. Für harte Bedingungen wie Land oder Vertragsart bleiben Metadatenfilter wichtig.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Findet passende Inhalte trotz anderer Formulierungen oder Synonyme.
- Verbessert Retrieval für Fragen in natürlicher Sprache.
- Funktioniert über verschiedene Dokumenttypen und größere Bestände hinweg.
- Lässt sich mit Filtern, Keyword-Suche und Reranking kombinieren.
Das solltest du beachten
- Die Trefferqualität hängt stark vom Embedding-Modell ab.
- Ähnlichkeit ist kein Beweis für fachliche Korrektheit.
- Metadaten und Berechtigungen müssen separat durchgesetzt werden.
- Schwellenwerte und Ranking brauchen reale Testfragen.
Vertiefung · für FortgeschritteneBausteine einer semantischen Suche
Bedeutungsähnlichkeit wird erst mit guten Quellen und klaren Filtern zu verlässlichem Retrieval.
Bedeutung vergleichen