Sofortantwort
Embeddings einfach erklärt
Vektoren, die semantische Bedeutung in hochdimensionalen Räumen abbilden.
- Kurz gesagt
- Wandeln Text, Bilder oder andere Daten in numerische Vektoren um
- Typischer Einsatz
- Semantische Suche, RAG-Systeme, Empfehlungssysteme
- Wichtig zu wissen
- Grundlage für Suche, Empfehlungen, RAG und Clustering
Embeddings im Überblick
Embeddings sind numerische Vektoren, die die Bedeutung von Text, Bildern oder anderen Daten in einem hochdimensionalen Raum repräsentieren. Sie sind das Herzstück moderner KI: Semantische Suche, RAG-Systeme, Empfehlungsalgorithmen und Klassifikatoren basieren alle auf Embeddings. Das Entscheidende: Ähnliche Konzepte haben ähnliche Vektoren – “König” und “Königin” liegen näher beieinander als “König” und “Fahrrad”.
Embeddings sind eine Methode, um Text (oder andere Daten) in Zahlen umzuwandeln, die ein Computer verarbeiten kann – und zwar so, dass die Bedeutung erhalten bleibt.
Warum braucht man Embeddings?
Computer können nicht direkt mit Wörtern rechnen. Embeddings lösen dieses Problem, indem sie jedes Wort oder jeden Text in eine Liste von Zahlen (einen Vektor) umwandeln. Das Besondere: Ähnliche Bedeutungen ergeben ähnliche Zahlen.
Beispiel:
"König" → [0.2, 0.8, 0.1, ...]
"Königin" → [0.3, 0.7, 0.1, ...] ← ähnlich!
"Auto" → [0.9, 0.1, 0.6, ...] ← ganz anders
Praktische Anwendungen:
- Semantische Suche: Du suchst nach “Wie kündige ich meinen Vertrag?” und findest auch Dokumente über “Vertragsauflösung” und “Kündigung einreichen”
- Ähnliche Inhalte: “Kunden, die das kauften, kauften auch…”
- RAG: Die relevantesten Dokumente für eine LLM-Anfrage finden
Technisch betrachtet
Wie Embeddings entstehen
Word Embeddings (klassisch):
- Word2Vec (2013): Trainiert auf Wort-Kontext-Paaren, lernt Wort-Vektoren
- GloVe: Nutzt globale Wort-Kookkurrenz-Statistiken
- Limitierung: Ein Vektor pro Wort, unabhängig vom Kontext
Kontextuelle Embeddings (modern):
- BERT-basiert: Jedes Wort bekommt einen kontextabhängigen Vektor
- “Bank” hat unterschiedliche Vektoren in “Ich sitze auf der Bank” vs. “Ich gehe zur Bank”
- Transformer-basierte Modelle erzeugen kontextuelle Embeddings
Sentence/Document Embeddings:
- Ganze Sätze oder Dokumente werden in einen einzelnen Vektor komprimiert
- Modelle: Sentence-BERT, OpenAI text-embedding-3, Cohere Embed
- Typische Dimensionen: 384 - 3072
Mathematische Grundlagen
Vektorraum-Eigenschaften:
- Embeddings leben in einem hochdimensionalen Raum (z.B. 1536D)
- Semantische Beziehungen werden als geometrische Beziehungen abgebildet
- Berühmtes Beispiel: König - Mann + Frau ≈ Königin
Ähnlichkeitsmetriken:
| Metrik | Formel | Wertebereich | Einsatz |
|---|---|---|---|
| Cosine Similarity | cos(θ) = A·B / (‖A‖·‖B‖) | [-1, 1] | Standard für Text |
| Dot Product | A·B = Σ(ai·bi) | (-∞, +∞) | Wenn Magnitude wichtig ist |
| Euclidean Distance | ‖A-B‖ = √Σ(ai-bi)² | [0, +∞) | Clustering |
Embedding-Modelle im Vergleich
OpenAI text-embedding-3-small:
- 1536 Dimensionen, günstig ($0.02/1M Tokens)
- Gute Allround-Performance
- Ideal für die meisten Anwendungen
OpenAI text-embedding-3-large:
- 3072 Dimensionen, höhere Qualität
- Matryoshka-Embeddings: Dimensionen können reduziert werden
- Für anspruchsvolle Retrieval-Aufgaben
Open-Source-Alternativen:
- BGE-M3: Mehrsprachig, verschiedene Retrieval-Modi
- E5-Mistral: Basiert auf Mistral-7B, sehr hohe Qualität
- Nomic Embed: 8192 Token Kontextlänge, Open Source
Embeddings in der Praxis
Chunking-Strategien für Dokumente:
- Fixed Size: Feste Zeichenanzahl (einfach, aber kann Kontext brechen)
- Sentence-based: An Satzgrenzen aufteilen
- Semantic: Thematisch zusammenhängende Abschnitte
- Recursive: Hierarchisches Aufteilen mit Overlap
Optimierung:
- Dimensionsreduktion: PCA oder Matryoshka für kleinere Vektoren
- Quantisierung: Float32 → Int8 für 4x weniger Speicher
- Batch-Processing: Viele Texte gleichzeitig embedden
- Caching: Häufig abgefragte Embeddings im Memory halten
Evaluation:
- MTEB Benchmark: Standardisierter Vergleich von Embedding-Modellen
- Retrieval-Metriken: Recall@k, MRR, NDCG
- Clustering-Metriken: Silhouette Score, V-Measure
Schritt für Schritt
So entstehen semantische Treffer
Embeddings übersetzen Inhalt in Zahlen. Dadurch kann ein System nicht nur gleiche Wörter, sondern ähnliche Bedeutungen vergleichen.
Inhalt vorbereiten
Input
Ein Text, Bild oder Dokumentabschnitt wird so zugeschnitten, dass er eine zusammenhängende Bedeutung trägt.
Vertrag kündigen → TextabschnittEmbedding berechnen
Modell
Ein Embedding-Modell wandelt den Inhalt in einen Zahlenvektor mit vielen Dimensionen um.
Text → [0.12, -0.08, 0.61, …]Vektoren vergleichen
Ähnlichkeit
Eine Anfrage erhält denselben Vektorraum. Eine Metrik wie Cosine Similarity misst, welche Inhalte semantisch nahe liegen.
Anfrage-Vektor ↔ Dokument-VektorenPassende Inhalte zurückgeben
Retrieval
Die ähnlichsten Treffer werden für Suche, Empfehlungen oder als Kontext für ein LLM weitergegeben.
Top-k Treffer → Anwendung oder LLM
Konkretes Beispiel
Suche nach Bedeutung statt Wortlaut
Eine Person sucht in einer Wissensdatenbank nach „Wie beende ich meinen Vertrag?“
Klassische Stichwortsuche
Sie bevorzugt Dokumente mit dem exakten Wort „Vertrag“ und kann relevante Seiten über Kündigungsfristen oder Vertragslaufzeiten übersehen.
Semantische Suche mit Embeddings
Die Anfrage liegt im Vektorraum nah bei Texten über Kündigung, Laufzeit und Beendigung. Diese Seiten erscheinen auch ohne identischen Wortlaut.
Embeddings verstehen keinen Text wie Menschen. Sie machen wiederkehrende Bedeutungsnähen aus ihren Trainingsdaten mathematisch vergleichbar.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Sie finden inhaltlich ähnliche Texte auch bei unterschiedlicher Wortwahl.
- Ein gemeinsamer Vektorraum unterstützt Suche, Empfehlungen, Clustering und RAG mit derselben Grundlage.
- Mehrsprachige Modelle können verwandte Inhalte über Sprachgrenzen hinweg verbinden.
- Einmal berechnete Vektoren lassen sich für viele Anfragen wiederverwenden.
Das solltest du beachten
- Ein ungeeignetes Embedding-Modell oder schlecht zugeschnittene Chunks verschlechtern die Trefferqualität.
- Ähnlichkeit ist keine fachliche Wahrheit und ersetzt keine Filter, Berechtigungen oder Bewertung.
- Vektoren benötigen Speicher und müssen bei geänderten Inhalten neu berechnet werden.
- Die richtige Distanzmetrik, Dimension und Schwelle hängt vom jeweiligen Anwendungsfall ab.
Vertiefung · für FortgeschritteneVom Inhalt zum Vektorraum
Der Vektor selbst ist nicht lesbar. Sein Wert entsteht daraus, dass ein Modell gleiche Muster für vergleichbare Inhalte nutzt.
Semantische Position