A/B Testing
A/B Testing
Eine Methode zum Vergleich zweier Varianten (A und B) durch zufällige Aufteilung der Nutzer – der Goldstandard für datengetriebene Entscheidungen.
Ohne Daten keine KI. Diese Kategorie deckt alles ab, was mit Daten zu tun hat: Datensätze und ihre Qualität, Preprocessing und Feature Engineering, Embeddings und Vektordatenbanken sowie Retrieval Augmented Generation (RAG) für wissensbasierte KI-Systeme.
A/B Testing
Eine Methode zum Vergleich zweier Varianten (A und B) durch zufällige Aufteilung der Nutzer – der Goldstandard für datengetriebene Entscheidungen.
Anonymization / Pseudonymization
Techniken zum Schutz personenbezogener Daten: Anonymisierung entfernt den Personenbezug unwiderruflich, Pseudonymisierung ersetzt ihn durch Kennzeichen.
Apache Kafka
Eine verteilte Streaming-Plattform für zeitnahe Datenströme zwischen Systemen – häufig genutzt in ML-Pipelines, Feature Stores und Event-Driven Architectures.
BLEU / ROUGE
Automatische Metriken zur Bewertung von generiertem Text – BLEU für Übersetzungen (Precision-basiert), ROUGE für Zusammenfassungen (Recall-basiert).
Confusion Matrix
Eine Tabelle, die zeigt wie oft ein Klassifikationsmodell richtig und falsch lag – aufgeschlüsselt nach True/False Positives und Negatives.
Cookieless Tracking
Methoden zur Messung von Nutzerverhalten und Marketing-Performance ohne Third-Party Cookies – als Reaktion auf Browser-Einschränkungen, DSGVO und das Ende des klassischen Retargetings.
Cosine Similarity
Ein Ähnlichkeitsmaß, das den Winkel zwischen zwei Vektoren misst – der Standard für den Vergleich von Embeddings in der semantischen Suche und RAG-Systemen.
Data Augmentation
Techniken zur künstlichen Vergrößerung von Trainingsdatensätzen durch Transformationen – Rotation, Spiegelung, Rauschen oder semantische Variationen.
Data Catalog
Ein zentrales Verzeichnis aller Datenbestände im Unternehmen – mit Metadaten, Beschreibungen und Lineage für bessere Data Discovery.
Data Governance
Ein Framework aus Richtlinien, Prozessen und Standards zur Verwaltung von Daten – stellt Qualität, Sicherheit, Compliance und Nutzbarkeit von Daten sicher.
Data Lake
Ein zentraler Speicher, der große Mengen an Rohdaten in ihrem ursprünglichen Format aufnimmt – strukturiert, semi-strukturiert und unstrukturiert.
Data Lineage
Die Dokumentation des Datenflusses von der Quelle bis zum Endprodukt – woher kommen Daten, wie werden sie transformiert, wo werden sie verwendet.
Data Mesh
Ein Architekturansatz, bei dem Dateneigentum und -verantwortung dezentralisiert werden – jedes Team besitzt und verwaltet seine eigenen Daten als Produkt, statt alles in einem zentralen Data Warehouse zu bündeln.
Data Pipeline
Eine automatisierte Abfolge von Schritten, die Daten von der Quelle über Transformation bis zum Ziel transportiert und verarbeitet.
Data Quality
Die Messung und Sicherstellung von Datenqualität anhand von Dimensionen wie Vollständigkeit, Genauigkeit, Konsistenz und Aktualität.
Data Validation
Automatische Prüfung von Daten auf Korrektheit, Vollständigkeit und Konsistenz – reduziert fehlerhafte Daten in Pipelines und ML-Modellen.
Data Warehouse
Ein zentrales Datenspeichersystem, das strukturierte, aufbereitete Daten aus verschiedenen Quellen für schnelle analytische Abfragen optimiert bereitstellt.
Dataset
Eine strukturierte Sammlung von Daten, die für das Training, die Evaluation oder das Testen von KI-Modellen verwendet wird.
Data Annotation
Der Prozess, Rohdaten mit zusätzlichen Informationen (Labels, Tags, Markierungen) zu versehen, damit KI-Modelle daraus lernen können.
Data Preprocessing
Datenvorverarbeitung umfasst alle Schritte, mit denen Rohdaten für ein Machine-Learning-Modell aufbereitet werden – von der Bereinigung über die Skalierung bis zur Kodierung. Sie entscheidet oft mehr über den Erfolg als das Modell selbst.
Differential Privacy
Ein mathematisches Framework, das garantiert, dass die Analyse eines Datensatzes keine Rückschlüsse auf einzelne Personen zulässt – durch kontrolliertes Hinzufügen von Rauschen.
Embedding Space
Der hochdimensionale mathematische Raum, in dem Embeddings leben – semantisch ähnliche Konzepte liegen nahe beieinander, verschiedene weit auseinander.
Embeddings
Numerische Vektordarstellungen von Text, Bildern oder anderen Daten, die semantische Bedeutung in einem hochdimensionalen Raum abbilden.
ETL / ELT
Zwei Muster für Datenpipelines: ETL transformiert Daten vor dem Laden, ELT lädt Rohdaten zuerst und transformiert sie im Zielsystem.
Feature Drift / Data Drift
Eine Veränderung in der statistischen Verteilung der Eingabe-Features eines ML-Modells über Zeit – kann zu Leistungseinbußen führen, auch wenn das Modell selbst unverändert ist.
Feature Engineering
Der Prozess, aus Rohdaten aussagekräftige Merkmale (Features) zu extrahieren oder zu erstellen, die einem ML-Modell helfen, bessere Vorhersagen zu treffen.
Feature Scaling
Die Transformation von Features auf vergleichbare Wertebereiche – wichtig für viele ML-Algorithmen, besonders bei Distanzmaßen, Gradientenverfahren und Regularisierung.
Feature Store
Eine zentrale Plattform zur Speicherung, Verwaltung und Bereitstellung von ML-Features, die Konsistenz zwischen Training und Produktion sicherstellt.
Federated Learning
Eine Trainingsmethode, bei der das Modell zu den Daten kommt statt umgekehrt – Daten bleiben lokal, nur Modell-Updates werden geteilt.
First-Party Data vs. Third-Party Data
First-Party Data sind Daten, die ein Unternehmen direkt von seinen Nutzern erhebt. Third-Party Data werden von Dritten gesammelt und verkauft. Mit dem Ende der Third-Party-Cookies wird First-Party Data zum strategischen Asset.
Imbalanced Data / Class Imbalance
Ein häufiges Problem in ML, wenn Klassen im Datensatz sehr ungleich verteilt sind – z.B. 99% normale Transaktionen, 1% Betrug. Erfordert spezielle Techniken.
Classification
Klassifikation ist eine Machine-Learning-Aufgabe, bei der ein Modell Eingaben einer von mehreren festen Kategorien zuordnet – etwa E-Mails als Spam oder Nicht-Spam, oder Bilder nach ihrem Inhalt.
Knowledge Graph
Eine strukturierte Wissensdatenbank, die Entitäten (Personen, Orte, Konzepte) und deren Beziehungen als Netzwerk aus Knoten und Kanten darstellt.
Cross-Validation
Kreuzvalidierung ist ein Verfahren, um die Leistung eines Machine-Learning-Modells zuverlässig zu schätzen, indem die Daten mehrfach in Trainings- und Testteile aufgeteilt und die Ergebnisse gemittelt werden.
Labeling / Data Labeling
Das Zuweisen von Kategorien oder Tags zu Datenpunkten – der spezifische Akt des Beschriftens, der Datenannotation erst ermöglicht.
Normalization vs. Standardization
Zwei Feature-Scaling-Methoden im Vergleich – Normalization skaliert auf [0,1], Standardization auf Mittelwert 0 und Standardabweichung 1.
OLAP vs. OLTP
OLTP (Online Transaction Processing) ist für schnelle, häufige Einzeltransaktionen optimiert. OLAP (Online Analytical Processing) für komplexe Analysen über große Datenmengen.
Ontology
Eine formale Beschreibung von Konzepten, deren Eigenschaften und Beziehungen innerhalb einer Wissensdomäne – die Grundlage für strukturiertes Wissensmanagement in KI-Systemen.
Precision, Recall & F1-Score
Die drei wichtigsten Metriken zur Bewertung von Klassifikationsmodellen – Precision misst Genauigkeit, Recall misst Vollständigkeit, F1 kombiniert beide.
Predictive Analytics
Der Einsatz von statistischen Modellen und Machine Learning, um aus historischen Daten Vorhersagen über zukünftige Ereignisse zu treffen – von Kundenabwanderung über Nachfrageprognosen bis zu Umsatzvorhersagen.
Query Expansion / Query Rewriting
Query Expansion erweitert oder reformuliert eine Suchanfrage automatisch – mit Synonymen, Umformulierungen oder LLM-generiertem Kontext – um mehr relevante Treffer zu finden.
Retrieval Augmented Generation
Eine Technik, die Large Language Models mit externen Wissensdatenbanken verbindet, um präzisere und faktenbasierte Antworten zu generieren.
Schema Evolution
Die Fähigkeit, Datenschemata zu ändern, ohne bestehende Daten oder Anwendungen zu brechen – essentiell für langlebige Datensysteme.
Semantic Search
Eine Suchmethode, die die Bedeutung einer Anfrage versteht statt nur nach exakten Keywords zu suchen – ermöglicht durch Embeddings und Vektordatenbanken.
Synthetic Minority Over-sampling Technique
Eine Technik zur Erzeugung synthetischer Datenpunkte für unterrepräsentierte Klassen – löst das Problem unbalancierter Datensätze im ML.
SQL vs. NoSQL
Zwei grundlegend verschiedene Ansätze zur Datenspeicherung: relationale Datenbanken mit fester Struktur (SQL) versus flexible, schema-lose Datenbanken (NoSQL).
Synthetic Data
Künstlich generierte Trainingsdaten, die echte Daten ergänzen oder ersetzen – von LLM-generierten Texten bis zu simulierten Sensordaten.
Time Series Data
Daten, die über die Zeit geordnet sind – von Aktienkursen bis Sensordaten. Erfordert spezielle Methoden für Analyse und Vorhersage.
Training Data
Die Datensätze, mit denen KI-Modelle trainiert werden – sie bestimmen maßgeblich, was ein Modell lernt, wie gut es funktioniert und welche Verzerrungen es aufweist.
Vector Search / Nearest Neighbor Search
Eine Suchmethode, die Daten als hochdimensionale Vektoren darstellt und die ähnlichsten Vektoren zu einer Anfrage findet – die Grundlage für semantische Suche und RAG.
Vector Database
Eine spezialisierte Datenbank, die hochdimensionale Vektoren (Embeddings) speichert und effiziente Ähnlichkeitssuchen ermöglicht.
Word2Vec / GloVe
Pionier-Verfahren, die Wörter als Vektoren darstellen – Word2Vec (Google, 2013) und GloVe (Stanford, 2014) legten den Grundstein für moderne Embeddings.