<EbeneX/>
Praxis Daten

A/B Testing

A/B Testing

Eine Methode zum Vergleich zweier Varianten (A und B) durch zufällige Aufteilung der Nutzer – der Goldstandard für datengetriebene Entscheidungen.

Sicherheit Daten

Anonymisierung / Pseudonymisierung

Anonymization / Pseudonymization

Techniken zum Schutz personenbezogener Daten: Anonymisierung entfernt den Personenbezug unwiderruflich, Pseudonymisierung ersetzt ihn durch Kennzeichen.

DevOps Daten

Apache Kafka

Apache Kafka

Eine verteilte Streaming-Plattform für zeitnahe Datenströme zwischen Systemen – häufig genutzt in ML-Pipelines, Feature Stores und Event-Driven Architectures.

Grundlagen Daten

BLEU / ROUGE

BLEU / ROUGE

Automatische Metriken zur Bewertung von generiertem Text – BLEU für Übersetzungen (Precision-basiert), ROUGE für Zusammenfassungen (Recall-basiert).

Grundlagen Daten

Confusion Matrix

Confusion Matrix

Eine Tabelle, die zeigt wie oft ein Klassifikationsmodell richtig und falsch lag – aufgeschlüsselt nach True/False Positives und Negatives.

Digital Marketing Daten

Cookieless Tracking

Cookieless Tracking

Methoden zur Messung von Nutzerverhalten und Marketing-Performance ohne Third-Party Cookies – als Reaktion auf Browser-Einschränkungen, DSGVO und das Ende des klassischen Retargetings.

Daten Grundlagen

Cosine Similarity

Cosine Similarity

Ein Ähnlichkeitsmaß, das den Winkel zwischen zwei Vektoren misst – der Standard für den Vergleich von Embeddings in der semantischen Suche und RAG-Systemen.

Daten Grundlagen

Data Augmentation

Data Augmentation

Techniken zur künstlichen Vergrößerung von Trainingsdatensätzen durch Transformationen – Rotation, Spiegelung, Rauschen oder semantische Variationen.

Daten Daten

Data Catalog

Data Catalog

Ein zentrales Verzeichnis aller Datenbestände im Unternehmen – mit Metadaten, Beschreibungen und Lineage für bessere Data Discovery.

Daten Praxis

Data Governance

Data Governance

Ein Framework aus Richtlinien, Prozessen und Standards zur Verwaltung von Daten – stellt Qualität, Sicherheit, Compliance und Nutzbarkeit von Daten sicher.

Daten DevOps

Data Lake

Data Lake

Ein zentraler Speicher, der große Mengen an Rohdaten in ihrem ursprünglichen Format aufnimmt – strukturiert, semi-strukturiert und unstrukturiert.

Daten DevOps

Data Lineage

Data Lineage

Die Dokumentation des Datenflusses von der Quelle bis zum Endprodukt – woher kommen Daten, wie werden sie transformiert, wo werden sie verwendet.

Daten DevOps

Data Mesh

Data Mesh

Ein Architekturansatz, bei dem Dateneigentum und -verantwortung dezentralisiert werden – jedes Team besitzt und verwaltet seine eigenen Daten als Produkt, statt alles in einem zentralen Data Warehouse zu bündeln.

Daten DevOps

Data Pipeline

Data Pipeline

Eine automatisierte Abfolge von Schritten, die Daten von der Quelle über Transformation bis zum Ziel transportiert und verarbeitet.

Daten

Data Quality

Data Quality

Die Messung und Sicherstellung von Datenqualität anhand von Dimensionen wie Vollständigkeit, Genauigkeit, Konsistenz und Aktualität.

Daten

Data Validation

Data Validation

Automatische Prüfung von Daten auf Korrektheit, Vollständigkeit und Konsistenz – reduziert fehlerhafte Daten in Pipelines und ML-Modellen.

Daten DevOps

Data Warehouse

Data Warehouse

Ein zentrales Datenspeichersystem, das strukturierte, aufbereitete Daten aus verschiedenen Quellen für schnelle analytische Abfragen optimiert bereitstellt.

Daten Grundlagen

Dataset

Dataset

Eine strukturierte Sammlung von Daten, die für das Training, die Evaluation oder das Testen von KI-Modellen verwendet wird.

Daten Praxis

Datenannotation

Data Annotation

Der Prozess, Rohdaten mit zusätzlichen Informationen (Labels, Tags, Markierungen) zu versehen, damit KI-Modelle daraus lernen können.

Daten Grundlagen

Datenvorverarbeitung (Preprocessing)

Data Preprocessing

Datenvorverarbeitung umfasst alle Schritte, mit denen Rohdaten für ein Machine-Learning-Modell aufbereitet werden – von der Bereinigung über die Skalierung bis zur Kodierung. Sie entscheidet oft mehr über den Erfolg als das Modell selbst.

Sicherheit Daten

Differential Privacy

Differential Privacy

Ein mathematisches Framework, das garantiert, dass die Analyse eines Datensatzes keine Rückschlüsse auf einzelne Personen zulässt – durch kontrolliertes Hinzufügen von Rauschen.

Daten Grundlagen

Embedding Space

Embedding Space

Der hochdimensionale mathematische Raum, in dem Embeddings leben – semantisch ähnliche Konzepte liegen nahe beieinander, verschiedene weit auseinander.

Daten LLM

Embeddings

Embeddings

Numerische Vektordarstellungen von Text, Bildern oder anderen Daten, die semantische Bedeutung in einem hochdimensionalen Raum abbilden.

Daten DevOps

ETL / ELT

ETL / ELT

Zwei Muster für Datenpipelines: ETL transformiert Daten vor dem Laden, ELT lädt Rohdaten zuerst und transformiert sie im Zielsystem.

Daten DevOps

Feature Drift

Feature Drift / Data Drift

Eine Veränderung in der statistischen Verteilung der Eingabe-Features eines ML-Modells über Zeit – kann zu Leistungseinbußen führen, auch wenn das Modell selbst unverändert ist.

Daten Grundlagen

Feature Engineering

Feature Engineering

Der Prozess, aus Rohdaten aussagekräftige Merkmale (Features) zu extrahieren oder zu erstellen, die einem ML-Modell helfen, bessere Vorhersagen zu treffen.

Daten Grundlagen

Feature Scaling

Feature Scaling

Die Transformation von Features auf vergleichbare Wertebereiche – wichtig für viele ML-Algorithmen, besonders bei Distanzmaßen, Gradientenverfahren und Regularisierung.

Daten DevOps

Feature Store

Feature Store

Eine zentrale Plattform zur Speicherung, Verwaltung und Bereitstellung von ML-Features, die Konsistenz zwischen Training und Produktion sicherstellt.

Daten Sicherheit

Federated Learning

Federated Learning

Eine Trainingsmethode, bei der das Modell zu den Daten kommt statt umgekehrt – Daten bleiben lokal, nur Modell-Updates werden geteilt.

Digital Marketing Daten

First-Party Data vs. Third-Party Data

First-Party Data vs. Third-Party Data

First-Party Data sind Daten, die ein Unternehmen direkt von seinen Nutzern erhebt. Third-Party Data werden von Dritten gesammelt und verkauft. Mit dem Ende der Third-Party-Cookies wird First-Party Data zum strategischen Asset.

Daten Grundlagen

Imbalanced Data

Imbalanced Data / Class Imbalance

Ein häufiges Problem in ML, wenn Klassen im Datensatz sehr ungleich verteilt sind – z.B. 99% normale Transaktionen, 1% Betrug. Erfordert spezielle Techniken.

Grundlagen Daten

Klassifikation (Classification)

Classification

Klassifikation ist eine Machine-Learning-Aufgabe, bei der ein Modell Eingaben einer von mehreren festen Kategorien zuordnet – etwa E-Mails als Spam oder Nicht-Spam, oder Bilder nach ihrem Inhalt.

Daten Grundlagen

Knowledge Graph

Knowledge Graph

Eine strukturierte Wissensdatenbank, die Entitäten (Personen, Orte, Konzepte) und deren Beziehungen als Netzwerk aus Knoten und Kanten darstellt.

Daten Grundlagen

Kreuzvalidierung (Cross-Validation)

Cross-Validation

Kreuzvalidierung ist ein Verfahren, um die Leistung eines Machine-Learning-Modells zuverlässig zu schätzen, indem die Daten mehrfach in Trainings- und Testteile aufgeteilt und die Ergebnisse gemittelt werden.

Daten Grundlagen

Labeling

Labeling / Data Labeling

Das Zuweisen von Kategorien oder Tags zu Datenpunkten – der spezifische Akt des Beschriftens, der Datenannotation erst ermöglicht.

Daten Grundlagen

Normalization vs. Standardization

Normalization vs. Standardization

Zwei Feature-Scaling-Methoden im Vergleich – Normalization skaliert auf [0,1], Standardization auf Mittelwert 0 und Standardabweichung 1.

Daten

OLAP vs. OLTP

OLAP vs. OLTP

OLTP (Online Transaction Processing) ist für schnelle, häufige Einzeltransaktionen optimiert. OLAP (Online Analytical Processing) für komplexe Analysen über große Datenmengen.

Daten Grundlagen

Ontologie

Ontology

Eine formale Beschreibung von Konzepten, deren Eigenschaften und Beziehungen innerhalb einer Wissensdomäne – die Grundlage für strukturiertes Wissensmanagement in KI-Systemen.

Grundlagen Daten

Precision, Recall & F1-Score

Precision, Recall & F1-Score

Die drei wichtigsten Metriken zur Bewertung von Klassifikationsmodellen – Precision misst Genauigkeit, Recall misst Vollständigkeit, F1 kombiniert beide.

Marketing Daten

Predictive Analytics

Predictive Analytics

Der Einsatz von statistischen Modellen und Machine Learning, um aus historischen Daten Vorhersagen über zukünftige Ereignisse zu treffen – von Kundenabwanderung über Nachfrageprognosen bis zu Umsatzvorhersagen.

Daten LLM

Query Expansion

Query Expansion / Query Rewriting

Query Expansion erweitert oder reformuliert eine Suchanfrage automatisch – mit Synonymen, Umformulierungen oder LLM-generiertem Kontext – um mehr relevante Treffer zu finden.

LLM Daten

RAG (Retrieval Augmented Generation)

Retrieval Augmented Generation

Eine Technik, die Large Language Models mit externen Wissensdatenbanken verbindet, um präzisere und faktenbasierte Antworten zu generieren.

Daten

Schema Evolution

Schema Evolution

Die Fähigkeit, Datenschemata zu ändern, ohne bestehende Daten oder Anwendungen zu brechen – essentiell für langlebige Datensysteme.

Daten Praxis

Semantische Suche

Semantic Search

Eine Suchmethode, die die Bedeutung einer Anfrage versteht statt nur nach exakten Keywords zu suchen – ermöglicht durch Embeddings und Vektordatenbanken.

Daten Grundlagen

SMOTE

Synthetic Minority Over-sampling Technique

Eine Technik zur Erzeugung synthetischer Datenpunkte für unterrepräsentierte Klassen – löst das Problem unbalancierter Datensätze im ML.

Daten Architektur

SQL vs. NoSQL

SQL vs. NoSQL

Zwei grundlegend verschiedene Ansätze zur Datenspeicherung: relationale Datenbanken mit fester Struktur (SQL) versus flexible, schema-lose Datenbanken (NoSQL).

Daten Praxis

Synthetische Daten

Synthetic Data

Künstlich generierte Trainingsdaten, die echte Daten ergänzen oder ersetzen – von LLM-generierten Texten bis zu simulierten Sensordaten.

Daten Grundlagen

Time Series

Time Series Data

Daten, die über die Zeit geordnet sind – von Aktienkursen bis Sensordaten. Erfordert spezielle Methoden für Analyse und Vorhersage.

Grundlagen Daten

Trainingsdaten

Training Data

Die Datensätze, mit denen KI-Modelle trainiert werden – sie bestimmen maßgeblich, was ein Modell lernt, wie gut es funktioniert und welche Verzerrungen es aufweist.

Daten DevOps

Vector Search

Vector Search / Nearest Neighbor Search

Eine Suchmethode, die Daten als hochdimensionale Vektoren darstellt und die ähnlichsten Vektoren zu einer Anfrage findet – die Grundlage für semantische Suche und RAG.

Daten DevOps

Vektordatenbank

Vector Database

Eine spezialisierte Datenbank, die hochdimensionale Vektoren (Embeddings) speichert und effiziente Ähnlichkeitssuchen ermöglicht.

Grundlagen Daten

Word2Vec / GloVe

Word2Vec / GloVe

Pionier-Verfahren, die Wörter als Vektoren darstellen – Word2Vec (Google, 2013) und GloVe (Stanford, 2014) legten den Grundstein für moderne Embeddings.