Data Quality

Daten für einen konkreten Zweck messbar verlässlich machen

Die Messung und Sicherstellung von Datenqualität anhand von Dimensionen wie Vollständigkeit, Genauigkeit, Konsistenz und Aktualität.

Fortgeschritten3 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Dimensionen: Vollständigkeit, Genauigkeit, Konsistenz, Aktualität
  2. Messen mit Metriken und Monitoring
  3. Garbage In, Garbage Out – besonders für ML

Sofortantwort

Data Quality einfach erklärt

Messung und Sicherstellung der Qualität von Daten.

Kurz gesagt
Dimensionen: Vollständigkeit, Genauigkeit, Konsistenz, Aktualität
Typischer Einsatz
ML-Training, Daten, Sicherheit
Wichtig zu wissen
Garbage In, Garbage Out – besonders für ML

Data Quality im Überblick

Data Quality misst, wie gut Daten für ihren Zweck geeignet sind.

Die 6 Dimensionen:

DimensionFrageMetrik
VollständigkeitFehlen Werte?Anteil vorhandener Werte
GenauigkeitSind Werte korrekt?Anteil plausibler oder validierter Werte
KonsistenzStimmen Quellen überein?Abgleich über Quellen
AktualitätWie alt sind Daten?Datenalter relativ zum Bedarf
EinzigartigkeitGibt es Duplikate?Anteil eindeutiger Datensätze
ValiditätEntsprechen Werte dem Format?Anteil formatvalider Werte

Technisch betrachtet

Data Quality Score

def calculate_dq_score(df):
    scores = {
        'completeness': 1 - df.isnull().mean().mean(),
        'uniqueness': 1 - df.duplicated().mean(),
        'validity': validate_formats(df)
    }
    return sum(scores.values()) / len(scores)

Monitoring

# Beispiel für automatisches Data-Quality-Monitoring
checkpoint = gx.Checkpoint(
    name="orders_quality_check",
    data_context=context,
    validations=[
        {"batch_request": batch, "expectation_suite_name": "orders"}
    ]
)

# In Orchestrierung oder Pipeline-Monitoring einbinden
results = checkpoint.run()
if not results.success:
    alert_data_team(results)

Data Quality ist relativ zum Zweck

„Fitness for Use” ist das zentrale Konzept: Dieselben Daten können für einen Zweck ausreichend und für einen anderen unbrauchbar sein. Eine Kundenliste mit veralteten Telefonnummern ist für eine Umsatzanalyse völlig in Ordnung, für eine Callcenter-Kampagne aber wertlos. Deshalb beginnt jede Data-Quality-Initiative mit der Frage: Wer nutzt diese Daten wofür, und welche Dimension ist dafür kritisch? Pauschale Qualitätsziele („99 % Vollständigkeit über alle Tabellen”) verfehlen meist den Punkt.

Reaktiv vs. präventiv

AnsatzBeispielWirkung
Reaktiv: CleansingDuplikate entfernen, Formate korrigierenSymptome beheben, wiederkehrender Aufwand
Präventiv: Validierung am EingangPflichtfelder und Formate beim Erfassen erzwingenFehler entstehen gar nicht erst
Präventiv: UrsachenanalyseWarum liefert Quelle X unvollständige Daten?Nachhaltig, erfordert Prozessänderung

Die Faustregel: Je früher ein Fehler abgefangen wird, desto günstiger ist er. Ein Tippfehler im Eingabeformular kostet eine Korrektur; derselbe Fehler, der durch Pipelines in Reports und ML-Modelle propagiert, kostet ein Vielfaches – plus das Vertrauen der Datennutzer.

Data Quality für Machine Learning

ML-Systeme stellen zusätzliche Anforderungen, die klassische Dimensionen nicht abdecken:

  • Label-Qualität: Falsch gelabelte Trainingsbeispiele setzen eine Obergrenze für die erreichbare Modellgüte – oft wirksamer verbessert als der Modelltyp.
  • Verteilungsstabilität: Auch formal valide Daten können driften. Wenn sich die Verteilung eines Features zwischen Training und Produktion verschiebt (Data Drift), degradiert das Modell schleichend.
  • Train/Serving-Konsistenz: Features müssen im Training und in der Inferenz identisch berechnet werden (Training-Serving Skew) – ein häufiger, schwer sichtbarer Fehler.
  • Repräsentativität: Ein Datensatz kann vollständig und korrekt sein, aber wichtige Subgruppen unterrepräsentieren – das Modell versagt dann genau dort.

Typische Fehler in der Praxis

  • Qualität einmalig messen statt kontinuierlich: Datenqualität ist ein Zustand, kein Projekt. Ohne Monitoring degradiert sie unbemerkt, etwa wenn ein Quellsystem sein Verhalten ändert.
  • Metriken ohne Konsequenzen: Ein Dashboard mit roten Kennzahlen ändert nichts, wenn niemand für die Behebung verantwortlich ist. Jede Metrik braucht einen Owner und einen definierten Eskalationspfad.
  • Alles gleich behandeln: Kritische Felder (Rechnungsbeträge, IDs) verdienen strengere Checks als Kommentarfelder. Priorisierung nach Geschäftsauswirkung spart Aufwand.
  • Nur Spalten prüfen, nicht Beziehungen: Viele Fehler zeigen sich erst im Zusammenhang – verwaiste Fremdschlüssel, inkonsistente Summen zwischen Detail- und Aggregattabellen oder Zeitreihen mit Lücken.

Schritt für Schritt

Datenqualität kontinuierlich sichern

Qualität ist nicht eine globale Punktzahl. Sie beschreibt, ob Daten für einen bestimmten Zweck ausreichend vollständig, korrekt und aktuell sind.

  1. Zweck und kritische Felder definieren

    Kontext

    Das Team legt fest, welche Datenentscheidung unterstützt wird und welche Fehler dabei nicht tolerierbar sind.

    Use Case → Qualitätskriterien
  2. Regeln messbar formulieren

    Regeln

    Vollständigkeit, Wertebereiche, Eindeutigkeit, Aktualität und Abgleich mit Quellen werden als prüfbare Erwartungen beschrieben.

    Feld → Erwartung + Schwelle
  3. In der Pipeline prüfen

    Checks

    Automatisierte Validierungen erkennen Abweichungen früh und verhindern, dass schlechte Daten unbemerkt weiterfließen.

    Datenfluss → valid oder auffällig
  4. Ursache beheben und beobachten

    Verbesserung

    Teams korrigieren nicht nur Datensätze, sondern auch Quellen oder Prozesse, die wiederkehrende Fehler erzeugen.

    Alarm → Ursache → Prävention

Konkretes Beispiel

Beispiel: Lieferdaten für ein Dashboard

Ein Operations-Team nutzt tägliche Lieferdaten für Entscheidungen.

Fehler erst im Dashboard

Fehlende Zeitstempel und doppelte Lieferungen fallen erst auf, wenn Zahlen im Bericht nicht plausibel wirken.

Qualität am Eingang prüfen

Die Pipeline prüft Pflichtfelder, Eindeutigkeit und Datenalter. Auffällige Lieferungen werden vor dem Dashboard markiert und an die Quelle zurückgegeben.

Je früher ein Qualitätsproblem erkannt wird, desto weniger weit wirkt es sich auf Berichte, Modelle und Entscheidungen aus.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Macht Datenprobleme sichtbar, bevor sie Entscheidungen beeinflussen.
  • Verbindet Qualitätsziele direkt mit einem konkreten Nutzungszweck.
  • Ermöglicht automatisierte Checks und nachvollziehbare Eskalationen.
  • Verbessert Vertrauen in Analysen und KI-Ausgaben.

Das solltest du beachten

  • Nicht jede wichtige Dimension lässt sich vollständig automatisch prüfen.
  • Zu viele starre Regeln können legitime Ausnahmen blockieren.
  • Kennzahlen ohne Ownership führen selten zu nachhaltiger Verbesserung.
  • Qualität kann sich durch neue Quellen oder Datenverteilungen verändern.
Vertiefung · für Fortgeschrittene

Qualität entlang des Datenflusses

Checks, Verantwortung und Ursachenanalyse arbeiten zusammen.

Wissenskarte

Fitness for Use

Die relevante Qualitätsfrage lautet nicht, ob Daten perfekt sind, sondern ob sie für die konkrete Entscheidung zuverlässig genug sind. Data Quality gliedert sich in: Quelle, Regeln, Validation, Pipeline, Owner, Monitoring.

01Einsatzbereiche

Wann ist Data Quality sinnvoll?

Geeignet für

  • ML-TrainingSchlechte Daten können Modellqualität und Zuverlässigkeit stark beeinträchtigen
  • DatenVertrauen in Dashboards und Reports
  • SicherheitNachvollziehbare und korrekte Daten für Compliance-Anforderungen

↑ Inhalt

Merksatz

Data Quality ist wie Lebensmittelqualität

Frisch (aktuell), vollständig (alle Zutaten), korrekt (richtige Zutaten), konsistent (immer gleich gut).

  1. Dimensionen: Vollständigkeit, Genauigkeit, Konsistenz, Aktualität
  2. Messen mit Metriken und Monitoring
  3. Garbage In, Garbage Out – besonders für ML

03Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

04FAQ

Häufige Fragen zu Data Quality

Wie messe ich Data Quality?

Metriken pro Dimension: fehlende Werte für Vollständigkeit, valide Werte für Genauigkeit, Abgleich über Quellen für Konsistenz und Datenalter für Aktualität. Schwellenwerte hängen vom Use Case ab.

Wer ist verantwortlich?

Data Owner für ihre Daten, Data Engineers für Pipelines, Data Quality Team für Standards und Monitoring.

↑ Inhalt

05Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Data Lineage

    Nachverfolgung von Datenherkunft, Transformationen und Verwendung.

  • Technisch vertiefen

    Data Validation

    Automatische Prüfung von Daten auf Korrektheit und Vollständigkeit.

↑ Inhalt