Data Catalog

Datenbestände finden, verstehen und verantwortbar nutzen

Ein zentrales Verzeichnis aller Datenbestände im Unternehmen – mit Metadaten, Beschreibungen und Lineage für bessere Data Discovery.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Zentrale Übersicht aller Datenquellen
  2. Metadaten: Schema, Owner, Qualität, Lineage
  3. Suchbar und navigierbar für Data Discovery

Sofortantwort

Data Catalog einfach erklärt

Zentrales Verzeichnis aller Datenbestände mit Metadaten und Beschreibungen.

Kurz gesagt
Zentrale Übersicht aller Datenquellen
Typischer Einsatz
Data Discovery, Onboarding, Sicherheit
Wichtig zu wissen
Suchbar und navigierbar für Data Discovery

Data Catalog im Überblick

Ein Data Catalog ist das Inhaltsverzeichnis deiner Daten – was gibt es, wo ist es, was bedeutet es.

Typische Inhalte:

InformationBeispiel
Namecustomer_orders
BeschreibungKundenbestellungen aus relevanten Systemen
Schemaorder_id, customer_id, total, date
Ownerzuständiges Data- oder Fachteam
LineageQuelle → Pipeline → Warehouse
QualitätVollständigkeit, Aktualität, Validierungsstatus
TagsPII, Finance, Daily

Technisch betrachtet

Tools

ToolTyp
DataHubOpen Source Metadata Platform
AmundsenOpen Source Data Discovery
AtlanCommercial
AlationCommercial
AWS Glue CatalogCloud-native

DataHub Beispiel

# dataset.yaml
- urn: urn:li:dataset:(urn:li:dataPlatform:warehouse,orders,PROD)
  aspects:
    - datasetProperties:
        name: orders
        description: Example customer order data
        tags:
          - PII
          - Finance
    - schemaMetadata:
        fields:
          - fieldPath: order_id
            type: NUMBER
          - fieldPath: customer_email
            type: STRING
            tags: [PII]

Schritt für Schritt

Einen Data Catalog als Arbeitswerkzeug aufbauen

Ein Katalog ist mehr als eine technische Inventarliste. Er verbindet Daten mit Bedeutung, Verantwortung, Qualität und erlaubter Nutzung.

  1. Metadaten automatisch erfassen

    Discovery

    Quellen, Tabellen, Schema und Nutzung werden über Integrationen regelmäßig in den Katalog übernommen.

    Systeme → technische Metadaten
  2. Fachkontext ergänzen

    Kontext

    Owner, Begriffe, Zweck, Sensibilität und bekannte Einschränkungen machen einen Datenbestand verständlich.

    Dataset → Bedeutung + Verantwortung
  3. Suchen und bewerten

    Nutzung

    Teams finden Daten über Begriffe und Tags und sehen Qualität, Lineage und Zugriffsregeln vor der Nutzung.

    Suche → passende Datenquelle
  4. Pflege im Prozess verankern

    Betrieb

    Änderungen an Datenprodukten aktualisieren Katalogeinträge und lösen bei Bedarf einen Review aus.

    Änderung → Metadaten aktualisieren

Konkretes Beispiel

Beispiel: Daten für eine neue Analyse finden

Ein Analyst sucht eine verlässliche Quelle für Kundenzufriedenheit.

Informelle Suche

Mehrere ähnliche Tabellen existieren. Herkunft, Aktualität und zuständiges Team sind unklar.

Kataloggestützte Auswahl

Der Catalog zeigt die geprüfte Quelle, Owner, Aktualisierungszeit, Qualitätsstatus und Lineage. Der Analyst kann die Daten passend und verantwortbar einsetzen.

Ein guter Catalog spart nicht nur Suchzeit. Er verhindert, dass Teams unpassende oder veraltete Daten stillschweigend weiterverwenden.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Macht Datenbestände für Fach- und Technikteams auffindbar.
  • Verbindet technische Metadaten mit Geschäftsbedeutung und Ownership.
  • Unterstützt sichere Nutzung durch sichtbare Sensibilität und Zugriffsregeln.
  • Beschleunigt Onboarding und reduziert doppelte Datenarbeit.

Das solltest du beachten

  • Ohne automatisierte Aktualisierung veraltet ein Catalog schnell.
  • Fachbeschreibungen und Ownership brauchen aktive Pflege.
  • Ein Katalog ersetzt keine Zugriffs- oder Qualitätskontrolle.
  • Zu viele unkuratierte Einträge können die Suche erschweren.
Vertiefung · für Fortgeschrittene

Metadaten, die Daten nutzbar machen

Der Katalog bündelt Informationen aus technischen Systemen und fachlicher Verantwortung.

Wissenskarte

Daten verstehen

Ein Katalog wird wertvoll, wenn er direkt im Arbeitsfluss hilft, die richtige Datenquelle für eine konkrete Entscheidung zu wählen. Data Catalog gliedert sich in: Quellen, Schema, Owner, Tags, Quality, Lineage.

01Einsatzbereiche

Wann ist Data Catalog sinnvoll?

Geeignet für

  • Data DiscoveryWelche Daten haben wir? Wo sind sie?
  • OnboardingNeue Mitarbeiter verstehen Datenlandschaft
  • SicherheitWo sind personenbezogene Daten?

↑ Inhalt

Merksatz

Ein Data Catalog ist wie ein Bibliothekskatalog

Du findest nicht nur, welche Bücher (Daten) es gibt, sondern auch wo sie stehen, worum es geht und wer sie zuletzt gelesen hat.

  1. Zentrale Übersicht aller Datenquellen
  2. Metadaten: Schema, Owner, Qualität, Lineage
  3. Suchbar und navigierbar für Data Discovery

03Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

04FAQ

Häufige Fragen zu Data Catalog

Data Catalog vs. Data Dictionary?

Dictionary: Technische Definitionen (Spalten, Typen). Catalog: Breiter – auch Business-Kontext, Lineage, Nutzung, Qualität.

Wie halte ich den Catalog aktuell?

Automatisierung hilft stark: Crawler oder Integrationen scannen Datenquellen und extrahieren technische Metadaten. Business-Kontext, Ownership und Qualitätshinweise brauchen meist ergänzende Pflege.

↑ Inhalt

05Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Data Quality

    Messung und Sicherstellung der Qualität von Daten.

  • Technisch vertiefen

    Data Lineage

    Nachverfolgung von Datenherkunft, Transformationen und Verwendung.

↑ Inhalt