Sofortantwort
Data Catalog einfach erklärt
Zentrales Verzeichnis aller Datenbestände mit Metadaten und Beschreibungen.
- Kurz gesagt
- Zentrale Übersicht aller Datenquellen
- Typischer Einsatz
- Data Discovery, Onboarding, Sicherheit
- Wichtig zu wissen
- Suchbar und navigierbar für Data Discovery
Data Catalog im Überblick
Ein Data Catalog ist das Inhaltsverzeichnis deiner Daten – was gibt es, wo ist es, was bedeutet es.
Typische Inhalte:
| Information | Beispiel |
|---|---|
| Name | customer_orders |
| Beschreibung | Kundenbestellungen aus relevanten Systemen |
| Schema | order_id, customer_id, total, date |
| Owner | zuständiges Data- oder Fachteam |
| Lineage | Quelle → Pipeline → Warehouse |
| Qualität | Vollständigkeit, Aktualität, Validierungsstatus |
| Tags | PII, Finance, Daily |
Technisch betrachtet
Tools
| Tool | Typ |
|---|---|
| DataHub | Open Source Metadata Platform |
| Amundsen | Open Source Data Discovery |
| Atlan | Commercial |
| Alation | Commercial |
| AWS Glue Catalog | Cloud-native |
DataHub Beispiel
# dataset.yaml
- urn: urn:li:dataset:(urn:li:dataPlatform:warehouse,orders,PROD)
aspects:
- datasetProperties:
name: orders
description: Example customer order data
tags:
- PII
- Finance
- schemaMetadata:
fields:
- fieldPath: order_id
type: NUMBER
- fieldPath: customer_email
type: STRING
tags: [PII]Schritt für Schritt
Einen Data Catalog als Arbeitswerkzeug aufbauen
Ein Katalog ist mehr als eine technische Inventarliste. Er verbindet Daten mit Bedeutung, Verantwortung, Qualität und erlaubter Nutzung.
Metadaten automatisch erfassen
Discovery
Quellen, Tabellen, Schema und Nutzung werden über Integrationen regelmäßig in den Katalog übernommen.
Systeme → technische MetadatenFachkontext ergänzen
Kontext
Owner, Begriffe, Zweck, Sensibilität und bekannte Einschränkungen machen einen Datenbestand verständlich.
Dataset → Bedeutung + VerantwortungSuchen und bewerten
Nutzung
Teams finden Daten über Begriffe und Tags und sehen Qualität, Lineage und Zugriffsregeln vor der Nutzung.
Suche → passende DatenquellePflege im Prozess verankern
Betrieb
Änderungen an Datenprodukten aktualisieren Katalogeinträge und lösen bei Bedarf einen Review aus.
Änderung → Metadaten aktualisieren
Konkretes Beispiel
Beispiel: Daten für eine neue Analyse finden
Ein Analyst sucht eine verlässliche Quelle für Kundenzufriedenheit.
Informelle Suche
Mehrere ähnliche Tabellen existieren. Herkunft, Aktualität und zuständiges Team sind unklar.
Kataloggestützte Auswahl
Der Catalog zeigt die geprüfte Quelle, Owner, Aktualisierungszeit, Qualitätsstatus und Lineage. Der Analyst kann die Daten passend und verantwortbar einsetzen.
Ein guter Catalog spart nicht nur Suchzeit. Er verhindert, dass Teams unpassende oder veraltete Daten stillschweigend weiterverwenden.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Macht Datenbestände für Fach- und Technikteams auffindbar.
- Verbindet technische Metadaten mit Geschäftsbedeutung und Ownership.
- Unterstützt sichere Nutzung durch sichtbare Sensibilität und Zugriffsregeln.
- Beschleunigt Onboarding und reduziert doppelte Datenarbeit.
Das solltest du beachten
- Ohne automatisierte Aktualisierung veraltet ein Catalog schnell.
- Fachbeschreibungen und Ownership brauchen aktive Pflege.
- Ein Katalog ersetzt keine Zugriffs- oder Qualitätskontrolle.
- Zu viele unkuratierte Einträge können die Suche erschweren.
Vertiefung · für FortgeschritteneMetadaten, die Daten nutzbar machen
Der Katalog bündelt Informationen aus technischen Systemen und fachlicher Verantwortung.
Daten verstehen