Sofortantwort
Data Lake einfach erklärt
Ein Speicher für große Mengen an Rohdaten in ihrem Originalformat.
- Kurz gesagt
- Speichert Rohdaten in ihrem Originalformat (Schema on Read)
- Typischer Einsatz
- ML-Trainingsdaten, Log-Analyse, IoT-Daten
- Wichtig zu wissen
- Ideal für ML-Training, da Rohdaten flexibel transformiert werden können
Data Lake im Überblick
Ein Data Lake ist ein zentrales Repository für alle Arten von Rohdaten – strukturiert, semi-strukturiert und unstrukturiert – in beliebigem Format und beliebiger Menge. Im Gegensatz zum Data Warehouse, das nur sauber transformierte Daten aufnimmt, akzeptiert ein Data Lake alles: Logs, Bilder, Videos, JSON-Dateien, CSV-Exporte, Sensor-Daten. Das Motto: “Erst speichern, dann entscheiden was man damit macht.” Für KI-Projekte ist der Data Lake oft die erste Anlaufstelle für Rohdaten, aus denen Trainingsdatensätze erstellt werden.
Ein Data Lake ist ein zentraler Speicher für alle Arten von Daten in ihrem Rohformat – strukturiert, semi-strukturiert und unstrukturiert. Im Gegensatz zum Data Warehouse, das nur sauber transformierte Daten aufnimmt, akzeptiert ein Data Lake alles: Logs, Bilder, Videos, JSON-Dateien, CSV-Exporte, Sensor-Daten. Für KI-Projekte ist der Data Lake oft die erste Anlaufstelle: Hier liegen die Rohdaten, aus denen Trainingsdatensätze erstellt werden.
Ein Data Lake ist ein riesiger Speicher für alle Arten von Daten in ihrem Rohformat. Anders als ein Data Warehouse, das nur sauber strukturierte Daten aufnimmt, akzeptiert ein Data Lake alles – Tabellen, JSON, Bilder, Videos, Logs.
Data Lake vs. Data Warehouse:
| Aspekt | Data Lake | Data Warehouse |
|---|---|---|
| Datenformat | Roh, alle Formate | Strukturiert, bereinigt |
| Schema | Schema on Read | Schema on Write |
| Kosten | Günstig (Objektspeicher) | Teurer (optimierte DBs) |
| Nutzer | Data Scientists, ML Engineers | Business Analysten |
| Abfragen | Flexibel, aber langsamer | Schnell, optimiert |
Technisch betrachtet
Architektur
Datenquellen → Ingestion → Data Lake (S3/GCS) → Processing → Consumers
(APIs, DBs, (Kafka, (Rohdaten in (Spark, (ML Training,
Logs, IoT) Fivetran) Zonen organisiert) dbt) Analytics)
Zonen-Konzept
- Raw/Bronze: Rohdaten, unverändert
- Cleaned/Silver: Bereinigte, validierte Daten
- Curated/Gold: Aufbereitete, analysefertige Daten
Data Lakehouse
Moderne Kombination: Delta Lake oder Iceberg auf S3/GCS mit:
- ACID-Transaktionen
- Schema Evolution
- Time Travel (historische Versionen)
- Schnelle Abfragen durch Statistiken und Indexierung
Schritt für Schritt
Rohdaten verantwortungsvoll nutzbar halten
Ein Data Lake schafft Flexibilität, wenn Speicherung, Metadaten und Zugriffsregeln von Beginn an gemeinsam gedacht werden.
Daten geordnet aufnehmen
Aufnahme
Neue Dateien und Ereignisse werden mit Herkunft, Zeit und Format in eine klar abgegrenzte Rohdatenzone geschrieben.
quelle -> rohzone + metadatenZugriff absichern
Schutz
Berechtigungen und Schutzklassen verhindern, dass sensible Daten einfach mit anderen Datenbeständen vermischt oder unkontrolliert genutzt werden.
datenklasse -> zugriffsregelDaten erschließen
Katalog
Katalog, Beschreibung und Qualitätsprüfungen machen auffindbar, welche Daten vorhanden sind und wofür sie geeignet sind.
metadaten + qualitaet -> auffindbares assetAbgeleitete Produkte liefern
Veredelung
Bereinigte oder aggregierte Daten werden als eigene verlässliche Schichten für Analyse und Training bereitgestellt.
rohzone -> gepruefte datenprodukte
Konkretes Beispiel
Verschiedene Quellen für ein ML-Projekt sammeln
Ein Team möchte Text, Bilder und Ereignisprotokolle später für mehrere Fragestellungen nutzen.
Ablagen ohne Ordnung
Dateien liegen in Einzelordnern. Herkunft, Zugriff und Versionen sind nicht zuverlässig nachvollziehbar.
Data Lake mit Zonen und Katalog
Rohdaten bleiben erhalten, sind klassifiziert und auffindbar. Für konkrete Projekte entstehen daraus geprüfte abgeleitete Datensätze.
Ein Data Lake ist keine ungeordnete Ablage, sondern eine Grundlage für spätere, kontrollierte Datennutzung.
Einordnung
Vorteile und Grenzen
Das spricht dafür
- Hohe Formatflexibilität: Strukturierte, semi-strukturierte und unstrukturierte Daten können gemeinsam verwaltet werden.
- Rohdaten bleiben verfügbar: Neue Anforderungen können auf den ursprünglichen Datenstand zurückgreifen.
- Gute Basis für ML: Große und vielfältige Datenbestände lassen sich für Trainings- und Evaluationsdaten erschließen.
- Kostengünstige Speicherung: Rohdaten können in skalierbaren Speichern aufbewahrt und schrittweise verarbeitet werden.
Das solltest du beachten
- Ohne Governance droht Unübersichtlichkeit: Fehlende Metadaten und Ownership machen Daten schnell wertlos.
- Zugriffsrechte sind kritisch: Rohdaten enthalten häufig sensible oder besonders schützenswerte Informationen.
- Qualität entsteht nicht automatisch: Rohdaten müssen für konkrete Nutzung erst geprüft und aufbereitet werden.
- Abfragen brauchen Architektur: Für wiederkehrende Analysen sind oft optimierte Datenprodukte oder ein Warehouse sinnvoller.
Vertiefung · für FortgeschritteneVom Rohdatum zum nutzbaren Datenbestand
Ein Lake verbindet flexible Speicherung mit Regeln, die Daten später sicher auffindbar und verarbeitbar machen.
zentraler Speicher für vielfältige Rohdaten