Data Lake

Ein Data Lake bewahrt vielfältige Rohdaten so auf, dass sie später gezielt erschlossen werden können.

Ein zentraler Speicher, der große Mengen an Rohdaten in ihrem ursprünglichen Format aufnimmt – strukturiert, semi-strukturiert und unstrukturiert.

Fortgeschritten2 Min Lesezeit

Erklärung starten

Auf einen Blick

3 Punkte

  1. Speichert Rohdaten in ihrem Originalformat (Schema on Read)
  2. Kann strukturierte (Tabellen), semi-strukturierte (JSON) und unstrukturierte Daten (Bilder, Text) aufnehmen
  3. Ideal für ML-Training, da Rohdaten flexibel transformiert werden können

Sofortantwort

Data Lake einfach erklärt

Ein Speicher für große Mengen an Rohdaten in ihrem Originalformat.

Kurz gesagt
Speichert Rohdaten in ihrem Originalformat (Schema on Read)
Typischer Einsatz
ML-Trainingsdaten, Log-Analyse, IoT-Daten
Wichtig zu wissen
Ideal für ML-Training, da Rohdaten flexibel transformiert werden können

Data Lake im Überblick

Ein Data Lake ist ein zentrales Repository für alle Arten von Rohdaten – strukturiert, semi-strukturiert und unstrukturiert – in beliebigem Format und beliebiger Menge. Im Gegensatz zum Data Warehouse, das nur sauber transformierte Daten aufnimmt, akzeptiert ein Data Lake alles: Logs, Bilder, Videos, JSON-Dateien, CSV-Exporte, Sensor-Daten. Das Motto: “Erst speichern, dann entscheiden was man damit macht.” Für KI-Projekte ist der Data Lake oft die erste Anlaufstelle für Rohdaten, aus denen Trainingsdatensätze erstellt werden.

Ein Data Lake ist ein zentraler Speicher für alle Arten von Daten in ihrem Rohformat – strukturiert, semi-strukturiert und unstrukturiert. Im Gegensatz zum Data Warehouse, das nur sauber transformierte Daten aufnimmt, akzeptiert ein Data Lake alles: Logs, Bilder, Videos, JSON-Dateien, CSV-Exporte, Sensor-Daten. Für KI-Projekte ist der Data Lake oft die erste Anlaufstelle: Hier liegen die Rohdaten, aus denen Trainingsdatensätze erstellt werden.

Ein Data Lake ist ein riesiger Speicher für alle Arten von Daten in ihrem Rohformat. Anders als ein Data Warehouse, das nur sauber strukturierte Daten aufnimmt, akzeptiert ein Data Lake alles – Tabellen, JSON, Bilder, Videos, Logs.

Data Lake vs. Data Warehouse:

AspektData LakeData Warehouse
DatenformatRoh, alle FormateStrukturiert, bereinigt
SchemaSchema on ReadSchema on Write
KostenGünstig (Objektspeicher)Teurer (optimierte DBs)
NutzerData Scientists, ML EngineersBusiness Analysten
AbfragenFlexibel, aber langsamerSchnell, optimiert

Technisch betrachtet

Architektur

Datenquellen → Ingestion → Data Lake (S3/GCS) → Processing → Consumers
(APIs, DBs,    (Kafka,      (Rohdaten in         (Spark,      (ML Training,
 Logs, IoT)    Fivetran)     Zonen organisiert)    dbt)         Analytics)

Zonen-Konzept

  • Raw/Bronze: Rohdaten, unverändert
  • Cleaned/Silver: Bereinigte, validierte Daten
  • Curated/Gold: Aufbereitete, analysefertige Daten

Data Lakehouse

Moderne Kombination: Delta Lake oder Iceberg auf S3/GCS mit:

  • ACID-Transaktionen
  • Schema Evolution
  • Time Travel (historische Versionen)
  • Schnelle Abfragen durch Statistiken und Indexierung

Schritt für Schritt

Rohdaten verantwortungsvoll nutzbar halten

Ein Data Lake schafft Flexibilität, wenn Speicherung, Metadaten und Zugriffsregeln von Beginn an gemeinsam gedacht werden.

  1. Daten geordnet aufnehmen

    Aufnahme

    Neue Dateien und Ereignisse werden mit Herkunft, Zeit und Format in eine klar abgegrenzte Rohdatenzone geschrieben.

    quelle -> rohzone + metadaten
  2. Zugriff absichern

    Schutz

    Berechtigungen und Schutzklassen verhindern, dass sensible Daten einfach mit anderen Datenbeständen vermischt oder unkontrolliert genutzt werden.

    datenklasse -> zugriffsregel
  3. Daten erschließen

    Katalog

    Katalog, Beschreibung und Qualitätsprüfungen machen auffindbar, welche Daten vorhanden sind und wofür sie geeignet sind.

    metadaten + qualitaet -> auffindbares asset
  4. Abgeleitete Produkte liefern

    Veredelung

    Bereinigte oder aggregierte Daten werden als eigene verlässliche Schichten für Analyse und Training bereitgestellt.

    rohzone -> gepruefte datenprodukte

Konkretes Beispiel

Verschiedene Quellen für ein ML-Projekt sammeln

Ein Team möchte Text, Bilder und Ereignisprotokolle später für mehrere Fragestellungen nutzen.

Ablagen ohne Ordnung

Dateien liegen in Einzelordnern. Herkunft, Zugriff und Versionen sind nicht zuverlässig nachvollziehbar.

Data Lake mit Zonen und Katalog

Rohdaten bleiben erhalten, sind klassifiziert und auffindbar. Für konkrete Projekte entstehen daraus geprüfte abgeleitete Datensätze.

Ein Data Lake ist keine ungeordnete Ablage, sondern eine Grundlage für spätere, kontrollierte Datennutzung.

Einordnung

Vorteile und Grenzen

Das spricht dafür

  • Hohe Formatflexibilität: Strukturierte, semi-strukturierte und unstrukturierte Daten können gemeinsam verwaltet werden.
  • Rohdaten bleiben verfügbar: Neue Anforderungen können auf den ursprünglichen Datenstand zurückgreifen.
  • Gute Basis für ML: Große und vielfältige Datenbestände lassen sich für Trainings- und Evaluationsdaten erschließen.
  • Kostengünstige Speicherung: Rohdaten können in skalierbaren Speichern aufbewahrt und schrittweise verarbeitet werden.

Das solltest du beachten

  • Ohne Governance droht Unübersichtlichkeit: Fehlende Metadaten und Ownership machen Daten schnell wertlos.
  • Zugriffsrechte sind kritisch: Rohdaten enthalten häufig sensible oder besonders schützenswerte Informationen.
  • Qualität entsteht nicht automatisch: Rohdaten müssen für konkrete Nutzung erst geprüft und aufbereitet werden.
  • Abfragen brauchen Architektur: Für wiederkehrende Analysen sind oft optimierte Datenprodukte oder ein Warehouse sinnvoller.
Vertiefung · für Fortgeschrittene

Vom Rohdatum zum nutzbaren Datenbestand

Ein Lake verbindet flexible Speicherung mit Regeln, die Daten später sicher auffindbar und verarbeitbar machen.

Wissenskarte

zentraler Speicher für vielfältige Rohdaten

Die Speicherung schafft erst dann Wert, wenn Herkunft, Schutz und der Weg zu nutzbaren Datenprodukten klar bleiben. Data Lake gliedert sich in: Datenquellen, Rohdatenzone, Metadaten, Zugriffsregeln, Verarbeitung, Datenprodukt.

01Einsatzbereiche

Wann ist Data Lake sinnvoll?

Geeignet für

  • ML-TrainingsdatenZentrale Ablage für alle Rohdaten, die für ML-Training genutzt werden
  • Log-AnalyseSpeicherung und Analyse großer Mengen an Server- und Anwendungslogs
  • IoT-DatenSammlung von Sensordaten aus tausenden Geräten

↑ Inhalt

02Werkzeuge

Womit Data Lake umgesetzt wird

↑ Inhalt

Merksatz

Ein Data Lake ist wie ein großer See, in den alle Flüsse (Datenquellen) münden

Das Wasser (die Daten) wird in seiner natürlichen Form gespeichert und erst bei Bedarf gefiltert und aufbereitet.

  1. Speichert Rohdaten in ihrem Originalformat (Schema on Read)
  2. Kann strukturierte (Tabellen), semi-strukturierte (JSON) und unstrukturierte Daten (Bilder, Text) aufnehmen
  3. Ideal für ML-Training, da Rohdaten flexibel transformiert werden können

04Anwenden

Data Lake praktisch anwenden

↑ Inhalt

05Redaktion

Herkunft und Stand

Redaktion und Aktualität

Ebenex RedaktionRedaktion

Veröffentlicht
Aktualisiert

Dieses Feld entwickelt sich schnell. Oben stehen Veröffentlichung und letzte Änderung; ein Prüfdatum kommt dazu, sobald die Erklärung nach ihrer letzten Änderung geprüft wurde.

↑ Inhalt

06FAQ

Häufige Fragen zu Data Lake

Was ist der Unterschied zwischen Data Lake und Data Warehouse?

Data Lake: Rohdaten, alle Formate, Schema on Read, günstig. Data Warehouse: Strukturierte, aufbereitete Daten, Schema on Write, teurer aber schneller für Abfragen. Moderne Architekturen nutzen oft beides (Lakehouse).

Was ist ein Data Lakehouse?

Eine Kombination aus Data Lake und Data Warehouse. Rohdaten im Lake-Format (günstig, flexibel) mit Warehouse-Features (ACID, Schema, schnelle Abfragen). Technologien: Delta Lake, Apache Iceberg.

Wie kann ich sicherstellen, dass mein Data Lake effizient bleibt?

Um die Effizienz deines Data Lakes zu gewährleisten, solltest du regelmäßige Datenbereinigungen und -archivierungen durchführen. Zudem ist es wichtig, Metadaten zu verwalten und geeignete Indizes zu verwenden, um die Datenabfrage zu optimieren.

Welche Tools eignen sich am besten zur Verwaltung eines Data Lakes?

Beliebte Tools zur Verwaltung von Data Lakes sind Apache Hadoop, Amazon S3 und Azure Data Lake Storage. Diese bieten Funktionen zur Speicherung, Verarbeitung und Analyse großer Datenmengen in verschiedenen Formaten.

↑ Inhalt

07Weiterlernen

Was möchtest du als Nächstes verstehen?

  • Grundlage nachholen

    Data Pipeline

    Eine automatisierte Folge von Schritten zur Datenverarbeitung.

  • Technisch vertiefen

    Dataset

    Eine Sammlung strukturierter Daten für das Training von KI-Modellen.

  • Alternative vergleichen

    Data Warehouse vs. Data Lake

    Verlässliche Kennzahlen oder günstiger Rohdatenspeicher?

↑ Inhalt