Was ist ein Data Lake?

Datenschicht
Kurz beantwortet

Ein Data Lake ist ein zentraler Speicher für Rohdaten in beliebigem Format - strukturiert, halbstrukturiert oder unstrukturiert. Anders als ein Data Warehouse werden die Daten nicht vor dem Laden aufbereitet, sondern erst bei der Nutzung interpretiert (Schema-on-Read). Dadurch ist ein Data Lake flexibel, aber ohne Governance droht er zum Data Swamp zu werden.

Kurz vorwegDie Qualität eines Data Lake steht und fällt mit Governance, nicht mit dem Speicher. Datenarchitektur-Check starten

Data Lake: Definition

Ein Data Lake speichert Daten in ihrer ursprünglichen Form, ohne sie vorher in ein festes Schema zu zwingen. Dokumente, JSON, Parquet, Bilder, Logs und Sensordaten landen direkt im Speicher, meist auf einer Cloud-Plattform wie Azure Data Lake Storage oder Amazon S3. Die Aufbereitung passiert erst bei der Auswertung: Wer die Daten liest, entscheidet, wie sie interpretiert werden. Das macht den Data Lake zur flexiblen Basis für Exploration, Machine Learning und Fragen, die beim Speichern noch unbekannt sind.

Der klassische Weg ins Data Warehouse ist ETL - transformieren vor dem Laden, damit nur bereinigte, konsistente Daten stehen. Der Data Lake dreht das Prinzip um: Erst speichern, dann entscheiden, was die Daten bedeuten. Genau diese Freiheit ist der Grund, warum KI-Projekte gern auf einem Data Lake aufsetzen: Modelle und RAG-Systeme brauchen Rohdaten in ihrer vollen Breite, nicht nur die bereits gefilterte Sicht eines Warehouses.

Der Preis der Flexibilität ist Ordnung: Ohne klare Regeln, wer welche Daten ablegen und lesen darf, wird ein Data Lake schnell zum Data Swamp - einem Speicher, in dem niemand mehr findet, was er sucht. Die Qualität des Lakes steht und fällt mit Governance, Metadaten und Berechtigungen, nicht mit dem Speicher selbst.

Zweck
Rohdaten in beliebigem Format zentral speichern, für später unbekannte Auswertungen
Kernidee
Flexibilität statt Ordnung - Schema-on-Read: interpretieren erst bei der Nutzung
Speicherformate
JSON, Parquet, Bilder, Logs, Sensordaten - alles bleibt im Original
Gegenstück
Data Warehouse (strukturiert, Schema-on-Write) - das Lakehouse verbindet beide
Typische Plattformen
Azure Data Lake Storage, Amazon S3, Databricks, Microsoft Fabric

Wie funktioniert ein Data Lake?

Der Weg der Daten in den Data Lake ist bewusst einfach gehalten, die Arbeit beginnt danach:

  1. Daten ablegenRohdaten aus Quellsystemen werden in ihrem Originalformat in den Speicher geschrieben - ohne Transformation, ohne Schema, ohne Qualitätsprüfung vorab.
  2. Metadaten pflegenKatalog, Lineage und Berechtigungen legen fest, welche Daten existieren, woher sie kommen und wer sie sehen darf. Hier entsteht die Auffindbarkeit.
  3. Bei Bedarf aufbereitenErst wenn eine Auswertung oder ein Modell die Daten braucht, werden sie gelesen, transformiert und in das passende Format gebracht - Schema-on-Read.
  4. AuswertenData Engineers und Data Scientists erkunden die Rohdaten frei, bauen Pipelines für Produktdaten und trainieren Modelle direkt auf der vollen Datenbasis.

Data Lake oder Data Warehouse?

Beide speichern Daten, aber mit unterschiedlichem Zweck. Die Entscheidung ist keine Frage des Neuen gegenüber dem Alten, sondern des Anwendungsfalls.

KriteriumData WarehouseData Lake
Datenformatestrukturiert, in einem einheitlichen Schemabeliebig: JSON, Parquet, Bilder, Logs
Zweckfeste Reports und wiederkehrende Auswertungenflexible Exploration, Machine Learning, Rohdatenhaltung
Aufbereitungvor dem Laden (Schema-on-Write)erst bei der Nutzung (Schema-on-Read)
Datenqualitätsichergestellt durch ETL vor dem Ladenhängt von Governance und Metadaten ab, sonst Data Swamp
Passt zubetrieblichen Reports mit definierten FragenExperimenten, KI-Projekten und unbekannten Fragen

Wann lohnt sich ein Data Lake?

Ein Data Lake lohnt sich, wenn
  • Machine-Learning- und KI-Projekte auf der vollen Datenbreite trainieren sollen
  • die Auswertungsfragen beim Speichern noch nicht bekannt sind
  • Rohdaten unverändert für spätere Analysen erhalten bleiben müssen
  • verschiedene Teams mit unterschiedlichen Formaten und Werkzeugen arbeiten
Ein Data Warehouse reicht, wenn
  • nur fest definierte Reports und Dashboards gebraucht werden
  • die Datenquellen überschaubar und stabil sind
  • Datenqualität garantiert sein muss, bevor Daten ins System kommen
  • das Team klein ist und mit einer aufgeräumten Datenbank startet

Was der Data Lake mit KI zu tun hat

RAG-Systeme und KI-Agenten holen ihre Fakten aus einem Index, der aus Dokumenten gebaut wird. Generative Modelle lernen aus möglichst vollständigen Daten. Ein Data Lake liefert genau diese Breite - aber nur, wenn Metadaten und Berechtigungen stimmen. Wer RAG auf einem Data Swamp aufbaut, verdoppelt das Chaos: Die Halluzination beginnt schon im Datenbestand.

Die häufigsten Data-Lake-Fehler

Die meisten Data-Lake-Projekte scheitern nicht am Speicher, sondern an diesen Punkten:

Häufige Fehler
  • Ohne Governance starten: jeder darf Daten ablegen, niemand kennt den Inhalt - aus dem Lake wird ein Swamp
  • Metadaten ignorieren: ohne Katalog und Lineage findet niemand die Daten, die er braucht
  • Berechtigungen erst am Ende regeln: wer sensible Daten lesen darf, steht fest, wenn es zu spät ist
  • Den Lake zum Warehouse machen: alle Daten vorsorglich in ein starres Schema zu zwingen, nimmt die Flexibilität
  • Ohne Aufräumregeln betreiben: veraltete und doppelte Daten wachsen unkontrolliert, bis die Kosten explodieren
In der Praxis

Ein Data Lake ist kein Selbstzweck, sondern die Antwort auf unbekannte Fragen. Die erste Frage ist nie „welche Plattform“, sondern: Welche Daten brauchen unsere KI-Projekte wirklich, und wer darf sie sehen? Wer Governance, Metadaten und Berechtigungen von Tag eins mitdenkt, baut einen Lake, der mitwächst - wer sie weglässt, baut einen Swamp, der alles verlangsamt.

Häufiger Irrtum

„Data Lakes sind veraltet, heute braucht man ein Lakehouse.“ Nein: Das Lakehouse verbindet beide Welten, aber die Kernfrage bleibt dieselbe - wie viel Ordnung braucht Ihre Auswertung? Wer flexibel erkunden will, nutzt die Lake-Seite, wer feste Reports will, die Warehouse-Seite. Das Lakehouse löst den Werkzeugkonflikt, nicht die Governance-Frage.

Häufige Fragen zu Data Lake

Was ist der Unterschied zwischen Data Lake und Data Warehouse?

Ein Data Lake speichert Rohdaten in beliebigem Format und interpretiert sie erst bei der Nutzung (Schema-on-Read). Ein Data Warehouse speichert aufbereitete, strukturierte Daten für fest definierte Auswertungen (Schema-on-Write). Der Lake ist flexibel, das Warehouse liefert verlässliche, einheitliche Reports.

Wann braucht ein Unternehmen einen Data Lake?

Sobald KI- und Machine-Learning-Projekte auf der vollen Datenbreite arbeiten, Auswertungsfragen noch unbekannt sind oder Rohdaten unverändert erhalten bleiben müssen. Für reine Reporting-Anforderungen mit definierten Fragen reicht meist ein Data Warehouse oder eine aufgeräumte Datenbank.

Was ist ein Data Swamp?

Ein Data Lake ohne Governance, in dem niemand mehr findet, was er sucht: Daten ohne Metadaten, ohne Berechtigungen, ohne klare Verantwortlichkeit. Der Speicher wächst, aber jede Auswertung wird teurer. Data Swamps entstehen durch fehlende Katalog-, Lineage- und Aufräumregeln - nicht durch die Technik.

Wenn es konkret wird

Ihre Daten sind die Basis Ihrer KI - wir prüfen in einem Gespräch, ob ein Data Lake, ein Data Warehouse oder ein Lakehouse für Ihren Anwendungsfall richtig ist.

Datenarchitektur-Check starten
Phillip PhamPexon ConsultingStand 19.08.2026