Was ist Data Engineering?

Datenschicht
Kurz beantwortet

Data Engineering verwandelt Rohdaten aus Quellsystemen in verwertbare Datenprodukte: Daten werden extrahiert, transformiert und für Analysen, Dashboards und KI-Modelle bereitgestellt. Zu den Kernaufgaben gehören ETL-Pipelines, Data Warehouses, Data Lakes und Datenqualität.

Kurz vorwegIn den meisten gescheiterten KI-Projekten liegt der Fehler in der Datenschicht. Datenarchitektur-Check starten

Data Engineering: Definition

Data Engineering bezeichnet alle Prozesse, mit denen Unternehmen Rohdaten in eine nutzbare Form bringen. Die Arbeit beginnt an den Quellsystemen - Datenbanken, SAP, ERP, Sensoren oder Dateien - und endet in den Systemen, die daraus Wert schöpfen: Reporting-Plattformen, Dashboards, Data-Science-Modelle und KI-Anwendungen.

Der typische Arbeitsablauf ist die Pipeline: Daten werden extrahiert (ETL) beziehungsweise direkt in ein Zielsystem geladen und dort transformiert (ELT), angereichert, bereinigt und für Analysezwecke strukturiert. Zwei Speicherkonzepte dominieren: das Data Warehouse für strukturierte Auswertungen und der Data Lake für Rohdaten - das Lakehouse verbindet beide.

Zweck
Rohdaten in verwertbare Datenprodukte verwandeln
Kernaufgaben
ETL-/ELT-Pipelines, Data Warehouses, Data Lakes, Datenqualität
Kernidee
Ohne saubere Daten keine belastbare KI
Typische Tools
Azure Data Factory, Databricks, Microsoft Fabric, Apache Airflow, dbt

Wie funktioniert Data Engineering?

Der Ablauf folgt dem Weg der Daten von der Quelle bis zum Datenprodukt:

  1. Quellen anbindenDatenbanken, SAP, ERP, Sensoren oder Dateien werden angebunden und extrahiert - inklusive der Frage, wer welche Daten sehen darf.
  2. Transformieren und bereinigenDaten werden angereichert, bereinigt und strukturiert. Datenqualitäts-Checks fangen Fehler, bevor sie Analysen oder Modelle verfälschen.
  3. BereitstellenDie fertigen Datenprodukte landen im Data Warehouse, Data Lake oder direkt in Dashboards, Reports und ML-Pipelines.

Warum ist Data Engineering die Basis für KI?

Modelle lernen aus den Daten, die die Pipelines liefern. Wer LLMs, RAG-Systeme oder KI-Agenten plant, muss zuerst die Dateninfrastruktur verstehen - schlechte Daten in, Halluzinationen raus. Die Datenqualität entscheidet über die KI-Qualität, nicht das Modell.

ETL oder ELT?

Die Reihenfolge der Schritte entscheidet, wo die Rechenlast liegt und wie flexibel die Plattform später ist.

KriteriumELTETL
Transformation läuftim Zielsystem, nach dem Ladenvor dem Laden, in einem eigenen Werkzeug
Rohdaten bleibenerhalten und nachvollziehbarmeist nur transformiert erhalten
Neue Auswertungauf den bestehenden Rohdaten möglicherfordert oft eine neue Pipeline
Rechenlastim Warehouse oder Lakehouseauf einem separaten ETL-Server
Passt zuCloud-Plattformen mit elastischer Rechenleistungfesten Kapazitäten, strengen Vorabfiltern

Was vor dem ersten KI-Projekt geklärt sein muss

Die meisten Verzögerungen entstehen nicht im Modell, sondern an diesen fünf Punkten.

Vor dem ersten KI-Projekt
  • Quellsysteme benannt: welches System führt welche Wahrheit, und wer gibt den Zugriff frei
  • Aktualität geklärt: reicht täglich, oder muss es minütlich sein
  • Berechtigungen bekannt: wer darf welche Zeile sehen, bevor die Daten kopiert werden
  • Datenqualität gemessen: Vollständigkeit und Dubletten geprüft, nicht angenommen
  • Zielbild definiert: welches Datenprodukt am Ende steht, nicht nur welche Technik
In der Praxis

In den meisten gescheiterten KI-Projekten liegt der Fehler in der Datenschicht, nicht im Modell. Die erste Frage ist nie „welches Modell“, sondern: Welche Quelle ist heute erreichbar, und wer darf welche Zeile sehen?

Häufiger Irrtum

„Data Engineering ist dasselbe wie Data Science." Nein: Data Engineering stellt die Daten bereit, Data Science wertet sie aus und baut Modelle. Ohne saubere Dateninfrastruktur kann Data Science nicht produktiv arbeiten.

Häufige Fragen zu Data Engineering

Was macht ein Data Engineer?

Ein Data Engineer baut und betreibt die Pipelines, die Daten aus Quellsystemen in Speicher- und Analysesysteme bringen. Dazu gehören ETL-/ELT-Prozesse, Datenqualitäts-Checks und die Auswahl der passenden Plattform.

Braucht jedes Unternehmen ein Data Warehouse?

Nein. Kleine Teams starten oft mit einer aufgeräumten Datenbank oder einer Reporting-Plattform. Ein Data Warehouse oder Data Lake lohnt sich, sobald mehrere Quellsysteme, hohe Datenmengen oder KI-Anwendungen zusammenkommen.

Was ist der Unterschied zwischen ETL und ELT?

Bei ETL werden die Daten vor dem Laden transformiert, bei ELT direkt ins Zielsystem geladen und dort transformiert. ELT nutzt die Rechenleistung moderner Plattformen wie Databricks oder Fabric und ist bei großen Datenmengen schneller.

Wenn es konkret wird

Ihre Daten sind die Basis Ihrer KI - wir prüfen in einem Gespräch, wo die Datenschicht steht und was sie braucht.

Datenarchitektur-Check starten
Phillip PhamPexon ConsultingStand 19.08.2026