Was ist Data Engineering?
DatenschichtData Engineering verwandelt Rohdaten aus Quellsystemen in verwertbare Datenprodukte: Daten werden extrahiert, transformiert und für Analysen, Dashboards und KI-Modelle bereitgestellt. Zu den Kernaufgaben gehören ETL-Pipelines, Data Warehouses, Data Lakes und Datenqualität.
Kurz vorwegIn den meisten gescheiterten KI-Projekten liegt der Fehler in der Datenschicht. Datenarchitektur-Check starten
Data Engineering: Definition
Data Engineering bezeichnet alle Prozesse, mit denen Unternehmen Rohdaten in eine nutzbare Form bringen. Die Arbeit beginnt an den Quellsystemen - Datenbanken, SAP, ERP, Sensoren oder Dateien - und endet in den Systemen, die daraus Wert schöpfen: Reporting-Plattformen, Dashboards, Data-Science-Modelle und KI-Anwendungen.
Der typische Arbeitsablauf ist die Pipeline: Daten werden extrahiert (ETL) beziehungsweise direkt in ein Zielsystem geladen und dort transformiert (ELT), angereichert, bereinigt und für Analysezwecke strukturiert. Zwei Speicherkonzepte dominieren: das Data Warehouse für strukturierte Auswertungen und der Data Lake für Rohdaten - das Lakehouse verbindet beide.
- Zweck
- Rohdaten in verwertbare Datenprodukte verwandeln
- Kernaufgaben
- ETL-/ELT-Pipelines, Data Warehouses, Data Lakes, Datenqualität
- Kernidee
- Ohne saubere Daten keine belastbare KI
- Typische Tools
- Azure Data Factory, Databricks, Microsoft Fabric, Apache Airflow, dbt
Wie funktioniert Data Engineering?
Der Ablauf folgt dem Weg der Daten von der Quelle bis zum Datenprodukt:
- Quellen anbindenDatenbanken, SAP, ERP, Sensoren oder Dateien werden angebunden und extrahiert - inklusive der Frage, wer welche Daten sehen darf.
- Transformieren und bereinigenDaten werden angereichert, bereinigt und strukturiert. Datenqualitäts-Checks fangen Fehler, bevor sie Analysen oder Modelle verfälschen.
- BereitstellenDie fertigen Datenprodukte landen im Data Warehouse, Data Lake oder direkt in Dashboards, Reports und ML-Pipelines.
Warum ist Data Engineering die Basis für KI?
Modelle lernen aus den Daten, die die Pipelines liefern. Wer LLMs, RAG-Systeme oder KI-Agenten plant, muss zuerst die Dateninfrastruktur verstehen - schlechte Daten in, Halluzinationen raus. Die Datenqualität entscheidet über die KI-Qualität, nicht das Modell.
ETL oder ELT?
Die Reihenfolge der Schritte entscheidet, wo die Rechenlast liegt und wie flexibel die Plattform später ist.
| Kriterium | ELT | ETL |
|---|---|---|
| Transformation läuft | im Zielsystem, nach dem Laden | vor dem Laden, in einem eigenen Werkzeug |
| Rohdaten bleiben | erhalten und nachvollziehbar | meist nur transformiert erhalten |
| Neue Auswertung | auf den bestehenden Rohdaten möglich | erfordert oft eine neue Pipeline |
| Rechenlast | im Warehouse oder Lakehouse | auf einem separaten ETL-Server |
| Passt zu | Cloud-Plattformen mit elastischer Rechenleistung | festen Kapazitäten, strengen Vorabfiltern |
Was vor dem ersten KI-Projekt geklärt sein muss
Die meisten Verzögerungen entstehen nicht im Modell, sondern an diesen fünf Punkten.
- Quellsysteme benannt: welches System führt welche Wahrheit, und wer gibt den Zugriff frei
- Aktualität geklärt: reicht täglich, oder muss es minütlich sein
- Berechtigungen bekannt: wer darf welche Zeile sehen, bevor die Daten kopiert werden
- Datenqualität gemessen: Vollständigkeit und Dubletten geprüft, nicht angenommen
- Zielbild definiert: welches Datenprodukt am Ende steht, nicht nur welche Technik
In den meisten gescheiterten KI-Projekten liegt der Fehler in der Datenschicht, nicht im Modell. Die erste Frage ist nie „welches Modell“, sondern: Welche Quelle ist heute erreichbar, und wer darf welche Zeile sehen?
„Data Engineering ist dasselbe wie Data Science." Nein: Data Engineering stellt die Daten bereit, Data Science wertet sie aus und baut Modelle. Ohne saubere Dateninfrastruktur kann Data Science nicht produktiv arbeiten.
Häufige Fragen zu Data Engineering
Was macht ein Data Engineer?
Ein Data Engineer baut und betreibt die Pipelines, die Daten aus Quellsystemen in Speicher- und Analysesysteme bringen. Dazu gehören ETL-/ELT-Prozesse, Datenqualitäts-Checks und die Auswahl der passenden Plattform.
Braucht jedes Unternehmen ein Data Warehouse?
Nein. Kleine Teams starten oft mit einer aufgeräumten Datenbank oder einer Reporting-Plattform. Ein Data Warehouse oder Data Lake lohnt sich, sobald mehrere Quellsysteme, hohe Datenmengen oder KI-Anwendungen zusammenkommen.
Was ist der Unterschied zwischen ETL und ELT?
Bei ETL werden die Daten vor dem Laden transformiert, bei ELT direkt ins Zielsystem geladen und dort transformiert. ELT nutzt die Rechenleistung moderner Plattformen wie Databricks oder Fabric und ist bei großen Datenmengen schneller.
Ihre Daten sind die Basis Ihrer KI - wir prüfen in einem Gespräch, wo die Datenschicht steht und was sie braucht.
Datenarchitektur-Check starten
