Was ist ETL?

Datenschicht
Kurz beantwortet

ETL steht für Extract, Transform, Load: Daten aus Quellsystemen werden extrahiert, in einem Zwischenschritt bereinigt und umgewandelt und dann in ein Zielsystem geladen. ETL ist der klassische Weg, Daten für Data Warehouses, Analysen und KI-Projekte aufzubereiten.

Kurz vorwegDie Qualität der KI steht und fällt mit der Qualität der Datenschicht. Datenarchitektur-Check starten

ETL: Definition

ETL ist das Standardverfahren, um Daten aus verschiedenen Quellsystemen in ein zentrales Zielsystem zu überführen. Die drei Buchstaben stehen für Extract (Daten aus Quellen lesen), Transform (Daten bereinigen, umwandeln, anreichern) und Load (Daten ins Zielsystem schreiben). Das Zielsystem ist klassischerweise ein Data Warehouse, zunehmend auch ein Data Lake oder Lakehouse.

Der Kern von ETL ist die Reihenfolge: Die Transformation passiert vor dem Laden, in einem eigenen Zwischenschritt. Das unterscheidet ETL vom moderneren ELT, bei dem die Rohdaten direkt ins Zielsystem geladen und erst dort transformiert werden. Beide Ansätze lösen dasselbe Problem, aber an unterschiedlichen Stellen - und die Wahl hängt von der Plattform ab.

Für KI-Projekte ist ETL der unspektakuläre Teil, der über Erfolg entscheidet: Was die Pipeline liefert, ist die Grundlage, auf der Modelle lernen. Schlecht bereinigte Daten führen zu schlechten Ergebnissen, egal wie gut das Modell ist. Datenqualität entsteht hier, nicht in der Analyse.

Zweck
Daten aus Quellsystemen in ein zentrales Zielsystem überführen
Kernidee
Transformieren, bevor geladen wird
Reihenfolge
Extract, Transform, Load - die Transformation läuft vor dem Laden
Zielsysteme
Data Warehouse, Data Lake, Lakehouse, Analysesysteme
Typische Werkzeuge
Azure Data Factory, Apache Airflow, dbt, Talend, Informatica

Wie funktioniert ETL in der Praxis?

Jede ETL-Pipeline durchläuft dieselben drei Phasen, unabhängig vom Werkzeug:

  1. ExtractDie Daten werden aus den Quellsystemen gelesen - Datenbanken, SAP, ERP, Dateien oder APIs. Oft laufen hier schon erste Filter, damit nicht unnötig Daten bewegt werden.
  2. TransformDie Daten werden bereinigt, umgewandelt und angereichert: Dubletten raus, Formate vereinheitlicht, fehlende Werte behandelt, Schlüssel zugeordnet. Qualitäts-Checks fangen Fehler, bevor sie weiterwandern.
  3. LoadDie aufbereiteten Daten werden ins Zielsystem geschrieben - als Voll- oder inkrementeller Ladevorgang, je nachdem, ob sich nur Änderungen oder immer alles bewegt.

ETL oder ELT - wo ist der Unterschied?

Die Reihenfolge der Schritte entscheidet, wo die Rechenlast liegt und wie flexibel die Plattform später ist.

KriteriumELTETL
Transformation läuftim Zielsystem, nach dem Ladenvor dem Laden, in einem eigenen Werkzeug
Rohdaten bleibenerhalten und nachvollziehbarmeist nur transformiert erhalten
Neue Auswertungauf den bestehenden Rohdaten möglicherfordert oft eine neue Pipeline
Rechenlastim Warehouse oder Lakehouseauf einem separaten ETL-Server
Passt zuCloud-Plattformen mit elastischer Rechenleistungfesten Kapazitäten und strengen Vorabfiltern

Wann lohnt sich klassisches ETL?

ETL ist die bessere Wahl, wenn
  • die Daten vor dem Laden strikt bereinigt werden müssen, etwa wegen Compliance-Vorgaben
  • das Zielsystem keine oder wenig Rechenleistung für Transformationen mitbringt
  • nur die gefilterten, fertigen Daten das Zielsystem erreichen dürfen
ELT ist die bessere Wahl, wenn
  • die Plattform elastische Rechenleistung mitbringt, etwa Databricks oder Microsoft Fabric
  • Rohdaten für spätere, noch unbekannte Auswertungen erhalten bleiben sollen
  • die Datenmenge groß ist und die Transformation in der Cloud günstiger skaliert

Was ETL mit KI zu tun hat

Modelle lernen aus dem, was die Pipelines liefern. Wer ein RAG-System oder einen KI-Agenten plant, braucht zuerst saubere, strukturierte Daten - die Qualität der KI steht und fällt mit der Qualität der Datenschicht. Deshalb beginnt jedes KI-Projekt bei den Daten, nicht beim Modell.

Die fünf häufigsten ETL-Fehler

In der Praxis scheitern ETL-Projekte selten an der Technik, meist an diesen Punkten:

Häufige Fehler
  • Ohne Zielbild starten: welche Datenprodukte am Ende stehen sollen, ist unklar, bevor die erste Quelle angebunden wird
  • Quellen nicht geklärt: wer das führende System ist und wer Zugriff freigibt, steht erst nach dem ersten Deadlock fest
  • Qualität erst am Ende prüfen: Fehler in den Quelldaten pflanzen sich durch die ganze Pipeline fort
  • Vollabgleich statt inkrementell: jede Nacht werden alle Daten neu bewegt, bis die Laufzeit explodiert
  • Ohne Monitoring betreiben: eine stille, fehlgeschlagene Ladung fällt erst auf, wenn der Report falsch ist
In der Praxis

ETL ist kein Projekt, sondern Betrieb: Pipelines laufen nachts, brechen leise und müssen überwacht werden. Die erste Frage ist nie „welches Werkzeug“, sondern: Welche Quelle ist die Wahrheit, und wer darf welche Zeile sehen? Wer das klärt, bevor die erste Pipeline gebaut wird, spart sich die teuersten Nacharbeiten.

Häufiger Irrtum

„ETL ist veraltet, heute macht man ELT.“ Nein: Beide Ansätze lösen unterschiedliche Probleme. Wer aus Datenschutzgründen nur bereinigte Daten ins Zielsystem lassen darf, fährt mit ETL besser - auch in der Cloud. Die Plattform entscheidet, nicht der Hype.

Häufige Fragen zu ETL

Was ist der Unterschied zwischen ETL und ELT?

Bei ETL werden die Daten vor dem Laden transformiert, bei ELT direkt ins Zielsystem geladen und dort umgewandelt. ELT nutzt die Rechenleistung moderner Cloud-Plattformen und hält die Rohdaten vor, ETL liefert nur die fertig bereinigten Daten.

Welche Tools werden für ETL verwendet?

Klassische ETL-Werkzeuge sind Azure Data Factory, Apache Airflow, Talend und Informatica, für die Transformationsebene zunehmend dbt. Die Wahl hängt davon ab, wo die Quellen liegen und wohin die Daten fließen sollen.

Warum ist ETL wichtig für KI-Projekte?

Modelle lernen aus den Daten, die Pipelines liefern. Wenn die Datenschicht unzuverlässig ist, helfen weder bessere Modelle noch mehr Rechenleistung. ETL ist der Ort, an dem Datenqualität entsteht - und damit die Basis jeder belastbaren KI.

Wenn es konkret wird

Ihre Daten sind die Basis Ihrer KI - wir prüfen in einem Gespräch, wo Ihre Datenschicht steht und welche Pipeline sie braucht.

Datenarchitektur-Check starten
Phillip PhamPexon ConsultingStand 19.08.2026