Was ist ein Data Warehouse?
DatenschichtEin Data Warehouse ist ein stark strukturierter, aufbereiteter Datenbestand, der fest definierte Auswertungen und Reports unterstützt. Daten aus mehreren Quellsystemen werden per ETL bereinigt, in ein einheitliches Modell überführt und für Business Intelligence und KI bereitgestellt. Der Unterschied zum Data Lake: Ordnung statt Flexibilität.
Kurz vorwegDie Qualität der Auswertung steht und fällt mit der Ordnung der Datenschicht. Datenarchitektur-Check starten
Data Warehouse: Definition
Ein Data Warehouse (DWH) sammelt Daten aus verschiedenen Quellsystemen - ERP, CRM, Datenbanken, Dateien - und bereitet sie so auf, dass daraus belastbare Auswertungen entstehen. Die Daten werden in einem einheitlichen Modell gespeichert, meist in Stern- oder Schneeflockenschema, damit Reports und Dashboards schnell und reproduzierbar funktionieren. Der Zweck entscheidet: ein DWH beantwortet fest definierte Fragen, kein offenes Durchsuchen.
Der klassische Weg der Daten ins Data Warehouse ist ETL: extrahieren, transformieren, laden. Die Transformation passiert vor dem Laden, damit im Zielsystem nur bereinigte, konsistente Daten stehen. Moderne Plattformen wie Microsoft Fabric oder Databricks verschieben die Grenze Richtung Lakehouse, wo sich strukturierte Auswertung und flexibler Rohdatenspeicher in einer Umgebung verbinden.
Für KI-Projekte bleibt das Data Warehouse relevant, weil Modelle und Agenten verlässliche, aktuelle Daten brauchen - die Qualität der Auswertung steht und fällt mit der Ordnung der Datenschicht. Nicht jedes Team braucht ein DWH von Tag eins, aber sobald mehrere Quellsysteme oder KI-Anwendungen zusammenkommen, wird es zur tragenden Säule.
- Zweck
- Strukturierte Daten für fest definierte Auswertungen, Reports und Dashboards
- Kernidee
- Ordnung statt Flexibilität - ein Modell für bekannte Fragen
- Befüllung
- Klassisch per ETL: bereinigen und transformieren, bevor geladen wird
- Gegenstück
- Data Lake (Rohdaten, flexibel) - das Lakehouse verbindet beide
- Typische Plattformen
- Microsoft Fabric, Databricks, Azure SQL Data Warehouse, Snowflake
Wie funktioniert ein Data Warehouse?
Der Aufbau folgt dem Weg der Daten von der Quelle bis zur Auswertung:
- Quellen anbindenERP, CRM, Datenbanken und Dateien werden angebunden. Geklärt wird, welches System die Wahrheit führt und wer welche Daten sehen darf.
- Transformieren und bereinigenPer ETL werden Daten vereinheitlicht: Dubletten raus, Formate vereinheitlicht, Schlüssel zugeordnet, fehlende Werte behandelt. Hier entsteht die Datenqualität.
- In das Modell ladenDie aufbereiteten Daten landen in einem einheitlichen Schema, oft als Faktentabellen und Dimensionen, bereit für Reports und Analysen.
- AuswertenDashboards, Reports und KI-Anwendungen greifen auf konsistente Daten zu - jede Auswertung liefert dasselbe Ergebnis, unabhängig vom Fragesteller.
Data Warehouse oder Data Lake?
Beide speichern Daten, aber mit unterschiedlichem Zweck. Die Entscheidung ist keine Entweder-oder-Frage, sondern eine Frage des Anwendungsfalls.
| Kriterium | Data Lake | Data Warehouse |
|---|---|---|
| Datenformate | beliebig: JSON, Parquet, Bilder, Logs | strukturiert, in einem einheitlichen Schema |
| Zweck | flexible Exploration, Machine Learning, Rohdatenhaltung | feste Reports und wiederkehrende Auswertungen |
| Aufbereitung | erst bei der Nutzung (Schema-on-Read) | vor dem Laden (Schema-on-Write) |
| Datenqualität | hängt von der Nutzung ab, oft ungepflegt | sichergestellt durch ETL vor dem Laden |
| Passt zu | Experimenten und unbekannten Fragen | betrieblichen Reports mit definierten Fragen |
Wann lohnt sich ein Data Warehouse?
- mehrere Quellsysteme in einer Auswertung zusammenkommen müssen
- Reports reproduzierbar und auditierbar sein müssen
- Datenqualität garantiert sein soll, bevor Analysen oder KI starten
- einheitliche Kennzahlen für das ganze Unternehmen gefragt sind
- die Fragen noch unbekannt sind und flexibel erkundet wird
- Rohdaten für spätere Auswertungen erhalten bleiben sollen
- das Team klein ist und mit einer aufgeräumten Datenbank startet
- Machine Learning direkt auf den Rohdaten trainiert
Was das Data Warehouse mit KI zu tun hat
RAG-Systeme und KI-Agenten brauchen verlässliche, aktuelle Daten, um keine falschen Antworten zu liefern. Ein Data Warehouse liefert genau das: konsistente Fakten aus einem gepflegten Modell. Die Ordnung der Datenschicht entscheidet darüber, ob die KI belastbar antwortet - oder halluziniert.
Die häufigsten Data-Warehouse-Fehler
Die meisten DWH-Projekte scheitern nicht an der Technik, sondern an diesen Punkten:
- Ohne Zielbild starten: welche Reports und Kennzahlen am Ende stehen sollen, ist unklar, bevor das erste Modell entsteht
- Das Warehouse zum Lake machen: Rohdaten in ein starres Schema zu zwingen, macht beide Ansätze schlechter
- Qualität erst am Ende prüfen: Fehler in den Quelldaten pflanzen sich durch das ganze Modell fort
- Vergessen, wer die Wahrheit führt: ohne klare Quellensysteme entstehen zwei Versionen derselben Zahl
- Ohne Governance betreiben: Berechtigungen und Lineage fehlen, bis die Revision sie einfordert
Ein Data Warehouse ist kein Selbstzweck, sondern die Antwort auf definierte Auswertungen. Die erste Frage ist nie „welche Plattform“, sondern: Welche Reports brauchen wir wirklich, und welche Quelle liefert die Wahrheit? Wer das vor dem ersten Modell klärt, baut das DWH in Wochen statt in Quartalen.
„Data Warehouse ist ein alter Hut, heute braucht man einen Data Lake oder ein Lakehouse.“ Nein: Das DWH löst ein anderes Problem - verlässliche, einheitliche Auswertungen. Moderne Plattformen wie Fabric oder Databricks verschmelzen beides, aber die Ordnung bleibt der Kern des Data Warehouse.
Häufige Fragen zu Data Warehouse
Was ist der Unterschied zwischen Data Warehouse und Data Lake?
Ein Data Warehouse speichert strukturierte, aufbereitete Daten für fest definierte Auswertungen, ein Data Lake speichert Rohdaten in beliebigem Format für flexible Nutzung. Die Aufbereitung passiert im DWH vor dem Laden, im Data Lake erst bei der Nutzung.
Wann braucht ein Unternehmen ein Data Warehouse?
Sobald mehrere Quellsysteme in einheitlichen Reports zusammenkommen, Kennzahlen auditierbar sein müssen oder KI-Anwendungen verlässliche Daten brauchen. Kleine Teams starten oft mit einer aufgeräumten Datenbank und bauen später um.
Welche Plattformen werden für Data Warehouses genutzt?
Klassisch Azure SQL Data Warehouse und Snowflake, zunehmend die Lakehouse-Plattformen Microsoft Fabric und Databricks, die strukturierte Auswertung und flexiblen Rohdatenspeicher in einer Umgebung verbinden. Die Wahl ist eine Architektur-Entscheidung, die länger bindet als ein Modellwechsel.
Was ist der Unterschied zwischen einem Data Warehouse und einer normalen Datenbank?
Eine Betriebsdatenbank (etwa PostgreSQL oder MySQL) speichert den aktuellen Zustand eines Prozesses - Bestellungen, Kunden, Buchungen - und ist auf schnelle Einzelschreibvorgänge ausgelegt. Ein Data Warehouse dagegen sammelt Daten aus vielen Quellen, bereitet sie in einem einheitlichen Modell auf und ist auf große, historische Auswertungen optimiert. Dieselbe Firma nutzt beides: die Datenbank für den laufenden Betrieb, das Data Warehouse für Reports und Analysen über die Zeit.
Warum ist ein Data Warehouse für KI-Projekte relevant?
KI-Modelle und RAG-Systeme sind nur so gut wie die Daten, auf denen sie aufsetzen. Ein Data Warehouse liefert konsistente, gepflegte Fakten aus einem einheitlichen Modell - genau das, was Modelle brauchen, um belastbar zu antworten. Ohne geordnete Datenschicht steigt das Risiko, dass die KI mit widersprüchlichen oder veralteten Daten arbeitet und halluziniert.
Ihre Daten sind die Basis Ihrer KI - wir prüfen in einem Gespräch, wo Ihre Datenschicht steht und ob ein Data Warehouse oder eine andere Architektur für Sie richtig ist.
Datenarchitektur-Check starten
