Schritt-für-Schritt-Anleitung: Wie Sie ein RAG-System im Unternehmen konzipieren

Phillip Pham von Pexon Consulting | 14 Min. Lesezeit | 03.03.2026 TL;DR Retrieval Augmented Generation (RAG) verbindet Large Language Models mit Ihren Unternehmensdaten — das LLM greift vor jeder Antwort…

3 März. 2026 | AI

Inhaltsverzeichnis

Phillip Pham von Pexon Consulting | 14 Min. Lesezeit | 03.03.2026


TL;DR

Retrieval Augmented Generation (RAG) verbindet Large Language Models mit Ihren Unternehmensdaten — das LLM greift vor jeder Antwort auf Ihre Dokumente, Wikis und Datenbanken zu und liefert so faktenbasierte, halluzinationsarme Ergebnisse. Pexon Consulting, Microsoft Partner mit 80 Mitarbeitern in Deutschland, hat RAG-Systeme bei Unternehmen wie Liebherr und Mecklenburgische produktiv umgesetzt — DSGVO-konform auf Azure. Ein typisches RAG-Projekt amortisiert sich in 4-6 Monaten durch 60-70% schnellere Informationssuche.

Vorher Nachher
Informationssuche 45 Min. pro Anfrage (manuell) 15 Sekunden (RAG-Chatbot)
Antwortqualität Abhängig von Einzelwissen Faktenbasiert aus allen Quellen
Onboarding neuer MA 3-6 Monate bis produktiv 4-8 Wochen mit KI-Wissensassistent

RAG ist eine Schicht, nicht die ganze Plattform. Wie Wissenssuche, Modelle und Betrieb zusammenlaufen: Offene KI-Plattform →


RAG-System-Beratung: Pakete, Preise und Ergebnis

Was ein RAG-System kostet, hängt vom Reifegrad ab, den Sie brauchen. Drei Pakete, transparent kalkuliert:

Paket Für wen Investition Betrieb
POC / Machbarkeit Machbarkeit auf Ihren echten Daten, gemessene Trefferquote 15.000-20.000 EUR
Pilot / Produktiv Erster produktiver Use-Case inklusive Integration 30.000-60.000 EUR 500-2.000 EUR/Monat
Enterprise Mehrere Quellen, Governance, unternehmensweiter Rollout 60.000-120.000 EUR 500-2.000 EUR/Monat
Die Plattform gehört Ihnen. Code, Architektur und Daten bleiben in Ihrem Besitz, kein Vendor-Lock-in. Betrieb und Hosting laufen DSGVO-konform in der EU.

Referenzfall: Ein Maschinenbauer mit rund 800 Mitarbeitern senkte die Support-Anfragen um 67 %, die Informationssuche fiel von 45 Minuten auf 15 Sekunden.

Was Sie Ihrem Vorstand zeigen

  • Wirtschaftlichkeit: bis zu 7,8-facher ROI über drei Jahre, gemessen an Suchzeit und Support-Aufwand.
  • Eigentum: Plattform, Code und Daten bleiben im Haus, kein Anbieter-Lock-in.
  • Compliance: DSGVO-konform, Hosting und Betrieb ausschließlich in der EU.
  • Beleg: vergleichbarer Maschinenbauer, 67 % weniger Anfragen, Suchzeit von 45 Minuten auf 15 Sekunden.
  • Nächster Schritt: kostenloses KI-Assessment, danach ein Fixpreis-POC ohne Verpflichtung.

Das teure Problem

Ein Maschinenbauer mit 500 Mitarbeitern hat typischerweise 15.000-50.000 technische Dokumente: Wartungsanleitungen, Stücklisten, Normen, Kundenkorrespondenz, Projektdokumentationen. Diese liegen verteilt in SharePoint, Confluence, Netzlaufwerken und SAP — ohne semantische Suche.

Die Rechnung: 200 Techniker x 3 Stunden/Woche Dokumentensuche x 75 EUR/Stunde = 2.340.000 EUR verlorene Produktivität pro Jahr

Laut MIT und RAND Corporation scheitern 70-85% aller KI-Initiativen an den erwarteten Ergebnissen. Der häufigste Grund: Das LLM wurde ohne Anbindung an die tatsächlichen Unternehmensdaten eingesetzt und halluziniert.

Die versteckten Kosten schlechter Wissenssuche

Kostenfaktor Typischer Ist-Zustand Mit RAG-System
Dokumentensuche 3 h/Woche pro Techniker 20 Min./Woche
Halluzinationsrate 15-25% bei reinem ChatGPT 2-5% mit RAG + Quellenangabe
Wissensabfluss Kritisch bei Personalwechsel Wissen dauerhaft indexiert
Onboarding 3-6 Monate 4-8 Wochen

Warum klassische Lösungsansätze scheitern

Ansatz Warum er nicht funktioniert
„Wir nutzen ChatGPT direkt“ Halluziniert bei firmenspezifischem Wissen, keine Quellenangabe, DSGVO-Risiko
„Wir bauen eine bessere SharePoint-Suche“ Keyword-basiert, findet keine semantisch verwandten Dokumente
„Wir machen Fine-Tuning unseres LLMs“ Teuer (50.000-200.000 EUR), veraltet sofort wenn sich Dokumente ändern

RAG löst genau diese Probleme: Das LLM bleibt aktuell, weil es bei jeder Anfrage live auf Ihre Dokumente zugreift — kein erneutes Training nötig. Und die Quellenangabe pro Antwort macht Halluzinationen sofort erkennbar.


Die Lösung: RAG als Enterprise-Wissensplattform

Ein RAG-System besteht aus drei Kernkomponenten: einer Indexierung-Pipeline (Ihre Dokumente werden in Vektoren umgewandelt), einer Retrieval-Schicht (die relevantesten Dokumentenabschnitte werden gefunden) und einem LLM (das aus den gefundenen Abschnitten eine Antwort generiert).

┌─────────────┐ ┌──────────────┐ ┌─────────────┐ │ Dokumente │────>│ Chunking + │────>│ Vektor-DB │ │ (SharePoint│ │ Embedding │ │ (Vespa / │ │ Confluence│ │ (Azure │ │ AI Search)│ │ SAP, PDF) │ │ OpenAI) │ │ │ └─────────────┘ └──────────────┘ └──────┬──────┘ │ ┌─────────────┐ ┌──────────────┐ │ │ Antwort │<────│ LLM │<───────────┘ │ + Quellen │ │ (GPT-4o / │ Top-K relevante │ │ │ Claude) │ Chunks + Kontext └─────────────┘ └──────────────┘

Warum jetzt der richtige Zeitpunkt ist

  1. Technologisch: Embedding-APIs kosten 95% weniger als vor 2 Jahren. Vektordatenbanken laufen stabil auf Standard-Cloud-Instanzen ab 50 EUR/Monat.
  2. Regulatorisch: Der EU AI Act (2024-2027) verlangt nachvollziehbare KI-Entscheidungen mit Quellennachweis — genau das liefert RAG.
  3. Wirtschaftlich: Gartner prognostiziert, dass bis 2026 40% aller Enterprise-Anwendungen KI-Agenten enthalten werden (2025: unter 5%). RAG ist die Grundlage für diese Agenten.

ROI-Rechnung (Beispiel: 300 Mitarbeiter, Maschinenbau)

Kategorie Vorher Nachher Einsparung
Dokumentensuche 600 h/Monat (200 MA x 3h) 65 h/Monat -89%
Support-Anfragen intern 400/Monat 120/Monat -70%
Onboarding-Zeit 5 Monate 6 Wochen -70%
Wissensabfluss bei Kündigung Kritisch Minimal (indexiert)

Projektkosten (typisch): 60.000-120.000 EUR (Assessment, Aufbau, Pilotphase, Rollout) Break-Even: Nach 4-6 Monaten 3-Jahres-ROI: 180.000 EUR Investition vs. 1.400.000 EUR Einsparung = Faktor 7,8x Weltweit werden 2026 rund 2,5 Billionen USD für KI ausgegeben (Gartner, Januar 2026). Unternehmen, die jetzt kein RAG implementieren, verlieren den Anschluss an Wettbewerber, die ihre technische Dokumentation bereits durchsuchbar gemacht haben.

Die Einsparung steht auf dem Papier.

Ob Ihre Quellen, Rechte und Trefferquote das tragen, zeigt erst ein System auf echten Daten. Nicht eine zweite Modellrechnung.

Enterprise-RAG ansehen


Die Rechnung geht allerdings erst auf, wenn aus dem RAG-Backend eine Oberfläche wird, die Mitarbeiter täglich nutzen. Wer diesen Schritt nicht selbst bauen will, kann bei Pexon einen KI-Chatbot für Unternehmen entwickeln lassen, inklusive Rechteprüfung, Quellenanzeige und Anbindung an SharePoint oder Confluence.

Technische Umsetzung: RAG-System Schritt für Schritt

Schritt 1: Datenquellen anbinden

Identifizieren Sie alle Wissensquellen, die Ihr RAG-System durchsuchen soll:

Quelle Typische Dokumente Connector
SharePoint Anleitungen, Policies, Wikis Microsoft Graph API
Confluence Technische Doku, Runbooks Confluence REST API
SAP Stammdaten, Materialinfos SAP OData / RFC
Netzlaufwerke PDFs, CAD-Zeichnungen Azure Blob Storage
E-Mail Kundenkommunikation Exchange API

Schritt 2: Chunking-Strategie wählen

Die Qualität Ihres RAG-Systems steht und fällt mit dem Chunking — dem Aufteilen großer Dokumente in suchbare Abschnitte.

Strategie Chunk-Größe Wann verwenden
Fixed-Size 512-1024 Tokens Einfache FAQ-Dokumente
Semantic Chunking Variabel (nach Thema) Technische Dokumentation, Normen
Recursive 256-512 Tokens mit Overlap Verträge, juristische Texte
Parent-Child Kleine Chunks + Eltern-Kontext Komplexe Handbücher mit Querverweisen

Pexon Consulting empfiehlt für Fertigungsunternehmen: Semantic Chunking mit 512-Token-Zielgröße und 20% Overlap. Damit werden Wartungsanleitungen und Stücklisten korrekt segmentiert, ohne Kontext zu verlieren. Mehr zu Chunking-Strategien: Chunking Best Practices für RAG-Systeme

Schritt 3: Vektordatenbank auswählen

Die Vektordatenbank speichert die Embeddings Ihrer Dokumente und ermöglicht die semantische Suche.

Datenbank Stärke Kosten (ab) Pexon-Empfehlung
Azure AI Search Native Azure-Integration, Hybrid Search 250 EUR/Monat (S1) Standard für Azure-Kunden
Vespa Open Source, Streaming Search, Skalierbar 0 EUR (Self-Hosted) Für On-Premise und hohe Volumina
Pinecone Managed, einfaches Setup 70 EUR/Monat Prototyping und kleine Teams
Weaviate Hybrid Search, deutsches Hosting 25 EUR/Monat (Cloud) DSGVO-Vorteil durch EU-Hosting

Detaillierter Vergleich: Vespa als Enterprise-Vektordatenbank

Schritt 4: Retrieval-Pipeline konfigurieren

# Beispiel: Hybrid Search mit Azure AI Search
from azure.search.documents import SearchClient
from azure.search.documents.models import VectorizableTextQuery

search_client = SearchClient(
    endpoint="https://ihr-search.search.windows.net",
    index_name="unternehmenswissen",
    credential=credential
)

# Hybrid: Vektor + Keyword-Suche kombiniert
results = search_client.search(
    search_text="Wartungsintervall Hydraulikpumpe Typ H200",
    vector_queries=[
        VectorizableTextQuery(
            text="Wartungsintervall Hydraulikpumpe Typ H200",
            k_nearest_neighbors=5,
            fields="content_vector"
        )
    ],
    select=["content", "source", "page_number"],
    top=5
)

Schritt 5: LLM-Antwortgenerierung mit Quellenangabe

from openai import AzureOpenAI

client = AzureOpenAI(
    azure_endpoint="https://ihr-endpoint.openai.azure.com/",
    api_version="2024-10-21"
)

# Kontext aus Retrieval-Ergebnissen zusammenbauen
context = "nn".join([
    f"[Quelle: {r['source']}, S.{r['page_number']}]n{r['content']}"
    for r in results
])

response = client.chat.completions.create(
    model="gpt-4o",
    messages=[
        {"role": "system", "content": (
            "Du bist ein technischer Assistent. "
            "Beantworte Fragen NUR basierend auf dem Kontext. "
            "Gib IMMER die Quelle an. "
            "Sage 'Dazu habe ich keine Information' wenn der Kontext "
            "keine Antwort enthält."
        )},
        {"role": "user", "content": (
            f"Kontext:n{context}nn"
            f"Frage: Wie oft muss die Hydraulikpumpe H200 gewartet werden?"
        )}
    ]
)

Security-Anforderungen für Enterprise RAG

Anforderung Umsetzung Pexon-Standard
DSGVO Art. 32 Alle Daten in EU, kein Transfer an US-Provider Azure West Europe, Private Endpoints
Zugriffssteuerung Dokument-Level Permissions aus SharePoint übernehmen Azure AD + Document ACLs
Audit-Trail Alle Fragen + Antworten + Quellen loggen Azure Monitor + CosmosDB
Halluzinations-Schutz Prompt Engineering + Confidence Score + Quellennachweis KI-Qualitätssicherung
EU AI Act Risikoklassifizierung, technische Dokumentation ISO/IEC 42001 Alignment

Praxis: Maschinenbauer mit 800 Mitarbeitern

Ausgangslage:

  • 35.000 technische Dokumente in SharePoint, SAP und auf Netzlaufwerken
  • 250 Service-Techniker im Außendienst ohne schnellen Zugriff auf aktuelle Wartungsanleitungen
  • 40 Stunden pro Woche Rückfragen an die zentrale Technik-Hotline
  • Kritisches Wissensabfluss-Risiko: 12 erfahrene Ingenieure gehen in 3 Jahren in Rente

Umsetzung in 6 Wochen:

Woche Phase Ergebnis
1-2 Assessment: Datenquellen kartieren, Chunking-Strategie Architektur-Blueprint, 3 priorisierte Use Cases
3-4 Pilot: 5.000 Dokumente indexieren, Chatbot für Technik-Team Funktionierender RAG-Chatbot mit Quellenangabe
5-6 Rollout: Alle Quellen anbinden, Mobile App für Außendienst Produktivsystem, 250 Techniker mit Zugriff

Ergebnis nach 3 Monaten:

  • 67% weniger Anfragen an die Technik-Hotline (von 160/Woche auf 53)
  • 12 Minuten statt 45 Minuten durchschnittliche Suchzeit pro Anfrage
  • 94% Nutzerzufriedenheit bei Service-Technikern (vorher: 38% mit SharePoint-Suche)
  • 480.000 EUR geschätzte Jahreseinsparung durch reduzierte Suchzeiten und weniger Hotline-Aufwand

Häufig gestellte Fragen

Was kostet ein RAG-System für ein mittelständisches Unternehmen? Ein typisches RAG-Projekt bei Pexon Consulting kostet 60.000-120.000 EUR für Assessment, Aufbau und Pilotphase (6 Wochen). Die laufenden Infrastrukturkosten liegen bei 500-2.000 EUR/Monat (Azure AI Search + Compute + LLM-API). Für einen schnellen Einstieg bietet Pexon einen 2-Stunden-Workshop ab 2.500 EUR an. Der Break-Even liegt typischerweise bei 4-6 Monaten — danach spart das System mehr als es kostet. RAG vs. Fine-Tuning — was ist besser für Unternehmenswissen? RAG ist in 90% der Fälle die bessere Wahl für Unternehmenswissen. Fine-Tuning kostet 50.000-200.000 EUR, muss bei jeder Dokumentenänderung wiederholt werden und bietet keine Quellenangabe. RAG greift bei jeder Anfrage live auf aktuelle Dokumente zu, kostet einen Bruchteil und zeigt die Quelle jeder Antwort. Fine-Tuning ist nur sinnvoll, wenn das LLM einen bestimmten Schreibstil oder eine Fachsprache lernen soll — nicht für Wissensabfragen. Welche Vektordatenbank eignet sich für deutsche Unternehmen? Für Azure-Kunden empfiehlt Pexon Consulting Azure AI Search (ab 250 EUR/Monat) — native Integration, Hybrid Search und EU-Hosting. Für höhere Volumina oder On-Premise-Anforderungen setzen wir Vespa ein (Open Source, Self-Hosted). Weaviate bietet EU-Hosting ab 25 EUR/Monat und eignet sich für Prototypen. Entscheidend ist: Die Datenbank muss in der EU gehostet sein und Hybrid Search (Vektor + Keyword) unterstützen — reine Vektorsuche verpasst exakte Begriffe wie Artikelnummern oder Normen. Ist ein RAG-System DSGVO-konform betreibbar? Ja, wenn alle Komponenten in der EU gehostet werden. Pexon Consulting deployt RAG standardmäßig auf Azure West Europe: Azure AI Search (EU), Azure OpenAI (EU Data Zone, seit 2024 verfügbar) und Private Endpoints für alle Verbindungen. Personenbezogene Daten in Dokumenten werden über Document ACLs (Zugriffsberechtigungen aus SharePoint) geschützt — ein Nutzer sieht nur Antworten aus Dokumenten, auf die er auch direkt Zugriff hat. Das System ist ISO 27001 und SOC-2 konform. Wie lange dauert die Implementierung eines RAG-Systems? Ein funktionierender Prototyp mit 5.000-10.000 Dokumenten steht typischerweise nach 2-3 Wochen. Der produktive Rollout mit allen Datenquellen, Zugriffssteuerung und Mobile App dauert 4-6 Wochen. Die größte Zeitinvestition ist nicht die Technik, sondern das Daten-Assessment: Welche Quellen enthalten das wertvollste Wissen? Wie sind die Zugriffsrechte strukturiert? Bei Pexon-Projekten investieren wir 30% der Zeit in diese Vorarbeit — das zahlt sich in der Antwortqualität aus.


Ihr nächster Schritt

Enterprise-RAG

Eine Datenquelle zuerst. Dann das System, das Sie abnehmen.

Ein Proof of Concept auf einer Ihrer Quellen zeigt, ob Retrieval unter echten Rechten trägt. Danach die Implementierung mit festem Rahmen, ohne eine Lawine aus Tagessätzen.

PoC einer Datenquelle ab 25.000 EURImplementierung 60.000 bis 120.000 EUR. Infrastruktur 500 bis 2.000 EUR im Monat.

Enterprise-RAG ansehen

Sie wollen die ganze Plattform, nicht nur die Wissenssuche? Dann ist die Offene KI-Plattform der bessere Einstieg.


Verwandte Themen

Microsoft Fabric. Bilder Blogtemplate Whitepaper

Claude Code im Unternehmen

  • Praxis-Guide für IT-Leiter – mit konkreten Einblicken zu Kosten, Sicherheit und Rollout von Claude Code im Unternehmen.

Beratungsgespräch

Sichern Sie sich Ihre kostenfreie Erstberatung

Analyse Ihres individuellen Cloud- oder KI-Bedarfs
Erste Empfehlungen zu Umsetzungsstrategien
Transparente Einblicke in unsere Methoden, Technologien & Referenzen