Private AI & Sovereign LLM-Plattform

Souveräne KI & Private AI für Unternehmen: ChatGPT-Leistung ohne Datenabfluss, DSGVO-konform in Ihrer Infrastruktur

Wir bauen Open-Source-LLM-Plattformen mit Llama 4, Mistral Small 3.1 und Qwen 2.5 auf STACKIT, Hetzner oder Azure Germany — vLLM für Inferenz, Open WebUI mit SSO, LiteLLM-Gateway und RAG. Kein US-CLOUD-Act-Zugriff, keine OpenAI-API-Lock-in, volle Modell-Kontrolle. DSGVO, BaFin, EU AI Act und BSI C5 in der Architektur, nicht als Audit-Nachtrag.

Enterprise-Kunden im Pexon Private-AI-Portfolio

5.000+
aktive Nutzer bei Deutz
30 Min.
POC-Setup Ollama
ISO 27001
zertifiziert
0 US-Cloud
kein CLOUD-Act-Zugriff
Unsere Private-AI-Lösungen

Private AI von POC bis Managed Service

Produktive Open-Source-LLM-Bausteine für Enterprise: Plattform, Governance, Infrastruktur und Managed Betrieb — DSGVO-, BaFin- und EU-AI-Act-konform. Neu: Private AI vs Azure OpenAI vs ChatGPT Enterprise im Vergleich - die drei Betriebsvarianten nebeneinander, mit Entscheidungsregel für Konstruktionsdaten.

Der Baustein, an dem sich Modellwechsel, Kostentransparenz und Zugriffskontrolle entscheiden, ist das Gateway. Wie dieser Layer aufgebaut und betrieben wird, zeigt die LiteLLM-Beratung mit Routing, Budgets und Key-Management. Die Kategorie darüber, Setup, Betrieb und Ownership, ist die Open-Source-KI-Plattform.

Private-AI-Plattform Enterprise

Vollständiges Setup mit Open WebUI, vLLM, LiteLLM-Gateway, SSO über Azure AD oder Keycloak, RBAC und Audit-Trail über LangFuse.

Ollama & vLLM Konfiguration

Ollama für Developer-POC, vLLM für produktive Skala — 19× höherer Throughput (Red Hat Benchmark). Llama 4, Mistral Small 3.1, Qwen 2.5-72B.

Sovereign Hosting: STACKIT, Hetzner, Delos

BSI-C5-zertifiziert auf STACKIT oder Delos Cloud, günstigste GPU-Kosten bei Hetzner Dedicated ab rund 2.500 €/Monat H100. Keine Hyperscaler-Lock-in.

Datensouveränität & DSGVO

Art. 25 Privacy by Design, Art. 32 TOM-Compliance, Schrems-II-Lösung. PII-Maskierung, Customer-Managed-Keys, keine Third-Party-Processor.

BaFin- & DORA-konformes Private AI

Für Banken, Versicherer und Finanzdienstleister: ICT-Risk-Mgmt, Incident-Reporting 4 h/72 h/1 M, Auslagerungs-Register. DORA seit 17.01.2025.

KI-Governance mit SSO & RBAC

Modell-Inventar, Prompt-Injection-Defense, HITL-Gates für EU AI Act Art. 14. Azure AD oder Keycloak Integration, Audit-Log via LangFuse.

Private AI für Engineering & CAD/PLM

IP-Schutz für Konstruktionsdaten, Teamcenter/Windchill/3DEXPERIENCE-Integration. Deutz-Pattern: 5.000+ aktive Nutzer im Motorenbau.

Managed Private AI (SLA)

24/7 Betrieb, Modell-Updates, Security-Patches, Performance-Tuning. Ab 4.000 €/Monat — günstiger als Inhouse-Team aufzubauen.

Fallback & Ausfallsicherheit

Multi-Model-Routing via LiteLLM, hybride Cloud-Architektur, automatischer Failover zwischen Azure OpenAI und On-Prem bei Lastspitzen.

Monitoring & Compliance-Reporting

LangFuse self-hosted für DORA-konformes Modell-Monitoring, Prompt-Audit, Kosten-Tracking, DSFA-Nachweise für Datenschutzaufsicht.

Air-Gapped Deployment

Für KRITIS, Behörden und Pharma: vollständig offline betriebene LLM-Plattform mit manueller Modell-Update-Kette und signiertem Release-Prozess.

Private AI TCO-Rechner

Azure OpenAI vs. vLLM on-prem — Kostenvergleich über 36 Monate mit Ihrer Nutzer- und Token-Zahl. Break-Even-Kalkulation für Ihren Use Case.

Was ist Private AI?

Private AI bezeichnet Large Language Models (Llama 4, Mistral Small 3.1, Qwen 2.5), die auf eigener GPU-Hardware oder souveräner EU-Cloud (STACKIT, Hetzner, Delos) laufen — Daten verlassen nie die Unternehmensgrenze, kein OpenAI-API-Call, kein US-CLOUD-Act-Zugriff, DSGVO-konform by design. Pexon Consulting (München, 80 Engineers, ISO 27001) baut Private-AI-Plattformen für regulierte DACH-Unternehmen. Referenzen: Deutz (5.000+ aktive Nutzer), Liebherr, Schaeffler, Reinhausen, Allianz, DEVK.

Kern-Services: Plattform-Setup · Ollama & vLLM · STACKIT/Hetzner · SSO + RBAC · Managed Betrieb.

Greifbar wird eine Private-AI-Plattform für die Fachbereiche meist erst über eine Oberfläche, die auf den eigenen Dokumenten antwortet. Dafür bauen wir einen KI-Chatbot auf den eigenen Unternehmensdaten, DSGVO-konform betrieben, mit Rechteprüfung und Quellenangabe je Antwort.

Compliance
DSGVO (Art. 25/32/35) · EU AI Act (GPAI aktiv seit 02.08.2025, Annex III ab 02.08.2026, Annex I ab 02.08.2027) · BaFin & DORA (seit 17.01.2025) · NIS-2 UmsuCG · BSI C5 · ISO 27001 & 42001
Tech-Stack 2026
Llama 4 Scout/Maverick · Mistral Small 3.1 (Apache 2.0) · Qwen 2.5-72B · vLLM · SGLang · Ollama (POC) · LiteLLM · Open WebUI · Qdrant · Weaviate · LangFuse
Hosting-Optionen
STACKIT (BSI C5, Sovereign) · Hetzner Dedicated · Delos Cloud · Azure Germany mit Private Endpoint · On-Prem GPU-Cluster (H100/H200) · Air-Gapped
Marktdruck

Cloud-AI-Lock-in, Datenschutz-Bußgelder, DORA und EU AI Act — 2026 ist der Kipp-Punkt.

KI-Adoption Deutschland 2026
41 %

der deutschen Unternehmen setzen KI aktiv ein — Verdopplung vs. 17 % im Vorjahr (Bitkom KI-Studie 2026).

OpenAI-DSGVO-Strafe
15 Mio. €

Garante-Bußgeld gegen OpenAI wegen Datenpanne & fehlender Rechtsgrundlage (Garante Dezember 2024).

Mitarbeiter-Daten-Leaks
46 %

der Privacy-Profis geben zu: Mitarbeiter laden sensible Daten in GenAI-Tools (Cisco 2026 Data Privacy Benchmark).

EU AI Act Bußgelder
bis 35 Mio. €

oder 7 % Weltjahresumsatz bei Verstoß gegen High-Risk-KI-Pflichten (EU AI Act Portal).

Für regulierte Unternehmen ist das kein Trend, sondern Compliance-Druck mit konkreten Kosten. Microsoft hat 2025 vor dem französischen Senat bestätigt: US-CLOUD-Act-Zugriff auf Azure-Daten kann nicht ausgeschlossen werden, auch mit EU Data Boundary. GPAI-Pflichten gelten bereits seit 02.08.2025, nicht erst 2026 — wer Llama 4 oder Mistral fine-tuned, wird selbst GPAI-Provider mit Transparenz- und Risk-Management-Pflichten (Art. 53 ff.).

Was Pexon anders macht

Wir bauen echtes Private AI — kein Cloud-Rebranding. Open-Source-LLMs auf eigener Hardware oder souveräner EU-Cloud. Klar abgegrenzt:

True Private AI: On-Prem + STACKIT + Delos Sovereign Cloud: Azure Germany mit Private Endpoint Hybrid: vLLM + Azure OpenAI via LiteLLM-Gateway Air-Gapped für KRITIS & Pharma
17.01.2025 in Kraft

DORA für Finanzsektor

ICT-Risk-Mgmt, Auslagerungs-Register, Incident-Reporting 4 h/72 h/1 Monat. Strafe bis 2 % Weltjahresumsatz. Private-AI-Anbieter als Drittanbieter zu registrieren.

02.08.2025 AKTIV

EU AI Act GPAI-Pflichten

General-Purpose-AI-Regeln gelten bereits: Transparenz, technische Dokumentation, Urheberrechts-Policy. Auch für fine-getunte Llama/Mistral-Modelle.

02.08.2026 voll wirksam

EU AI Act Annex III (High-Risk)

Standalone High-Risk-Systeme: HR-Screening, Credit-Scoring, Law-Enforcement. Art. 9–15 Risk-Mgmt, HITL, Audit-Trail. Strafe bis 35 Mio. € / 7 % Umsatz.

02.08.2027

EU AI Act Annex I

KI-Systeme als Sicherheitsbauteile in regulierten Produkten (Medizin, Maschinen, Autos). Konformitätsbewertung als Teil der Produktzulassung.

Scharf — aktiv durchsetzbar
Aktuell
Bevorstehend
In Planung
Was Pexon bei Private AI anders macht

Vier Pillars unserer Private-AI-Beratung

Wir sind kein klassisches Beratungshaus mit Powerpoint. Wir sind Engineers, die Private-AI-Plattformen bauen, ausrollen, betreiben — bis zur Übergabe oder als Managed Service.

Sovereign Open-Source-Stack

Llama 4 Scout/Maverick, Mistral Small 3.1 (Apache 2.0), Qwen 2.5-72B — auf STACKIT (BSI C5), Hetzner Dedicated oder On-Prem-GPU. Keine OpenAI-Lock-in, keine US-CLOUD-Act-Risiken. Break-Even gegenüber Azure OpenAI in 8–14 Monaten.

DSGVO + EU AI Act by Design

Art. 25 Privacy by Design, Art. 32 TOM, Art. 35 DSFA — für Banken DORA (seit 17.01.2025), für Versicherer VAIT/DORA, für KRITIS NIS-2 UmsuCG. GPAI-Pflichten des EU AI Act gelten bereits seit 02.08.2025.

Kosten-Kontrolle statt Token-Überraschung

Self-Hosted LLM amortisiert sich bei 2–3 Mio. Tokens/Tag (Consumer-GPU) oder 10–30 Mio. Tokens/Tag (Enterprise) gegenüber OpenAI-API. H100-Preise seit Q4/2025 um 40 % gestiegen — eigene Hardware amortisiert sich schneller als gedacht.

Performance für Enterprise-Skala

vLLM liefert 793 Tokens/s (Peak) vs. 41 Tokens/s bei Ollama — Faktor 19 bei 128 parallelen Usern, P99-Latenz unter 100 ms. Deutz-Pattern: 5.000+ aktive Nutzer modular auf vLLM-Cluster skaliert.

Pexon-Stack für Private AI

Wie die Pexon-Private-AI-Plattform aussieht

Vier Layer von oben nach unten — Applications, Models + Inference, Platform, Sovereign Infrastructure. Produktionsreife, DSGVO-konforme Referenzarchitektur. Jeder Layer einzeln pilotierbar.

04Applications
Private Chatbot (Open WebUI) · RAG über SharePoint/Confluence/Wiki · Document Intelligence · Agentic Workflows · Multimodal Q&A · Voice-Bots · Servicetechniker-Assistent · Code-Assistent
03Models & Inference
Llama 4 Scout & Maverick (MoE) · Mistral Small 3.1 24B (Apache 2.0) · Qwen 2.5-72B · Qwen 2.5-VL · vLLM (Produktion, 793 Tok/s) · SGLang · TensorRT-LLM · Ollama (POC/Developer)
02Platform & Gateway
LiteLLM Gateway (Multi-Model-Routing) · LangFuse self-hosted (Audit-Trail & Observability) · Qdrant / Weaviate (Vector DB) · Azure AD / Keycloak (SSO) · RBAC · Prompt-Injection-Defense · HITL-Gates
01Sovereign Infrastructure
STACKIT (BSI C5, Schwarz-Gruppe) · Delos Cloud (SAP/Microsoft/Arvato JV) · Hetzner Dedicated · Azure Germany mit Private Endpoint · AWS eu-central-1 · On-Prem GPU (H100/H200/B200) · Air-Gapped für KRITIS

Praxiswissen Private AI

Vergleiche, Leitfäden und Tools für Private-AI-Entscheider — aus echten Kundenprojekten bei Liebherr, Deutz, Reinhausen, Schaeffler und Allianz.

Wer heute OpenAI- oder ChatGPT-Enterprise im deutschen Mittelstand einführt, zahlt zweimal: einmal für die Lizenzen, einmal in der Compliance-Diskussion mit Datenschutz, Betriebsrat und Aufsicht. Private AI mit Llama oder Mistral auf STACKIT oder Hetzner ist nicht billiger, aber es stellt keine dieser Fragen — weil Daten die Unternehmensgrenze nie verlassen.

Phillip Pham, Geschäftsführer Pexon Consulting Private-AI-Praxis aus 30+ DACH-Projekten · München
13
Private-AI-Landing-Pages
5.000+
Nutzer Deutz-Plattform
725+
inbound Backlinks
80
Engineers in DE
Wie wir Private AI umsetzen

5 Phasen vom POC in 30 Minuten zum Managed Service

Jede Phase mit klarem Output, Festpreis-Pilot, dokumentierter Übergabe. Kein Berater-Abo, keine Tagessatz-Lawine.

1

Assessment & Use-Case-Auswahl

Workshop zur Use-Case-Priorisierung, Hosting-Entscheidung (STACKIT vs. Hetzner vs. Azure Germany), Compliance-Mapping (DORA, AI Act).

1–2 Wochen
2

Architektur & Modell-Auswahl

Zielbild mit Llama 4, Mistral Small 3.1 oder Qwen 2.5, GPU-Dimensionierung (H100/H200), Gateway- und SSO-Design.

1 Woche
3

POC / Pilot

30-Min-Prototyp (Ollama + Open WebUI) oder 6-Wochen-Pilot mit vLLM, RAG, LangFuse auf echten Daten. Festpreis, Go/No-Go mit Metriken.

30 Min – 6 Wo
4

Production Rollout

Produktivnahme mit RBAC, SSO, Audit-Trail und Monitoring. Deutz-Pattern: modular auf vLLM-Cluster bis 5.000+ aktive Nutzer skaliert.

2–12 Monate
5

Managed Betrieb (SLA)

24/7-Betrieb, Modell-Updates, Security-Patches, Compliance-Updates (GPAI, AI Act). Ab 4.000 €/Monat.

dauerhaft optional
Private-AI-Case-Studies

Drei Private-AI-Projekte aus dem DACH-Mittelstand

Realisierte Pexon-Projekte — mit konkreten Zahlen, Tech-Stack und Outcome.

Deutz · Skalierbare Private-AI-Plattform

Generative KI für 5.000+ aktive Nutzer im Motorenbau

5.000+
aktive Nutzer
−30 %
Reaktionszeiten

LLM-Chatbot mit OCR/NLP, rollenbasierte Tool-Integration, KI-Agenten für HR, IT und Qualitätssicherung. 8+ Use Cases, modulare vLLM-Architektur über Fachbereiche skaliert. Hybrid aus Azure OpenAI und on-prem Inference.

Vollständige Case Study →
Liebherr · Private AI mit SSO & RBAC

Private-AI-Chatbot mit persönlichem Datenzugriff

SSO
+ RBAC Entra ID
IP-sicher
on-prem LLM

Private-AI-Chatbot mit SSO und rollenbasiertem Zugriff auf Outlook, OneDrive und Teams. Isolierte Verarbeitung für Engineering-Wissen und CAD-nahe Inhalte — KI im Alltag genutzt, nicht nur Pilot. AD/Entra-Integration out-of-the-box.

Mehr Private-AI-Cases →
Reinhausen · RAG-Chatbot technischer Support

Support-RAG für 1.000+ MA Energietechnik

−30 %
Reaktionszeit Support
Azure
Private Endpoint + RBAC

RAG-Chatbot über SharePoint, Confluence, Wiki und Dateiablagen mit Azure OpenAI via Private Endpoint, Customer-Managed-Keys. Produktsuche integriert, kontinuierliche Datenpflege. Entlastung des First-Level-Supports bei Transformatoren.

Mehr Private-AI-Cases →

Weitere Private-AI-Referenzen aus DACH-Kundenprojekten

Liebherr · Deutz · Schaeffler · Reinhausen · Allianz · DEVK · HDI · Münchener Rück · AOK · BSH · Sennheiser · Bitzer · Dr. Wolff · Gerresheimer · Infineon · Fischer Panda

Regulatorik-Mapping Private AI

DSGVO · EU AI Act · DORA · NIS-2 · BSI C5 · ISO 42001

Sechs Regulierungen, sechs Stichtage, sechs Pexon-Lösungspfade. Was muss Ihr Unternehmen wann tun, was kostet ein Verstoß bei KI-Einsatz.

RegulierungStichtagWas muss ein Private-AI-Betreiber tun?StrafePexon-Lösung
EU AI Act GPAI 02.08.2025 AKTIV Fine-tuning von Llama/Mistral → Sie werden selbst GPAI-Provider: technische Dokumentation, Urheberrechts-Policy, Training-Data-Summary, Transparenz bis 15 Mio. € oder 3 % Umsatz GPAI-Compliance-Paket, Modell-Karte, Data-Lineage
EU AI Act Annex III 02.08.2026 (standalone High-Risk) HR-Screening, Credit-Scoring, Law-Enforcement mit KI: Art. 9–15 Risk-Management, HITL, Audit-Trail, Robustness, technische Dokumentation bis 35 Mio. € oder 7 % globaler Umsatz AI-Act-Audit, Explainability-Layer, HITL-Gates, DSFA-Template
DORA (BaFin) 17.01.2025 in Kraft Für Banken/Versicherer: Private-AI-Anbieter als ICT-Drittanbieter registrieren, Incident-Reporting 4 h/72 h/1 Monat, Exit-Strategie, Resilience-Tests bis 2 % Weltjahresumsatz DORA-Readiness, Auslagerungs-Register, Audit-Trail via LangFuse
NIS-2 UmsuCG 06.12.2025 in Kraft · BSI-Registrierung bis 06.03.2026 Wesentliche Einrichtungen: Private-AI-Systeme als Lieferkette absichern (§30 NIS2UmsuCG), Supplier-Security-Fragebögen, Incident-Meldung 24 h bis 10 Mio. € oder 2 % Umsatz, Geschäftsleiter-Haftung Supplier-Assessment, Lieferketten-Audit, AI-Supply-Chain-Security
BSI C5 & AIC4 laufend (freiwillig, für KRITIS & Pharma empfohlen) Cloud-Compliance-Kriterien: 125+ Kontrollen inkl. AI Cloud Services (AIC4). STACKIT, Delos und Azure Germany sind C5-testiert — bei Hetzner selbst prüfen Kundenanforderung, Versicherungs-Risiko C5-konforme Architektur, Testat-Unterstützung
DSGVO + ISO 27001/42001 laufend Art. 25 Privacy by Design, Art. 32 TOM, Art. 35 DSFA bei Hochrisiko. ISO 42001 (AI Management System) als Differenzierungs-Zertifikat bis 4 % Umsatz (DSGVO) DSFA-Template, PII-Maskierung, Customer-Managed Keys, ISO-42001-Beratung

Welche dieser sechs Regulierungen treffen auf Ihren Private-AI-Einsatz zu? Jetzt Kontakt aufnehmen

Private-AI-Journey

Von Use Case bis Managed Service: der Private-AI-Stack in 6 Schritten

Kein Big-Bang — jede Stufe einzeln pilotierbar, aufeinander integrierbar. Von der Use-Case-Auswahl bis zum 24/7-Managed-Service mit DORA-/NIS-2-Evidenz.

Jede Stufe als Festpreis-Modul startbar — POC ab 30 k€ in 6 Wochen, Plattform-Rollout mit Senior-Engineer als Tech-Lead und klarer Go/No-Go-Logik.
30-Min Private-AI-Sparring buchen
Engagement-Modelle

Private-AI-Preise, die CFOs & CTOs planen können

Festpreise für POC und Plattform-Rollout, transparente Range für Managed Service. Keine Tagessatz-Lawine, kein Vendor-Lock-in im Vertrag.

Private-AI POC
ab 30.000 € / Festpreis
4–6 Wochen
  • Ollama/vLLM-Setup in 30 Min
  • Llama 4 / Mistral Small 3.1 / Qwen 2.5
  • RAG auf echten Dokumenten (Confluence, SharePoint)
  • Benchmark gegen Azure OpenAI / ChatGPT Enterprise
  • TCO-Rechnung über 3 Jahre
  • Go/No-Go mit Business-Case
POC starten
Managed Private AI
ab 4–8 k€ / Monat
24 Monate (kündbar 3 Mon.)
  • 24/7 Betrieb & Modell-Updates
  • Incident-Response < 4 h
  • Quartals-Benchmark neuer Open-Source-LLMs
  • EU-AI-Act- & ISO-42001-Evidenz
  • Managed Cost-Control + Anomaly-Alerts
  • Skaliert mit Nutzerzahl (nicht Token!)
Managed-Service anfragen
Häufige Fragen

12 Private-AI-Fragen, ehrlich beantwortet

Aus echten Sales-Calls mit CIOs, CISOs und Data-Platform-Leads aus Banking, Versicherung, Energie und Maschinenbau.

Was ist Private AI — und warum nicht einfach ChatGPT Enterprise?
Private AI ist der Betrieb generativer KI auf eigener oder souveräner Infrastruktur (On-Prem, STACKIT, Open Telekom Cloud, Azure Germany) mit Open-Source-Modellen wie Llama 4, Mistral Small 3.1 oder Qwen 2.5. Keine Daten verlassen die EU, kein CLOUD-Act-Zugriff, vollständige Kontrolle über Modell-Version, Logs und Kosten. ChatGPT Enterprise ist bequem, aber bleibt US-Cloud mit OpenAI als SaaS-Provider — für DORA, BaFin-MaRisk-AT und IP-sensible Use-Cases oft nicht akzeptabel.
Was kostet Private AI — POC, Plattform, Betrieb?
Ehrliche Bandbreite: POC 30–50 k€ Festpreis in 4–6 Wochen, Plattform-Rollout 80–150 k€ über 3–6 Monate, Managed Service ab 4–8 k€ pro Monat. Operative Stückkosten nach Rollout: meist unter 2 € pro Mitarbeiter und Monat — deutlich günstiger als ChatGPT Enterprise mit ca. 25 €/User. Entscheidender TCO-Hebel: Kosten skalieren mit Nutzern, nicht mit Token-Volumen.
Welches Modell für welchen Use Case: Llama 4, Mistral oder Qwen?
Grobe Heuristik 2026: Mistral Small 3.1 (Apache 2.0) für allgemeines Chat/RAG bis 24B, günstig in Inferenz. Llama 4 Scout/Maverick für lange Kontexte und multimodale Aufgaben. Qwen 2.5-72B für deutsch-/code-lastige Use-Cases und Reasoning. Wir benchmarken im POC immer auf echten Kundendaten gegen Azure OpenAI — das Ergebnis entscheidet, nicht Hype. Keine Single-Model-Religion, LiteLLM-Gateway lässt Fallback zu.
Ist Azure OpenAI in Germany West Central schon „Private AI"?
Nein — Azure OpenAI Germany West Central ist EU-Region mit Data Processing Agreement, aber weiterhin US-Cloud (Microsoft als Auftragsverarbeiter, CLOUD-Act-Zugriffsrisiko). Für DORA Art. 28/29 (Drittparteien-Risiko), BaFin-MaRisk AT 9 und viele BSI-C5-Relevante Use-Cases ist das zu wenig. Private AI heißt: Open-Source-Modell, eigene oder souveräne Infrastruktur, eigener Gateway. Azure OpenAI kann als Fallback-Modell über LiteLLM-Gateway danebenstehen — die Kontrolle bleibt aber bei Ihnen.
vLLM oder Ollama — was nimmt man wann?
Ollama für POC, Einzel-Workstations und kleine Teams bis 50 Nutzer — läuft in 30 Minuten, super für erste Tests. vLLM für Production ab ~100 gleichzeitigen Nutzern: PagedAttention, Continuous Batching, deutlich höherer Durchsatz. Wir starten fast jedes Projekt mit Ollama, migrieren dann auf vLLM auf Kubernetes. Beide laufen auf On-Prem-GPU oder STACKIT/OTC.
Welche GPU brauche ich für 500 Nutzer?
Pi-mal-Daumen für Mistral Small 3.1 (24B) mit quantisiertem vLLM: 2–4× NVIDIA H100 80GB oder 4× AMD MI300X reichen für ca. 500 gleichzeitig aktive Nutzer im RAG-Betrieb. Für Llama 4 Scout mit langem Kontext eher 8× H100. Bei Sovereign-Cloud-Anbietern (STACKIT, OTC) mietet man die GPU-Slots — Kapex entfällt, dafür 30–40 % höhere OPEX. Wir rechnen im POC immer beide Szenarien durch.
Was ändert der EU AI Act ab August 2025?
Seit 02.08.2025 gelten die GPAI-Pflichten (General-Purpose AI, Art. 53–55) — betrifft primär Modell-Anbieter, aber Enterprise-Nutzer müssen Modell-Cards, Trainings-Transparenz und Urheberrechts-Policy dokumentieren. Ab 02.08.2026 High-Risk-Pflichten für Annex-III-Systeme (HR, Bonität, kritische Infrastruktur). Ab 02.08.2027 Annex-I-Systeme (Sicherheitsbauteile, u.a. Maschinenverordnung). Pexon liefert einen EU-AI-Act-Compliance-Check als Festpreis-Modul im Rollout.
Wie erfüllt Private AI DORA Art. 28/29 (Drittparteien-Risiko)?
DORA ist seit 17.01.2025 aktiv. Drittparteien-Register, Exit-Strategie, Sub-Outsourcing-Ketten-Dokumentation sind Pflicht. Private AI hat hier einen strukturellen Vorteil: Open-Source-Modell = kein kritischer Drittanbieter. Sovereign-Cloud-Provider (STACKIT, OTC) = dokumentierbare EU-Kette. Bei uns gehört ein DORA-Evidenz-Paket zum Managed Service (Test-Framework, Exit-Playbook, Register-Export). Für reine SaaS-AI mit OpenAI als kritischem Third Party wird das deutlich schwieriger.
Wie schütze ich RAG vor Prompt-Injection aus Dokumenten?
Drei Layer: (1) Input-Sanitization — Dokumente vor dem Embedding auf "Ignore previous instructions"-Patterns scannen. (2) Instruction-Hierarchy in Systemprompt (OpenAI-Pattern): System > User > Retrieved Content. (3) Guardrails wie NeMo Guardrails oder Llama Guard 3 als separater Prüf-Agent. Dazu: RBAC im Retrieval (Abschnitt auf Abschnitt-Ebene), damit ein kompromittiertes Dokument keine fremden Daten leaken kann. Wir haben dazu einen eigenen Defense-Stack-Blog.
Was ist LiteLLM und warum brauche ich einen Gateway?
LiteLLM ist ein OpenAI-kompatibler Proxy vor beliebigen Modellen (Llama via vLLM, Azure OpenAI, Claude, Mistral API). Drei Vorteile: (1) Fallback — wenn Private-AI-Cluster ausfällt, automatisch zu Azure OpenAI. (2) Cost-Tracking pro Team/Kostenstelle. (3) Kein Vendor-Lock-in im Applikations-Code — alle Apps sprechen OpenAI-API-Format. Ist bei uns Default-Baustein in jedem Plattform-Rollout.
Wie lange dauert ein Private-AI-POC realistisch?
Technisch 30 Minuten (Ollama + Mistral + Open WebUI) bis Produktions-POC 4–6 Wochen. Realistisch: Tag 1 lauffähiges Setup, Woche 2–3 RAG auf echten Dokumenten, Woche 4 SSO/RBAC/Logging, Woche 5–6 Benchmark gegen Azure OpenAI + TCO-Rechnung. Engpass ist nie die Technik, sondern Daten-Freigabe durch Datenschutz, Betriebsrat und IT-Security. Deshalb starten wir Parallelspur „Organisation" am ersten Tag.
Was passiert, wenn wir den Anbieter wechseln wollen?
Genau dafür ist Private AI gebaut: LiteLLM-Gateway + OpenAI-kompatible API heißt, die Applikationen sind vom Modell entkoppelt. Modell-Wechsel (Llama → Mistral → Qwen) ist Config-Änderung, kein Re-Build. Infrastruktur-Wechsel (On-Prem → STACKIT → OTC) läuft über GitOps, Prompt-Library und Eval-Tests bleiben identisch. Exit aus dem Pexon-Managed-Service: 3 Monate Kündigungsfrist, volle Doku, Hand-over zum In-House-Team oder zum nächsten Dienstleister gehört zum Vertrag. Kein Lock-in, kein Drama.
Private AI & Compliance — Begriffe

Glossar: 12 Private-AI-Begriffe für Enterprise-Entscheider 2026

Kompaktes Nachschlagewerk für EU AI Act, DORA, NIS-2, Sovereign Cloud und moderne LLM-Inferenz — mit Stichtagen und Paragrafen.

Private AI / Sovereign AI
Betrieb generativer KI auf eigener oder souveräner Infrastruktur (On-Prem, STACKIT, Open Telekom Cloud, Azure Germany) mit Open-Source-Modellen (Llama 4, Mistral Small 3.1, Qwen 2.5). Keine Daten verlassen die EU, kein CLOUD-Act-Zugriff, volle Kontrolle über Modell-Version, Logs und Kosten.
EU AI Act — GPAI (Art. 53–55)
General-Purpose-AI-Pflichten seit 02.08.2025 aktiv. Modell-Anbieter müssen technische Dokumentation, Urheberrechts-Policy und Modell-Cards bereitstellen. Enterprise-Nutzer brauchen Transparenz darüber, welches Modell welche Daten gesehen hat. Hub-Pflicht: Dokumentation in der AI-Governance-Policy.
EU AI Act — High-Risk Annex III
Ab 02.08.2026: High-Risk-Pflichten für KI in HR-Prozessen, Bonität/Kredit, kritischer Infrastruktur, Bildung, Strafverfolgung. Risk-Mgmt (Art. 9), Daten-Governance (Art. 10), Logging (Art. 12), Human Oversight (Art. 14). Bußgeld bis 7 % globaler Umsatz.
EU AI Act — High-Risk Annex I
Ab 02.08.2027: KI als Sicherheitsbauteil unter Annex-I-Harmonisierungsrecht (u.a. Maschinenverordnung 2023/1230, Medizinprodukte, Fahrzeuge). Volle High-Risk-Pflichten, CE-Kennzeichnung, Konformitätsbewertung.
DORA (Digital Operational Resilience Act)
EU 2022/2554, seit 17.01.2025 aktiv. ICT-Risk-Mgmt für Finanzsektor inkl. Versicherer. Art. 28/29 = Drittparteien-Risiko: Register, Exit-Strategien, Sub-Outsourcing-Ketten. Private AI hat strukturellen Vorteil gegenüber SaaS-AI (weniger kritische Drittanbieter).
NIS-2-Umsetzungsgesetz (NIS2UmsuCG)
In Kraft seit 06.12.2025. Betrifft ~30.000 dt. Unternehmen als wesentliche/bedeutende Einrichtungen. BSI-Registrierung (Frist 06.03.2026), 24-h-Incident-Meldung, Lieferketten-Sicherheit. Bußgeld bis 10 Mio. € oder 2 % Umsatz, persönliche Geschäftsleiter-Haftung.
vLLM / PagedAttention
Hochperformante LLM-Inferenz-Engine (UC Berkeley). PagedAttention verwaltet KV-Cache wie Virtual Memory — 2–4× höherer Durchsatz als HuggingFace Transformers. Continuous Batching. Production-Standard für Llama, Mistral, Qwen, DeepSeek. Läuft auf H100, MI300X, auch Spark-Cluster.
Ollama
Leichtgewichtige LLM-Runtime für Dev/POC und kleine Teams (<50 Nutzer). Startet in 30 Min, läuft auf Laptop bis Workstation. Für Production-Durchsatz (>100 parallele Nutzer) wird auf vLLM migriert. OpenAI-kompatible API, keine Vendor-Abhängigkeit.
LiteLLM Gateway
OpenAI-kompatibler Proxy vor beliebigen Modellen (vLLM, Azure OpenAI, Claude, Mistral API). Drei Funktionen: Fallback zwischen Modellen, Cost-Tracking pro Team, Lock-in-freie Anwendungs-API. Standard-Baustein in jeder Pexon-Private-AI-Plattform.
RAG (Retrieval-Augmented Generation)
Pattern, bei dem ein LLM vor der Antwort relevante Dokumente aus einem Vector-Store (Qdrant, Weaviate, pgvector) sucht und als Kontext nutzt. Kein Fine-Tuning nötig, Inhalte aktualisierbar. Für Enterprise: mit RBAC auf Dokumenten-Ebene + Prompt-Injection-Defense.
Prompt Injection (Indirect)
Angriff, bei dem ein manipuliertes Dokument den LLM über RAG dazu bringt, ursprüngliche Anweisungen zu ignorieren oder Daten zu leaken. OWASP LLM Top 10 #1. Defense: Input-Sanitization, Instruction-Hierarchy, Guardrails (NeMo, Llama Guard 3), RBAC im Retrieval.
ISO/IEC 42001 (AI Management System)
Seit Dez. 2023 gültig: weltweit erster zertifizierbarer Standard für KI-Management-Systeme. Analogie zu ISO 27001 für IT-Security. Von BaFin und EU AI Act als Nachweis für Governance akzeptiert. Pexon liefert Readiness-Assessment und Audit-Vorbereitung.
Trust & Compliance

Was Enterprise-Kunden bei uns einkaufen — neben Private-AI-Engineering

ISO-Zertifizierung, Hyperscaler-Partnerstatus und produktive Private-AI-Projekte bei Deutz, Liebherr, Schaeffler, Reinhausen sowie Banken und Versicherern aus DACH.

Pexon Compliance-Stack

  • ISO 27001 zertifiziert
  • Microsoft Solutions Partner (AI, Data, Infra)
  • AWS Advanced Tier Partner
  • Google Cloud Partner
  • EU AI Act Compliance-Framework (GPAI/Annex III/I)
  • DORA-Test-Framework & Evidence-Pack
  • NIS-2-konforme Implementierungspraxis
  • ISO 42001 Readiness-Assessment

Sovereign-Infrastruktur & IP-Schutz

  • Llama 4 · Mistral Small 3.1 · Qwen 2.5 on-prem
  • STACKIT (rein deutsche Cloud)
  • Open Telekom Cloud (sovereign)
  • Azure Germany West Central
  • AWS Frankfurt (eu-central-1)
  • Air-Gapped LLM-Deployment möglich
  • RBAC + SSO (Entra ID, Keycloak, Okta)
  • Zero US-Cloud-Zugriff (kein CLOUD Act)

Production-Stack & Observability

  • vLLM auf Kubernetes (AKS, EKS, On-Prem)
  • LiteLLM-Gateway mit Fallback & Cost-Tracking
  • Open WebUI / Custom-Frontends
  • Qdrant, Weaviate, pgvector Vector-Stores
  • LangFuse + OpenTelemetry Tracing
  • Guardrails (NeMo, Llama Guard 3)
  • GitOps-Deployments (ArgoCD, Flux)
  • Audit-Trail für EU AI Act Art. 12

30 Minuten Private-AI-Sparring.
Senior-Engineer, keine Sales-Pipeline.

Wir analysieren Ihren konkreten Use Case, rechnen TCO über 3 Jahre und zeigen Ihnen einen lauffähigen POC in unserer Referenz-Umgebung (Llama 4 + vLLM + LiteLLM + LangFuse). Direkt mit dem Tech-Lead, der die Projekte bei Deutz, Liebherr und Reinhausen verantwortet.

Weitere Themen