Souveräne KI & Private AI für Unternehmen: ChatGPT-Leistung ohne Datenabfluss, DSGVO-konform in Ihrer Infrastruktur
Wir bauen Open-Source-LLM-Plattformen mit Llama 4, Mistral Small 3.1 und Qwen 2.5 auf STACKIT, Hetzner oder Azure Germany — vLLM für Inferenz, Open WebUI mit SSO, LiteLLM-Gateway und RAG. Kein US-CLOUD-Act-Zugriff, keine OpenAI-API-Lock-in, volle Modell-Kontrolle. DSGVO, BaFin, EU AI Act und BSI C5 in der Architektur, nicht als Audit-Nachtrag.
Enterprise-Kunden im Pexon Private-AI-Portfolio
Private AI von POC bis Managed Service
Produktive Open-Source-LLM-Bausteine für Enterprise: Plattform, Governance, Infrastruktur und Managed Betrieb — DSGVO-, BaFin- und EU-AI-Act-konform. Neu: Private AI vs Azure OpenAI vs ChatGPT Enterprise im Vergleich - die drei Betriebsvarianten nebeneinander, mit Entscheidungsregel für Konstruktionsdaten.
Der Baustein, an dem sich Modellwechsel, Kostentransparenz und Zugriffskontrolle entscheiden, ist das Gateway. Wie dieser Layer aufgebaut und betrieben wird, zeigt die LiteLLM-Beratung mit Routing, Budgets und Key-Management. Die Kategorie darüber, Setup, Betrieb und Ownership, ist die Open-Source-KI-Plattform.
Private-AI-Plattform Enterprise
Vollständiges Setup mit Open WebUI, vLLM, LiteLLM-Gateway, SSO über Azure AD oder Keycloak, RBAC und Audit-Trail über LangFuse.
Ollama & vLLM Konfiguration
Ollama für Developer-POC, vLLM für produktive Skala — 19× höherer Throughput (Red Hat Benchmark). Llama 4, Mistral Small 3.1, Qwen 2.5-72B.
Sovereign Hosting: STACKIT, Hetzner, Delos
BSI-C5-zertifiziert auf STACKIT oder Delos Cloud, günstigste GPU-Kosten bei Hetzner Dedicated ab rund 2.500 €/Monat H100. Keine Hyperscaler-Lock-in.
Datensouveränität & DSGVO
Art. 25 Privacy by Design, Art. 32 TOM-Compliance, Schrems-II-Lösung. PII-Maskierung, Customer-Managed-Keys, keine Third-Party-Processor.
BaFin- & DORA-konformes Private AI
Für Banken, Versicherer und Finanzdienstleister: ICT-Risk-Mgmt, Incident-Reporting 4 h/72 h/1 M, Auslagerungs-Register. DORA seit 17.01.2025.
KI-Governance mit SSO & RBAC
Modell-Inventar, Prompt-Injection-Defense, HITL-Gates für EU AI Act Art. 14. Azure AD oder Keycloak Integration, Audit-Log via LangFuse.
Private AI für Engineering & CAD/PLM
IP-Schutz für Konstruktionsdaten, Teamcenter/Windchill/3DEXPERIENCE-Integration. Deutz-Pattern: 5.000+ aktive Nutzer im Motorenbau.
Managed Private AI (SLA)
24/7 Betrieb, Modell-Updates, Security-Patches, Performance-Tuning. Ab 4.000 €/Monat — günstiger als Inhouse-Team aufzubauen.
Fallback & Ausfallsicherheit
Multi-Model-Routing via LiteLLM, hybride Cloud-Architektur, automatischer Failover zwischen Azure OpenAI und On-Prem bei Lastspitzen.
Monitoring & Compliance-Reporting
LangFuse self-hosted für DORA-konformes Modell-Monitoring, Prompt-Audit, Kosten-Tracking, DSFA-Nachweise für Datenschutzaufsicht.
Air-Gapped Deployment
Für KRITIS, Behörden und Pharma: vollständig offline betriebene LLM-Plattform mit manueller Modell-Update-Kette und signiertem Release-Prozess.
Private AI TCO-Rechner
Azure OpenAI vs. vLLM on-prem — Kostenvergleich über 36 Monate mit Ihrer Nutzer- und Token-Zahl. Break-Even-Kalkulation für Ihren Use Case.
Private AI bezeichnet Large Language Models (Llama 4, Mistral Small 3.1, Qwen 2.5), die auf eigener GPU-Hardware oder souveräner EU-Cloud (STACKIT, Hetzner, Delos) laufen — Daten verlassen nie die Unternehmensgrenze, kein OpenAI-API-Call, kein US-CLOUD-Act-Zugriff, DSGVO-konform by design. Pexon Consulting (München, 80 Engineers, ISO 27001) baut Private-AI-Plattformen für regulierte DACH-Unternehmen. Referenzen: Deutz (5.000+ aktive Nutzer), Liebherr, Schaeffler, Reinhausen, Allianz, DEVK.
Kern-Services: Plattform-Setup · Ollama & vLLM · STACKIT/Hetzner · SSO + RBAC · Managed Betrieb.
Greifbar wird eine Private-AI-Plattform für die Fachbereiche meist erst über eine Oberfläche, die auf den eigenen Dokumenten antwortet. Dafür bauen wir einen KI-Chatbot auf den eigenen Unternehmensdaten, DSGVO-konform betrieben, mit Rechteprüfung und Quellenangabe je Antwort.
Cloud-AI-Lock-in, Datenschutz-Bußgelder, DORA und EU AI Act — 2026 ist der Kipp-Punkt.
der deutschen Unternehmen setzen KI aktiv ein — Verdopplung vs. 17 % im Vorjahr (Bitkom KI-Studie 2026).
Garante-Bußgeld gegen OpenAI wegen Datenpanne & fehlender Rechtsgrundlage (Garante Dezember 2024).
der Privacy-Profis geben zu: Mitarbeiter laden sensible Daten in GenAI-Tools (Cisco 2026 Data Privacy Benchmark).
oder 7 % Weltjahresumsatz bei Verstoß gegen High-Risk-KI-Pflichten (EU AI Act Portal).
Für regulierte Unternehmen ist das kein Trend, sondern Compliance-Druck mit konkreten Kosten. Microsoft hat 2025 vor dem französischen Senat bestätigt: US-CLOUD-Act-Zugriff auf Azure-Daten kann nicht ausgeschlossen werden, auch mit EU Data Boundary. GPAI-Pflichten gelten bereits seit 02.08.2025, nicht erst 2026 — wer Llama 4 oder Mistral fine-tuned, wird selbst GPAI-Provider mit Transparenz- und Risk-Management-Pflichten (Art. 53 ff.).
Wir bauen echtes Private AI — kein Cloud-Rebranding. Open-Source-LLMs auf eigener Hardware oder souveräner EU-Cloud. Klar abgegrenzt:
DORA für Finanzsektor
ICT-Risk-Mgmt, Auslagerungs-Register, Incident-Reporting 4 h/72 h/1 Monat. Strafe bis 2 % Weltjahresumsatz. Private-AI-Anbieter als Drittanbieter zu registrieren.
EU AI Act GPAI-Pflichten
General-Purpose-AI-Regeln gelten bereits: Transparenz, technische Dokumentation, Urheberrechts-Policy. Auch für fine-getunte Llama/Mistral-Modelle.
EU AI Act Annex III (High-Risk)
Standalone High-Risk-Systeme: HR-Screening, Credit-Scoring, Law-Enforcement. Art. 9–15 Risk-Mgmt, HITL, Audit-Trail. Strafe bis 35 Mio. € / 7 % Umsatz.
EU AI Act Annex I
KI-Systeme als Sicherheitsbauteile in regulierten Produkten (Medizin, Maschinen, Autos). Konformitätsbewertung als Teil der Produktzulassung.
Vier Pillars unserer Private-AI-Beratung
Wir sind kein klassisches Beratungshaus mit Powerpoint. Wir sind Engineers, die Private-AI-Plattformen bauen, ausrollen, betreiben — bis zur Übergabe oder als Managed Service.
Sovereign Open-Source-Stack
Llama 4 Scout/Maverick, Mistral Small 3.1 (Apache 2.0), Qwen 2.5-72B — auf STACKIT (BSI C5), Hetzner Dedicated oder On-Prem-GPU. Keine OpenAI-Lock-in, keine US-CLOUD-Act-Risiken. Break-Even gegenüber Azure OpenAI in 8–14 Monaten.
DSGVO + EU AI Act by Design
Art. 25 Privacy by Design, Art. 32 TOM, Art. 35 DSFA — für Banken DORA (seit 17.01.2025), für Versicherer VAIT/DORA, für KRITIS NIS-2 UmsuCG. GPAI-Pflichten des EU AI Act gelten bereits seit 02.08.2025.
Kosten-Kontrolle statt Token-Überraschung
Self-Hosted LLM amortisiert sich bei 2–3 Mio. Tokens/Tag (Consumer-GPU) oder 10–30 Mio. Tokens/Tag (Enterprise) gegenüber OpenAI-API. H100-Preise seit Q4/2025 um 40 % gestiegen — eigene Hardware amortisiert sich schneller als gedacht.
Performance für Enterprise-Skala
vLLM liefert 793 Tokens/s (Peak) vs. 41 Tokens/s bei Ollama — Faktor 19 bei 128 parallelen Usern, P99-Latenz unter 100 ms. Deutz-Pattern: 5.000+ aktive Nutzer modular auf vLLM-Cluster skaliert.
Wie die Pexon-Private-AI-Plattform aussieht
Vier Layer von oben nach unten — Applications, Models + Inference, Platform, Sovereign Infrastructure. Produktionsreife, DSGVO-konforme Referenzarchitektur. Jeder Layer einzeln pilotierbar.
Praxiswissen Private AI
Vergleiche, Leitfäden und Tools für Private-AI-Entscheider — aus echten Kundenprojekten bei Liebherr, Deutz, Reinhausen, Schaeffler und Allianz.
Ollama vs. vLLM vs. TGI: Welche Inference-Engine wann?
Red Hat Benchmark: vLLM liefert bis zu 19× Throughput von Ollama bei 128 parallelen Usern. Entscheidungsmatrix für Enterprise-Deployments.
Jetzt lesen Neu VergleichPrivate RAG mit LlamaIndex: On-Premise ohne Cloud-Lock-in
LlamaIndex + Llama 4/Mistral on-prem: 1,20 €/User/Monat statt 25 € ChatGPT. Qdrant, vLLM, Ollama — null Datenabfluss.
Jetzt lesen Neu Kostenloses ToolEU AI Act Reifegrad-Assessment
Wie gut ist Ihre KI-Nutzung auf GPAI-Pflichten (seit 02.08.2025) und High-Risk-Regeln (ab 02.08.2026) vorbereitet? Radar-Profil und Maßnahmenplan.
Assessment starten Case StudyDeutz: Private AI für 5.000+ aktive Nutzer
LLM-Chatbot mit OCR/NLP, RAG und KI-Agenten für Servicedokumentation, HR und QS. 30 % kürzere Reaktionszeiten, modulare vLLM-Architektur.
Zur Case Study TutorialPrivate AI in 30 Minuten: Ollama + Open WebUI auf Ubuntu
Developer-POC mit Llama 4, Open WebUI, lokaler RAG — für Pilot- und Proof-of-Concept-Deployments. Von Docker-Install bis erste Query.
Jetzt lesen BlogPrivate AI im Banking und Versicherung: DORA, BAIT und EU AI Act
Regulatorik-Mapping für Finanzdienstleister: DORA-Architektur, §203-sichere Deployment-Pattern, High-Risk-KI nach Annex III klassifizieren.
Jetzt lesenWer heute OpenAI- oder ChatGPT-Enterprise im deutschen Mittelstand einführt, zahlt zweimal: einmal für die Lizenzen, einmal in der Compliance-Diskussion mit Datenschutz, Betriebsrat und Aufsicht. Private AI mit Llama oder Mistral auf STACKIT oder Hetzner ist nicht billiger, aber es stellt keine dieser Fragen — weil Daten die Unternehmensgrenze nie verlassen.
5 Phasen vom POC in 30 Minuten zum Managed Service
Jede Phase mit klarem Output, Festpreis-Pilot, dokumentierter Übergabe. Kein Berater-Abo, keine Tagessatz-Lawine.
Assessment & Use-Case-Auswahl
Workshop zur Use-Case-Priorisierung, Hosting-Entscheidung (STACKIT vs. Hetzner vs. Azure Germany), Compliance-Mapping (DORA, AI Act).
Architektur & Modell-Auswahl
Zielbild mit Llama 4, Mistral Small 3.1 oder Qwen 2.5, GPU-Dimensionierung (H100/H200), Gateway- und SSO-Design.
POC / Pilot
30-Min-Prototyp (Ollama + Open WebUI) oder 6-Wochen-Pilot mit vLLM, RAG, LangFuse auf echten Daten. Festpreis, Go/No-Go mit Metriken.
Production Rollout
Produktivnahme mit RBAC, SSO, Audit-Trail und Monitoring. Deutz-Pattern: modular auf vLLM-Cluster bis 5.000+ aktive Nutzer skaliert.
Managed Betrieb (SLA)
24/7-Betrieb, Modell-Updates, Security-Patches, Compliance-Updates (GPAI, AI Act). Ab 4.000 €/Monat.
Drei Private-AI-Projekte aus dem DACH-Mittelstand
Realisierte Pexon-Projekte — mit konkreten Zahlen, Tech-Stack und Outcome.
Generative KI für 5.000+ aktive Nutzer im Motorenbau
LLM-Chatbot mit OCR/NLP, rollenbasierte Tool-Integration, KI-Agenten für HR, IT und Qualitätssicherung. 8+ Use Cases, modulare vLLM-Architektur über Fachbereiche skaliert. Hybrid aus Azure OpenAI und on-prem Inference.
Vollständige Case Study →Private-AI-Chatbot mit persönlichem Datenzugriff
Private-AI-Chatbot mit SSO und rollenbasiertem Zugriff auf Outlook, OneDrive und Teams. Isolierte Verarbeitung für Engineering-Wissen und CAD-nahe Inhalte — KI im Alltag genutzt, nicht nur Pilot. AD/Entra-Integration out-of-the-box.
Mehr Private-AI-Cases →Support-RAG für 1.000+ MA Energietechnik
RAG-Chatbot über SharePoint, Confluence, Wiki und Dateiablagen mit Azure OpenAI via Private Endpoint, Customer-Managed-Keys. Produktsuche integriert, kontinuierliche Datenpflege. Entlastung des First-Level-Supports bei Transformatoren.
Mehr Private-AI-Cases →Weitere Private-AI-Referenzen aus DACH-Kundenprojekten
Liebherr · Deutz · Schaeffler · Reinhausen · Allianz · DEVK · HDI · Münchener Rück · AOK · BSH · Sennheiser · Bitzer · Dr. Wolff · Gerresheimer · Infineon · Fischer Panda
DSGVO · EU AI Act · DORA · NIS-2 · BSI C5 · ISO 42001
Sechs Regulierungen, sechs Stichtage, sechs Pexon-Lösungspfade. Was muss Ihr Unternehmen wann tun, was kostet ein Verstoß bei KI-Einsatz.
| Regulierung | Stichtag | Was muss ein Private-AI-Betreiber tun? | Strafe | Pexon-Lösung |
|---|---|---|---|---|
| EU AI Act GPAI | 02.08.2025 AKTIV | Fine-tuning von Llama/Mistral → Sie werden selbst GPAI-Provider: technische Dokumentation, Urheberrechts-Policy, Training-Data-Summary, Transparenz | bis 15 Mio. € oder 3 % Umsatz | GPAI-Compliance-Paket, Modell-Karte, Data-Lineage |
| EU AI Act Annex III | 02.08.2026 (standalone High-Risk) | HR-Screening, Credit-Scoring, Law-Enforcement mit KI: Art. 9–15 Risk-Management, HITL, Audit-Trail, Robustness, technische Dokumentation | bis 35 Mio. € oder 7 % globaler Umsatz | AI-Act-Audit, Explainability-Layer, HITL-Gates, DSFA-Template |
| DORA (BaFin) | 17.01.2025 in Kraft | Für Banken/Versicherer: Private-AI-Anbieter als ICT-Drittanbieter registrieren, Incident-Reporting 4 h/72 h/1 Monat, Exit-Strategie, Resilience-Tests | bis 2 % Weltjahresumsatz | DORA-Readiness, Auslagerungs-Register, Audit-Trail via LangFuse |
| NIS-2 UmsuCG | 06.12.2025 in Kraft · BSI-Registrierung bis 06.03.2026 | Wesentliche Einrichtungen: Private-AI-Systeme als Lieferkette absichern (§30 NIS2UmsuCG), Supplier-Security-Fragebögen, Incident-Meldung 24 h | bis 10 Mio. € oder 2 % Umsatz, Geschäftsleiter-Haftung | Supplier-Assessment, Lieferketten-Audit, AI-Supply-Chain-Security |
| BSI C5 & AIC4 | laufend (freiwillig, für KRITIS & Pharma empfohlen) | Cloud-Compliance-Kriterien: 125+ Kontrollen inkl. AI Cloud Services (AIC4). STACKIT, Delos und Azure Germany sind C5-testiert — bei Hetzner selbst prüfen | Kundenanforderung, Versicherungs-Risiko | C5-konforme Architektur, Testat-Unterstützung |
| DSGVO + ISO 27001/42001 | laufend | Art. 25 Privacy by Design, Art. 32 TOM, Art. 35 DSFA bei Hochrisiko. ISO 42001 (AI Management System) als Differenzierungs-Zertifikat | bis 4 % Umsatz (DSGVO) | DSFA-Template, PII-Maskierung, Customer-Managed Keys, ISO-42001-Beratung |
Welche dieser sechs Regulierungen treffen auf Ihren Private-AI-Einsatz zu? Jetzt Kontakt aufnehmen
Von Use Case bis Managed Service: der Private-AI-Stack in 6 Schritten
Kein Big-Bang — jede Stufe einzeln pilotierbar, aufeinander integrierbar. Von der Use-Case-Auswahl bis zum 24/7-Managed-Service mit DORA-/NIS-2-Evidenz.
Use-Case & Daten-Assessment
Modell-Auswahl (Llama/Mistral/Qwen)
SSO, RBAC & Datenintegration
Production: Gateway & Monitoring
Managed Service & Compliance
Private-AI-Preise, die CFOs & CTOs planen können
Festpreise für POC und Plattform-Rollout, transparente Range für Managed Service. Keine Tagessatz-Lawine, kein Vendor-Lock-in im Vertrag.
- Ollama/vLLM-Setup in 30 Min
- Llama 4 / Mistral Small 3.1 / Qwen 2.5
- RAG auf echten Dokumenten (Confluence, SharePoint)
- Benchmark gegen Azure OpenAI / ChatGPT Enterprise
- TCO-Rechnung über 3 Jahre
- Go/No-Go mit Business-Case
- vLLM-Cluster auf STACKIT / OTC / On-Prem
- LiteLLM-Gateway mit Fallback & Cost-Tracking
- Open WebUI oder Custom-Frontend
- SSO (Entra ID / Keycloak) + RBAC
- LangFuse-Observability & DORA-Evidenz
- Bis 5.000+ Nutzer (Deutz-Pattern)
- Senior-Engineer als Tech-Lead
- 24/7 Betrieb & Modell-Updates
- Incident-Response < 4 h
- Quartals-Benchmark neuer Open-Source-LLMs
- EU-AI-Act- & ISO-42001-Evidenz
- Managed Cost-Control + Anomaly-Alerts
- Skaliert mit Nutzerzahl (nicht Token!)
12 Private-AI-Fragen, ehrlich beantwortet
Aus echten Sales-Calls mit CIOs, CISOs und Data-Platform-Leads aus Banking, Versicherung, Energie und Maschinenbau.
Was ist Private AI — und warum nicht einfach ChatGPT Enterprise?
Was kostet Private AI — POC, Plattform, Betrieb?
Welches Modell für welchen Use Case: Llama 4, Mistral oder Qwen?
Ist Azure OpenAI in Germany West Central schon „Private AI"?
vLLM oder Ollama — was nimmt man wann?
Welche GPU brauche ich für 500 Nutzer?
Was ändert der EU AI Act ab August 2025?
Wie erfüllt Private AI DORA Art. 28/29 (Drittparteien-Risiko)?
Wie schütze ich RAG vor Prompt-Injection aus Dokumenten?
Was ist LiteLLM und warum brauche ich einen Gateway?
Wie lange dauert ein Private-AI-POC realistisch?
Was passiert, wenn wir den Anbieter wechseln wollen?
Glossar: 12 Private-AI-Begriffe für Enterprise-Entscheider 2026
Kompaktes Nachschlagewerk für EU AI Act, DORA, NIS-2, Sovereign Cloud und moderne LLM-Inferenz — mit Stichtagen und Paragrafen.
- Private AI / Sovereign AI
- Betrieb generativer KI auf eigener oder souveräner Infrastruktur (On-Prem, STACKIT, Open Telekom Cloud, Azure Germany) mit Open-Source-Modellen (Llama 4, Mistral Small 3.1, Qwen 2.5). Keine Daten verlassen die EU, kein CLOUD-Act-Zugriff, volle Kontrolle über Modell-Version, Logs und Kosten.
- EU AI Act — GPAI (Art. 53–55)
- General-Purpose-AI-Pflichten seit 02.08.2025 aktiv. Modell-Anbieter müssen technische Dokumentation, Urheberrechts-Policy und Modell-Cards bereitstellen. Enterprise-Nutzer brauchen Transparenz darüber, welches Modell welche Daten gesehen hat. Hub-Pflicht: Dokumentation in der AI-Governance-Policy.
- EU AI Act — High-Risk Annex III
- Ab 02.08.2026: High-Risk-Pflichten für KI in HR-Prozessen, Bonität/Kredit, kritischer Infrastruktur, Bildung, Strafverfolgung. Risk-Mgmt (Art. 9), Daten-Governance (Art. 10), Logging (Art. 12), Human Oversight (Art. 14). Bußgeld bis 7 % globaler Umsatz.
- EU AI Act — High-Risk Annex I
- Ab 02.08.2027: KI als Sicherheitsbauteil unter Annex-I-Harmonisierungsrecht (u.a. Maschinenverordnung 2023/1230, Medizinprodukte, Fahrzeuge). Volle High-Risk-Pflichten, CE-Kennzeichnung, Konformitätsbewertung.
- DORA (Digital Operational Resilience Act)
- EU 2022/2554, seit 17.01.2025 aktiv. ICT-Risk-Mgmt für Finanzsektor inkl. Versicherer. Art. 28/29 = Drittparteien-Risiko: Register, Exit-Strategien, Sub-Outsourcing-Ketten. Private AI hat strukturellen Vorteil gegenüber SaaS-AI (weniger kritische Drittanbieter).
- NIS-2-Umsetzungsgesetz (NIS2UmsuCG)
- In Kraft seit 06.12.2025. Betrifft ~30.000 dt. Unternehmen als wesentliche/bedeutende Einrichtungen. BSI-Registrierung (Frist 06.03.2026), 24-h-Incident-Meldung, Lieferketten-Sicherheit. Bußgeld bis 10 Mio. € oder 2 % Umsatz, persönliche Geschäftsleiter-Haftung.
- vLLM / PagedAttention
- Hochperformante LLM-Inferenz-Engine (UC Berkeley). PagedAttention verwaltet KV-Cache wie Virtual Memory — 2–4× höherer Durchsatz als HuggingFace Transformers. Continuous Batching. Production-Standard für Llama, Mistral, Qwen, DeepSeek. Läuft auf H100, MI300X, auch Spark-Cluster.
- Ollama
- Leichtgewichtige LLM-Runtime für Dev/POC und kleine Teams (<50 Nutzer). Startet in 30 Min, läuft auf Laptop bis Workstation. Für Production-Durchsatz (>100 parallele Nutzer) wird auf vLLM migriert. OpenAI-kompatible API, keine Vendor-Abhängigkeit.
- LiteLLM Gateway
- OpenAI-kompatibler Proxy vor beliebigen Modellen (vLLM, Azure OpenAI, Claude, Mistral API). Drei Funktionen: Fallback zwischen Modellen, Cost-Tracking pro Team, Lock-in-freie Anwendungs-API. Standard-Baustein in jeder Pexon-Private-AI-Plattform.
- RAG (Retrieval-Augmented Generation)
- Pattern, bei dem ein LLM vor der Antwort relevante Dokumente aus einem Vector-Store (Qdrant, Weaviate, pgvector) sucht und als Kontext nutzt. Kein Fine-Tuning nötig, Inhalte aktualisierbar. Für Enterprise: mit RBAC auf Dokumenten-Ebene + Prompt-Injection-Defense.
- Prompt Injection (Indirect)
- Angriff, bei dem ein manipuliertes Dokument den LLM über RAG dazu bringt, ursprüngliche Anweisungen zu ignorieren oder Daten zu leaken. OWASP LLM Top 10 #1. Defense: Input-Sanitization, Instruction-Hierarchy, Guardrails (NeMo, Llama Guard 3), RBAC im Retrieval.
- ISO/IEC 42001 (AI Management System)
- Seit Dez. 2023 gültig: weltweit erster zertifizierbarer Standard für KI-Management-Systeme. Analogie zu ISO 27001 für IT-Security. Von BaFin und EU AI Act als Nachweis für Governance akzeptiert. Pexon liefert Readiness-Assessment und Audit-Vorbereitung.
Was Enterprise-Kunden bei uns einkaufen — neben Private-AI-Engineering
ISO-Zertifizierung, Hyperscaler-Partnerstatus und produktive Private-AI-Projekte bei Deutz, Liebherr, Schaeffler, Reinhausen sowie Banken und Versicherern aus DACH.
Pexon Compliance-Stack
- ISO 27001 zertifiziert
- Microsoft Solutions Partner (AI, Data, Infra)
- AWS Advanced Tier Partner
- Google Cloud Partner
- EU AI Act Compliance-Framework (GPAI/Annex III/I)
- DORA-Test-Framework & Evidence-Pack
- NIS-2-konforme Implementierungspraxis
- ISO 42001 Readiness-Assessment
Sovereign-Infrastruktur & IP-Schutz
- Llama 4 · Mistral Small 3.1 · Qwen 2.5 on-prem
- STACKIT (rein deutsche Cloud)
- Open Telekom Cloud (sovereign)
- Azure Germany West Central
- AWS Frankfurt (eu-central-1)
- Air-Gapped LLM-Deployment möglich
- RBAC + SSO (Entra ID, Keycloak, Okta)
- Zero US-Cloud-Zugriff (kein CLOUD Act)
Production-Stack & Observability
- vLLM auf Kubernetes (AKS, EKS, On-Prem)
- LiteLLM-Gateway mit Fallback & Cost-Tracking
- Open WebUI / Custom-Frontends
- Qdrant, Weaviate, pgvector Vector-Stores
- LangFuse + OpenTelemetry Tracing
- Guardrails (NeMo, Llama Guard 3)
- GitOps-Deployments (ArgoCD, Flux)
- Audit-Trail für EU AI Act Art. 12
30 Minuten Private-AI-Sparring.
Senior-Engineer, keine Sales-Pipeline.
Wir analysieren Ihren konkreten Use Case, rechnen TCO über 3 Jahre und zeigen Ihnen einen lauffähigen POC in unserer Referenz-Umgebung (Llama 4 + vLLM + LiteLLM + LangFuse). Direkt mit dem Tech-Lead, der die Projekte bei Deutz, Liebherr und Reinhausen verantwortet.
Verwandte Inhalte für Private-AI-Entscheider
Zuletzt aktualisiert: · Pexon Consulting GmbH, München
Weitere Themen
- Datensouveränität für Kundendaten (Private AI) – Kundendaten mit Private AI schuetzen: DSGVO und AI Act erfuellen. Volle Datensouveraenitaet fuer Unternehmen sichern.
- Ollama & vLLM Konfiguration für Private AI – Ollama & vLLM für Enterprise Private AI konfigurieren. On-Premise LLM-Serving mit GPU-Support, API-Integration & Datenschutz. Jetzt beraten lassen.
- Private AI Engineering-Wissen im Maschinenbau – Private AI Engineering Wissen: Schützen Sie Ihr technisches Wissen und nutzen Sie CAD und PLM sicher im Maschinenbau. Jetzt informieren!
- Private KI-Infrastruktur: GPU-Server On-Premise für Unternehmen – Private KI-Infrastruktur mit GPU-Servern: LLMs on-premise betreiben, volle Datenkontrolle, keine Token-Kosten. Ab 100 GPU-Stunden/Monat rentabel. Jetzt planen.

