Private AI für den Mittelstand · Open-Weight LLM

Open-Weight LLM für Unternehmen: Ihre private KI ohne Datenabfluss

Kurz gesagt

Ein Open-Weight LLM, oft auch Open-Source-LLM genannt, ist ein KI-Modell, dessen Gewichte offen vorliegen, sodass Sie es selbst betreiben können, statt eine fremde API aufzurufen. Pexon Consulting betreibt offene Modelle wie Llama, Mistral oder Qwen für Sie, on-premise oder im deutschen Rechenzentrum, DSGVO-konform und ohne Datenabfluss. Für den Mittelstand, der Datensouveränität und Kostenkontrolle braucht, fixe Kosten statt Token-Abrechnung. Datenschutz ist laut Bitkom 2026 mit 77 Prozent die größte Hürde bei der Digitalisierung.

Llama, Mistral, Qwen & Co.
On-Premise & deutsches Rechenzentrum
Herstellerunabhängig
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner

Warum KI über geschlossene US-APIs teuer wird

80 Prozent des weltweiten Token-Volumens laufen laut Forschern von MIT Sloan und Georgia Tech noch über geschlossene Modelle, die pro Token im Schnitt rund sechsmal so teuer sind wie offene Alternativen. Dazu läuft jeder Prompt über eine Infrastruktur unter US-Recht.

Rechtsrisiko Cloud Act
US-Anbieter müssen Daten auf behördliche Anordnung herausgeben, auch bei einem Rechenzentrum in Frankfurt. Ein Auftragsverarbeitungsvertrag löst das nicht, die US-Herausgabepflicht bleibt bestehen. Für personenbezogene Daten und Berufsgeheimnisse ist das ein DSGVO-Problem.
Token-Kosten ohne Deckel
Bei API-Modellen zahlen Sie pro Token, im Schnitt rund das Sechsfache offener Modelle. Wächst die Nutzung, wächst die Rechnung unkalkulierbar.
Lock-in an einen Anbieter
Ein geschlossenes Modell bindet Sie an dessen Preise, Rate-Limits und Modellwechsel. Wird das Modell abgekündigt oder teurer, haben Sie keine Wahl und keine Migrationsoption.

Ihre Vorteile in Zahlen

Die Zahlen stammen teils aus Marktstudien, teils aus dem Betrieb. Sie zeigen, warum offene Modelle für Unternehmen rechnen.

~3 Monate Rückstand auf Frontier
Offene Modelle holen den Rückstand auf die besten geschlossenen Modelle laut MIT-Sloan-Analyse im Schnitt binnen rund drei Monaten auf. Bei Routine-Aufgaben sind sie ebenbürtig. (MIT Sloan / Georgia Tech 2026)
6× günstiger pro Token
Geschlossene Modelle kosten pro Token im Schnitt rund das Sechsfache offener Alternativen. Wer viel nutzt, spart mit einem Fixpreis erheblich. (MIT Sloan / Georgia Tech 2026)
100 % Datenhoheit
Offene Modelle laufen vollständig in Ihrer Umgebung. Kein Prompt und kein Dokument erreicht einen externen Anbieter. (Architekturprinzip)
0 variable Token-Kosten
Sie zahlen einen festen Monatspreis statt pro Token. Die KI-Kosten werden planbar, unabhängig davon, wie intensiv Ihr Team die Modelle nutzt. (Fixkosten-Modell)

Ab wann sich ein eigenes Open-Weight LLM lohnt

Ein eigenes Open-Weight LLM lohnt sich, sobald mehr als 50 Mitarbeitende regelmäßig KI verwenden, sensible Datenklassen im Spiel sind oder Ihre monatliche Token-Rechnung planlos wächst.
ab 50
Mitarbeitende sollen KI nutzen
ab 3
Anwendungsfälle mit sensiblen Daten
0
Toleranz für Datenabfluss

Anwendungsbeispiele

Use Case 01

Wissens-Assistent auf internen Dokumenten

Ein Mittelständler lässt ein offenes Modell Handbücher, Richtlinien und Angebote per RAG auf den eigenen Fileshares beantworten.

Antworten in Sekunden statt langer Suche, die Quellen bleiben im Haus.
Use Case 02

Coding-Assistent auf eigenem Code

Entwicklungsteams nutzen ein offenes Coding-Modell als Assistenten, ohne dass Quellcode an eine US-API gesendet wird.

Kein Code verlässt das Haus, die Codebasis bleibt intern.
Use Case 03

Dokumente und E-Mails verarbeiten

Fachabteilungen lassen Anfragen klassifizieren, Texte zusammenfassen und Entwürfe schreiben, direkt auf eigener Infrastruktur.

Routine-Textarbeit automatisiert, die Freigabe bleibt beim Menschen.
Use Case 04

Mehrere Modelle je Aufgabe

Ein kleines Modell für einfache Aufgaben, ein großes für komplexe, alle über denselben OpenAI-kompatiblen Endpoint.

Beste Qualität pro Aufgabe, ohne Anbieterwechsel.

Integration in Ihre Umgebung

Passt ein offenes Modell in Ihre Landschaft? In der Regel ja, über Standard-Schnittstellen.

Betrieb und Infrastruktur

On-Premise · Auf Ihrer eigenen Hardware, GPU-Sizing nach Last und Modellgröße.
Deutsches Rechenzentrum · Managed in einem ISO-27001-zertifizierten deutschen oder EU-Rechenzentrum, Ihre Daten bleiben im Land.
OpenAI-kompatibel · Bereitstellung über vLLM mit OpenAI-kompatibler API, bestehende Tools sprechen das Modell ohne Umbau an.

Modelle und Daten

Modellauswahl · Llama, Mistral, Qwen, Gemma oder ein deutsches Modell, je nach Aufgabe, Sprache und Lizenz.
RAG auf Ihren Daten · Anbindung an SharePoint, Confluence, DMS oder Fileshares über Retrieval, ohne die Quellen zu kopieren.
SSO und Rechte · Anbindung an Entra ID oder LDAP, Zugriff und Modell-Rechte pro Rolle.

Wie eine private KI mit offenen Modellen funktioniert

1
Assessment
Wir sichten Use-Cases, Datenklassen und Last und wählen die passenden Modelle.
2
Modellauswahl
Das beste offene Modell je Aufgabe, Sprache, Lizenz und GPU-Budget, statt eines Anbieters für alles.
3
Plattform aufsetzen
vLLM-Serving on-premise oder im deutschen Rechenzentrum, OpenAI-kompatibler Endpoint, Monitoring.
4
Zugriff und Rechte
SSO-Anbindung, Rollen und Rate-Limits, Audit-Log für jede Anfrage.
5
Anwendung anbinden
RAG, Assistent oder Agent auf Ihren Daten, mit Confidence-Schwellen und definiertem Klärfall.
6
Betrieb
Managed Service mit Updates, Modellwechseln und SLA, oder Enablement Ihres Teams.
Erfahren Sie mehr über private KI-Plattformen

Warum Pexon statt Inhouse-Entwicklung

Inhouse allein
-Ein Prototyp mit Ollama ist schnell gebaut, der stabile Produktivbetrieb mit vLLM und Skalierung ist die eigentliche Arbeit.
-Modellauswahl und Updates kosten laufend Zeit, die intern fehlt.
-GPU-Sizing und Rechte-Management sind Spezialwissen, Fehler sind teuer.
US-Cloud mit AVV
-Ein Auftragsverarbeitungsvertrag hebt den US Cloud Act nicht auf.
-Token-Kosten bleiben, ein Datenabfluss bleibt möglich.
-Der Lock-in an einen Anbieter bleibt bestehen.
Mit Pexon
Herstellerunabhängig: wir betreiben das Modell, das zu Ihnen passt, nicht das eines Anbieters.
Private KI-Plattformen sind unser Kerngeschäft, deutsches Rechenzentrum wie on-premise.
Offene Gewichte plus OpenAI-API heißt: kein Lock-in bei uns, Sie können jederzeit wechseln.

In 4 Phasen zur produktiven Lösung

1
Woche 1
Assessment und Modellauswahl
Use-Cases, Datenklassen und Modelle stehen fest.
2
Woche 2-3
Plattform-Setup
Serving, Endpoint, Zugriff und Monitoring laufen.
3
Woche 4
Erster Anwendungsfall
Ein produktiver Use-Case läuft auf Ihren Daten, messbar.
4
ab Woche 5
Betrieb und Rollout
Weitere Use-Cases, Managed Service, Updates und SLA.

Pilot zum Festpreis

Der Einstieg ist eine private KI-Plattform mit klaren Fixkosten, ohne Token-Zähler. Der Umfang wird nach einem kurzen Assessment festgelegt.

Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner
Ihre Investition
ab 1.500 EUR
pro Monat · Managed · S-Tier
Enthält:

Was drin ist · Managed Hosting offener Modelle im deutschen Rechenzentrum, OpenAI-kompatible API, Monitoring und Updates.

Setup · Einmaliges Onboarding als Festpreis, inklusive Modellauswahl, GPU-Sizing und Anbindung. On-Premise-Plattform ab 35.000 EUR.

Skalierung · Größere Modelle und mehr Last über höhere Tiers (S+, L, XL), transparent gestaffelt, mit SLA und Abnahme-Kriterien.
Jetzt Kontakt aufnehmen
100 % unverbindlich, ohne Verpflichtung

Häufige Fragen

Was ist ein Open-Weight LLM?

Ein Open-Weight LLM, auch als Open-Source-LLM bezeichnet, ist ein KI-Modell, dessen trainierte Gewichte offen veröffentlicht sind, etwa Llama, Mistral oder Qwen. Sie können es selbst betreiben, anpassen und fine-tunen, statt eine fremde API aufzurufen. Anders als bei Closed-Modellen wie ChatGPT läuft es komplett auf Ihrer Infrastruktur, kein Prompt verlässt Ihr Haus.
Welche offenen Modelle setzt ihr ein?

Je nach Aufgabe Llama, Mistral, Qwen, Gemma oder ein deutsches Modell. Mistral kommt aus der EU, Qwen ist mehrsprachig stark, Llama breit einsetzbar. Wir sind herstellerunabhängig und wählen pro Fall das beste Modell, statt Sie festzulegen. Ein Wechsel ist jederzeit möglich, kein Lock-in.
Was kostet ein eigenes Open-Weight LLM?

Managed Hosting im deutschen Rechenzentrum beginnt bei rund 1.500 EUR pro Monat als fixer Preis, ohne Token-Kosten. Eine On-Premise-Plattform startet ab 35.000 EUR als Projektpreis. Bei intensiver Nutzung durch viele Mitarbeitende unterschreiten die Fixkosten die variable Token-Rechnung meist deutlich. Den genauen Preis legen wir nach einem Assessment fest.
Sind offene Modelle DSGVO-konform?

Beim Self-Hosting ja, per Architektur. Kein Prompt und kein Dokument verlässt Ihr Rechenzentrum, es gibt keine Übermittlung an einen US-Anbieter, das Cloud-Act-Risiko entfällt. Die Verarbeitung bleibt vollständig unter Ihrer Kontrolle, ohne dass eine AVV mit einem Hyperscaler nötig ist.
Wo passen offene Modelle nicht?

Wenn Sie maximale Reasoning-Leistung am absoluten Stand der Technik oder umfangreiche Bild- und Videofunktionen brauchen, sind geschlossene Frontier-Modelle wie ChatGPT oder Gemini teils noch voraus. Ein Open-Source-LLM und ein Frontier-Modell schließen sich nicht aus, ein Hybrid-Betrieb für die letzten Prozent Spitzenleistung ist möglich. Bei chinesischen Modellen wie DeepSeek gilt: lokal gehostet unkritisch, die Warnungen der Datenschutzbehörden betreffen nur die Cloud-API.
Was brauchen Sie von uns?

Für das Assessment einen Ansprechpartner aus IT und Fachbereich, eine grobe Use-Case-Liste und Angaben zu Datenklassen. Für den Betrieb entweder GPU-Kapazität bei Ihnen oder unser deutsches Rechenzentrum, plus die Anbindung an Ihre relevanten Datenquellen.

Private KI mit offenen Modellen, sprechen wir über Ihr Setup

Datenhoheit ohne Token-Rechnung. In 30 Minuten klären wir, welche offenen Modelle zu Ihnen passen und wie eine private KI-Plattform konkret aussieht.

Jetzt Kontakt aufnehmen

Nachricht senden

Kein passender Termin? Schreiben Sie uns, wir melden uns innerhalb von 24 Stunden.

Antwort innerhalb von 24 Stunden
Unverbindliches Erstgespräch
Persönlicher Ansprechpartner
Phillip Pham
Phillip Pham
CEO @ Pexon Consulting
Aktualisiert am 18. Juli 2026

Sie suchen einen Partner für Ihr Projekt?

Wir analysieren Ihren individuellen Bedarf, geben erste Empfehlungen zu Umsetzungsstrategien und bieten Ihnen transparente Einblicke in unsere Methoden, Technologien und Referenzen.

Vertrieb kontaktieren
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner
400+Projekte seit 2020
100+Kunden im DACH-Raum
ISO27001 zertifiziert
3Hyperscaler Partner