Ollama Kubernetes Sizing Rechner – GPU-Nodes und Kosten berechnen

Berechnen Sie GPU-Nodes, VRAM-Bedarf und monatliche Cloud-Kosten für Ollama auf Kubernetes — basierend auf Ihrem Modell, Ihrer Nutzerzahl und Ihrem Cloud-Provider.

Wählen Sie Modell, Quantisierung und Verfügbarkeit — der Rechner zeigt die passende GPU, Helm-Config und geschätzte Kosten für Azure AKS, AWS EKS, GCP GKE oder On-Premise.

100% unverbindlich mit echtem Mehrwert

Ollama Kubernetes Sizing Rechner

Berechnen Sie GPU-Nodes, VRAM und monatliche Kosten für LLM-Inference auf Kubernetes — basierend auf Ihrem Modell, Ihrer Nutzerzahl und Ihrem Cloud-Provider.

🧠 Modell & Quantisierung

👥 Nutzung & Last

Single Node (Dev/Test)
HA: 2 Replicas (Produktion)
HA: 3 Replicas (Enterprise)

☁️ Cloud Provider

Azure (AKS)
AWS (EKS)
GCP (GKE)
On-Premise

📊 Empfohlene Konfiguration

GPU-Nodes
VRAM pro Node
EUR / Monat
Komponente Spezifikation Hinweis

🔧 Helm-Deployment

Kubernetes-Cluster für LLM-Inference aufsetzen?

Pexon Consulting — 80 Berater, Microsoft Partner, 50+ K8s-Deployments

Kostenlose Erstberatung anfragen

Ollama auf Kubernetes: LLM-Inference im Cluster richtig dimensionieren

Ollama auf Kubernetes zu deployen klingt einfach — helm install ollama und fertig. In der Praxis scheitern die meisten Setups an der GPU-Dimensionierung: Zu wenig VRAM und das Modell lädt nicht. Zu viel und Sie verbrennen tausende Euro pro Monat für ungenutzte GPU-Kapazität. Dieser Rechner hilft Ihnen, die richtige Konfiguration zu finden — bevor Sie Infrastruktur provisionieren.

Warum ein Sizing-Rechner?

Der VRAM-Bedarf eines LLM hängt von drei Faktoren ab: Modellgröße (Parameter), Quantisierung (FP16 bis Q2) und Context Length. Ein Mistral 7B in Q4_K_M braucht ~4,2 GB VRAM — aber mit 32K Context kommen nochmal 3,5 GB KV-Cache dazu. Ohne diese Rechnung buchen Sie entweder eine zu teure A100 oder eine T4, die nicht reicht.


So berechnet sich der VRAM-Bedarf

Die Formel ist simpel: Gesamt-VRAM = Modellgewichte + KV-Cache + Overhead. Die Modellgewichte hängen von der Parameterzahl und Quantisierung ab. Ein 7B-Modell in FP16 braucht ~14 GB, in Q4_K_M nur ~4,2 GB. Der KV-Cache wächst linear mit der Context Length und proportional zur Parameterzahl.

Modell FP16 Q4_K_M Empfohlene GPU
Llama 3.2 3B 6 GB 1,8 GB T4 16 GB
Mistral 7B 14 GB 4,2 GB T4 16 GB / L4 24 GB
Llama 3.1 70B 140 GB 42 GB A100 80 GB
DeepSeek R1 671B 1.342 GB 403 GB Multi-GPU (8x H100)

Ollama Kubernetes Deployment: Was Sie wissen müssen

Ollama auf Kubernetes läuft über den offiziellen Helm Chart (otwld/ollama-helm). Der Chart unterstützt NVIDIA-GPUs mit DRA-Integration, automatisches Model-Pulling beim Start und horizontale Skalierung über Replicas. Für Produktions-Setups empfehlen wir mindestens 2 Replicas mit einem vorgeschalteten Ingress-Controller für Load Balancing.

Kritisch beim Kubernetes-Deployment: Der NVIDIA GPU Operator muss auf allen GPU-Nodes installiert sein. Ohne ihn erkennt der Kubelet die GPUs nicht, und Pods bleiben im Status Pending. Auf AKS aktivieren Sie GPU-Support über den Node-Pool mit --node-vm-size Standard_NC4as_T4_v3. Auf EKS benötigen Sie das NVIDIA Device Plugin DaemonSet.

Tipp: Helm-Timeout erhöhen

Große Modelle (70B+) brauchen 5-15 Minuten zum Herunterladen beim ersten Start. Setzen Sie --timeout 15m beim helm install, sonst bricht Helm mit einem Timeout-Fehler ab, obwohl das Modell noch lädt.


GPU-Kosten: Azure vs. AWS vs. GCP vs. On-Premise

GPU VRAM Azure AWS GCP
T4 16 GB ~380 EUR/Mo ~340 EUR/Mo
L4 / A10G 24 GB ~520 EUR/Mo ~450 EUR/Mo
A100 80 GB ~2.800 EUR/Mo ~3.200 EUR/Mo ~3.500 EUR/Mo

Preise sind Richtwerte für On-Demand-Instanzen (Stand März 2026). Mit Reserved Instances oder Spot-Preisen lassen sich 30-60% sparen. On-Premise rechnet sich ab etwa 18 Monaten Laufzeit — vorausgesetzt, Sie haben die GPU-Hardware bereits oder können sie beschaffen.


Häufig gestellte Fragen

Kann Ollama auf Kubernetes ohne GPU laufen?

Ja, Ollama unterstützt CPU-only Inference. Für Produktions-Workloads ist das aber nicht empfehlenswert — ein Mistral 7B generiert auf CPU nur ~2-5 Tokens pro Sekunde statt 30-80 auf einer T4 GPU. Für Dev/Test-Umgebungen oder sehr kleine Modelle (3B) kann CPU-Inference ausreichen.

Welche Quantisierung soll ich wählen?

Q4_K_M ist der beste Kompromiss: 70% weniger VRAM bei nur ~5% Qualitätsverlust. Für Coding-Aufgaben oder mathematische Probleme empfehlen wir Q6_K oder Q8, da Quantisierung hier stärker auffällt. FP16 lohnt sich nur, wenn Sie genug VRAM haben und maximale Qualität brauchen.

Wie viele gleichzeitige Nutzer kann ein Ollama-Pod bedienen?

Das hängt von der GPU und der akzeptablen Latenz ab. Eine T4 mit Mistral 7B schafft ~30 Tokens/s — das reicht für 3-5 gleichzeitige Chats mit akzeptabler Antwortzeit. Eine A100 schafft ~80 Tokens/s und bedient 8-15 parallele Anfragen. Für mehr skalieren Sie horizontal über Replicas.

Ollama oder vLLM für Kubernetes-Inference?

Ollama ist einfacher zu deployen und ideal für Teams, die schnell starten wollen. vLLM bietet höheren Throughput durch PagedAttention und Continuous Batching — bei 50+ gleichzeitigen Anfragen kann vLLM 2-3x schneller sein. Unsere Empfehlung: Starten Sie mit Ollama, wechseln Sie zu vLLM wenn der Throughput nicht reicht.

Was kostet Ollama auf Kubernetes im Monat?

Ein typisches Setup mit Mistral 7B, 2 Replicas für HA und einer T4-GPU pro Node kostet auf Azure ~760 EUR/Monat. Auf AWS mit g4dn.xlarge ~680 EUR/Monat. Die Software (Ollama + Kubernetes) ist kostenlos — Sie zahlen nur für die Infrastruktur.


Weiterführende Ressourcen


Kubernetes Beratung — GPU-Cluster und LLM-Inference


Private KI-Infrastruktur für Unternehmen


Ollama vs. vLLM vs. TGI: Inference Engines im Vergleich


Private AI in 30 Minuten: Ollama + Open WebUI auf Ubuntu


LibreChat vs Open WebUI: Self-Hosted KI-Chat im Vergleich

Ihre Experten

Wir verbinden strategisches Know-how mit technologischer Exzellenz.

Phillip Pham

Geschäftsführer

 

Max Hennig

Cluster Lead OCR

100% unverbindlich mit echtem Mehrwert

Aktuelles Fachwissen zu Data & AI

Beratungsgespräch

Sichern Sie sich Ihre kostenfreie Erstberatung

Analyse Ihres individuellen Bedarfs
Erste Empfehlungen zu passenden Produkten und Umsetzungsstrategien
Transparente Einblicke in unsere Methoden, Technologien & Referenzen

Sie suchen einen Partner für Ihr Projekt?

Wir geben unser Bestes, um Sie zufriedenzustellen.

Auf der Suche nach einem spannenden Job?

Schau dir jetzt unsere offenen Stellen an und finde deinen neuen Job bei Pexon.