Kubernetes · KI-Plattform-Betrieb

GPU-Scheduling auf Kubernetes: Queue vor der Karte

Kurz gesagt

GPU-Scheduling auf Kubernetes von Pexon Consulting klärt für Plattform-Teams mit knapper GPU-Flotte, wer wann die Karte bekommt: Kueue stellt Jobs in Quotas, Time-Slicing und MIG schneiden die Hardware, DRA vergibt das Gerät. NVIDIA A100 MIG teilt eine Karte in bis zu sieben Instanzen. Pexon Consulting baut den nachvollziehbaren Betrieb, ohne eine 69-Prozent-Branchenzahl zu versprechen.

ISO 27001 zertifiziert
Kueue und Fair-Share
vLLM danach, nicht davor
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner

Warum First-Apply ohne Queue teuer wird

Für Plattform-Teams mit knapper GPU-Flotte: ohne Queue startet Training auf derselben Node-Gruppe wie vLLM. Der Chat wird langsam, das Training ist nicht fertig, im Audit fehlt, wer die Karte hielt. NVIDIA A100 MIG teilt eine Karte in bis zu sieben Instanzen.

Kein Fair-Share
Ein Team füllt die Queue, die anderen warten ohne Regel. Kueue gibt Quota und Priorität, nicht eine Karte auf Dauer.
Time-Slicing als Allheilmittel
Time-Slicing isoliert Speicher und Faults nicht. Wer Störungswände braucht, nimmt MIG. Wer Kontextfenster trainiert, nimmt die volle Karte.
Inferenz durch die Queue
vLLM ist ein Deployment. Wer den Chat durch Kueue schickt, kauft Fairness mit Latenz. Serving-Pools bleiben reserviert.

Was Queue und Schnitt belegen, ohne 69-Prozent-Branchenzahl

Zahlen aus NVIDIA-Docs und dem Festpreis. Keine 69-Prozent-Branchenzahl, keine erfundenen GPU-Euro.

bis 7 MIG-Instanzen auf A100
Hardware-Scheiben mit klarerer Störungswand als Time-Slicing. Time-Slicing bleibt für Dev und kleine Inferenz, wenn Latenz wackeln darf. (NVIDIA A100 MIG, bis zu 7 Instanzen)
3 Schnitte Time-Slicing, MIG, volle GPU
Die Queue entscheidet wer wartet. Der Schnitt entscheidet wie hart die Karte geteilt wird. Time-Slicing gewinnt nicht immer. (NVIDIA GPU Operator Docs, Time-Slicing ohne Speicher-/Fault-Isolation)
450 EUR Einstieg Sprechstunde
90 Minuten klären Queue, Schnitt und ob vLLM überhaupt durch Kueue darf. Danach der Pilot, nicht ein Kostensatz aus der Luft. (Pexon Festpreis Architektur-Sprechstunde)
14.500 EUR Pilot ein Cluster
Sechs Wochen: Kueue, Label, Schnitt, Nachweis. Auslastung vorher/nachher am Cluster, oder die Zahl entfällt. (Pexon Festpreis, analog Cilium-Pilot)

Ab wann sich GPU-Scheduling auf Kubernetes lohnt

GPU-Scheduling auf Kubernetes lohnt sich, sobald drei Teams sich eine kleine GPU-Flotte teilen und im Audit jemand erklären muss, warum Modell A gewartet hat. Ohne Queue gewinnt, wer zuerst das Manifest applyt. Kueue ist eine Kubernetes-native Job-Queue: Teams bekommen ein Budget an GPU-Kapazität, nicht eine Karte auf Dauer. Time-Slicing teilt weich und ohne Speicher- oder Fault-Isolation, so die GPU-Operator-Dokumentation. MIG schneidet Hardware-Scheiben, auf A100 bis zu sieben Instanzen. Die volle Karte bleibt für Training und großen Kontext. vLLM läuft als Deployment auf reservierten Pools, nicht durch die Queue, sonst kaufen Sie Fairness mit Chat-Wartezeit. Hardware, Operator und Azure-NC stehen auf der GPU-Cluster-Seite. Queue und Fair-Share klären, wer wann darf. DRA vergibt das Gerät, sobald der Cluster das Feature trägt, bis dahin bleibt der Device-Plugin-Pfad. Pexon Consulting verspricht keine automatische Kostensenkung um zwei Drittel und keine erfundenen GPU-Euro. Auslastung zeigen wir vorher und nachher am Cluster, oder die Zahl entfällt. Servicezeit Mo-Fr 08:00-18:00 MEZ, kein 24/7. Stand 30. August 2026.
1 Queue
sonst gewinnt das erste Manifest
7 MIG
Instanzen auf einer A100, Maximum
0 vLLM
durch die Queue, Serving bleibt Pool

Wo die GPU wartet, und wo sie reserviert bleibt

Use Case 01

Kueue vor Training und Batch

Teams bekommen GPU-Budget im Cluster. Jobs ohne Team- und Modell-Label bleiben in der Queue oder fallen durch Admission.

1 Quota pro Team, nicht eine Karte auf Dauer
Use Case 02

MIG wo Isolation zählt

Hardware-Scheiben zwischen Teams. Time-Slicing nur wo Latenz das aushält. Volle Karte für Training mit großem Kontext.

bis 7 Instanzen auf A100, nicht auf jeder GPU-Generation
Use Case 03

vLLM auf reserviertem Pool

Serving als Deployment. Kueue hält Training davon fern. Die Engine steht auf der Inferenz-Seite, nicht hier.

2 Schichten: Gateway wählt das Modell, Queue wählt die Karte
Use Case 04

Nachweis im Audit

Wer hatte die GPU, welches Modell, welche Datenresidenz des Checkpoints. Ohne Label kein Schedule.

1 nachvollziehbare Zuteilung statt Idle-Folie

Passt Kueue auf Ihre GPU-Nodes?

Die Queue muss auf GPU-Operator, Node-Pools und Serving-Pools passen, auf AKS ebenso wie on-prem.

Queue und Label

Kueue · Quota, Priorität, Suspend für Training und Batch-Eval.
Admission · Ohne Team-, Modell- und Datenklasse-Label kein Schedule.
Fair-Share · Ein Team darf die Queue nicht dauerhaft füllen.

Schnitt und Serving

Time-Slicing · Weich, gemeinsam, keine Speicher-/Fault-Isolation.
MIG · Härter, eigene GPU-Instanz, A100 bis sieben Scheiben.
vLLM-Pool · Reserviert, nicht durch die Queue, Engine auf der Inferenz-Seite.

Wie Kueue funktioniert

1
Flotte und Jobs sehen
Welche GPUs, welche Teams, ob vLLM schon auf denselben Nodes steht.
2
Schnitt wählen
Time-Slicing, MIG oder volle Karte, Tabelle zuerst.
3
Quota setzen
Budget pro Team, Label-Pflicht, Fair-Share.
4
Serving trennen
Inferenz-Pool reservieren, Training in die Queue.
5
Nachweis schreiben
Wer hielt die Karte, welches Modell, welcher Checkpoint-Ort.
6
Betrieb anbinden
Servicezeit Mo-Fr 08:00-18:00 MEZ. Nachts wartet die Quota, nicht ein NOC.
Erfahren Sie mehr über GPU-Cluster

Wann braucht GPU-Sharing auf Kubernetes eine Queue?

Inhouse-Apply
Wer zuerst applyt, hält die Karte.
Kein Label, Audit ohne Antwort.
Training verdrängt vLLM ohne Regel.
Nur Operator-Install
Treiber sitzen, Queue fehlt.
Time-Slicing als Default ohne Isolation.
Branchenzahl 69 Prozent ohne eigene Messung.
Mit Pexon
Queue, Schnitt, Nachweis, Zahl nur vom Cluster.
MIG bis 7 auf A100 laut NVIDIA, keine erfundenen Euro.
Pilot 14.500 EUR, 6 Wochen, ein Cluster. Sprechstunde ab 450 EUR.

Wie läuft der GPU-Scheduling-Pilot in sechs Wochen?

1
90 Min
Sprechstunde
Queue, Schnitt, Serving-Trennung, 450 EUR Festpreis.
2
Woche 1-2
Bestand
GPUs, Teams, ob Inferenz auf denselben Nodes läuft.
3
Woche 3-5
Queue
Kueue, Label, MIG oder Time-Slicing, Serving-Pool.
4
Woche 6
Übergabe
Nachweis, Auslastung vorher/nachher oder bewusst keine Zahl.

Time-Slicing, MIG oder volle GPU, eine Queue davor

Time-Slicing gewinnt nicht immer. Kueue entscheidet wer wartet. vLLM läuft daneben, nicht durch die Queue. Keine 69-Prozent-Zahl.

SchnittWas er teiltIsolationPasst, wenn
Time-SlicingViele kleine Workloads auf einer KarteWeich, kein Speicher-/Fault-IsolationDev, kleine Inferenz, Latenz darf wackeln
MIGHardware-Scheiben auf einer KarteHärter, eigene GPU-Instanz, A100 bis 7Störungswände zwischen Teams
Volle GPUEine Karte, ein JobMaximalTraining, großer Kontext
Kueue davorWer die Karte bekommtQuota und Fair-Share, kein GerätTraining und Batch, nicht der Chat
Passt, wennSie teilen müssenSie Isolation nachweisen müssenSie Idle senken und den Audit bestehen wollen

Was kostet Kueue-GPU-Scheduling bei Pexon Consulting?

Der Pilot gilt für einen GPU-Cluster: Queue, Schnitt, Label, Nachweis. Endpreis nach Scoping, wenn mehrere Pools oder ein Hardware-Kauf dazukommen.

Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner
Ihre Investition
ab 14.500 EUR
Festpreis · 6 Wochen · ein Cluster
Enthält:

Enthalten · Kueue-Pfad, Schnitt-Entscheidung, Nachweis, Übergabe.

Einstieg · Architektur-Sprechstunde ab 450 EUR, 90 Minuten.

Nicht enthalten · GPU-Kauf, 69-Prozent-Versprechen, 24/7. Hardware auf der GPU-Cluster-Seite. Foundation ab 30.000 EUR.
Jetzt Kontakt aufnehmen
100 % unverbindlich, ohne Verpflichtung

Häufige Fragen zu GPU-Scheduling und Kueue

Was ist Kueue auf Kubernetes?

Kueue auf Kubernetes von Pexon Consulting ist ein Scheduler für Jobs mit Quotas. Teams bekommen ein Budget an GPU-Kapazität im Cluster, nicht eine Karte auf Dauer. Training und Auswertung warten in der Queue. Inferenz-Services laufen daneben auf reservierten Pools. Ohne Queue gewinnt, wer zuerst das Manifest applyt.
GPU Time-Slicing oder MIG?

Time-Slicing, wenn viele kleine Inferenz- oder Dev-Workloads sich eine Karte teilen und Isolation weich sein darf. MIG, wenn Sie Hardware-Scheiben und klarere Störungswände brauchen. Volle Karte für großes Training. Die Wahl steht in einer Tabelle, Time-Slicing gewinnt nicht immer.
Was kostet GPU-Scheduling mit Kueue?

Die Architektur-Sprechstunde kostet 450 EUR Festpreis für 90 Minuten. Der Umsetzungs-Pilot für einen Cluster liegt bei 14.500 EUR über sechs Wochen. Foundation-Aufbau beginnt bei 30.000 EUR. Endpreis nach Scoping, wenn Hardware-Kauf oder mehrere Pools dazukommen.
Läuft das auf Azure Kubernetes Service?

Ja, auf GPU-Node-Pools. Der Operator installiert Treiber, Kueue läuft als Controller, Azure stellt die VM-Größe. Der Nachweis (Quota, Label, wer die Karte hielt) ist Ihr Betrieb, nicht ein Azure-Häkchen. Hardware und Operator bleiben auf der GPU-Cluster-Seite.
Senkt das die GPU-Kosten automatisch um zwei Drittel?

Nein. Sie senken Idle, wenn Queue und Schnitt sitzen und die Teams Limits einhalten. Branchenzahlen zu 69 Prozent Overprovisioning sind nicht unsere Messung. Wir zeigen Auslastung vorher und nachher am Cluster, oder wir lassen die Zahl weg.
Soll Inferenz durch Kueue laufen?

Meist nein. vLLM und vergleichbare Serving-Engines laufen als Deployment auf reservierten Pools. Kueue hält Training und Batch-Eval davon fern. Time-Slicing nur, wo Latenz das aushält. Wer den Chat durch die Queue schickt, kauft Fairness mit Wartezeit.

GPU-Betriebscheck anfragen

Die Flotte ist knapp, die Queue fehlt, die Branchenzahl hilft nicht. 90 Minuten Sprechstunde zu Queue, Schnitt und Nachweis, danach der Review-Termin.

Jetzt Kontakt aufnehmen

Nachricht senden

Kein passender Termin? Schreiben Sie uns, wir melden uns innerhalb von 24 Stunden.

Antwort innerhalb von 24 Stunden
Unverbindliches Erstgespräch
Persönlicher Ansprechpartner
Phillip Pham
Phillip Pham
CEO @ Pexon Consulting
Aktualisiert am 30. August 2026

Sie suchen einen Partner für Ihr Projekt?

Wir analysieren Ihren individuellen Bedarf, geben erste Empfehlungen zu Umsetzungsstrategien und bieten Ihnen transparente Einblicke in unsere Methoden, Technologien und Referenzen.

Vertrieb kontaktieren
Microsoft Solutions Partner (Digital & App Innovation, Infrastructure Azure, Data & AI Azure), ISO/IEC 27001, Google Cloud Partner, AWS Partner
400+Projekte seit 2020
100+Kunden im DACH-Raum
ISO27001 zertifiziert
3Hyperscaler Partner