GPU-Scheduling auf Kubernetes: Queue vor der Karte
GPU-Scheduling auf Kubernetes von Pexon Consulting klärt für Plattform-Teams mit knapper GPU-Flotte, wer wann die Karte bekommt: Kueue stellt Jobs in Quotas, Time-Slicing und MIG schneiden die Hardware, DRA vergibt das Gerät. NVIDIA A100 MIG teilt eine Karte in bis zu sieben Instanzen. Pexon Consulting baut den nachvollziehbaren Betrieb, ohne eine 69-Prozent-Branchenzahl zu versprechen.
Warum First-Apply ohne Queue teuer wird
Für Plattform-Teams mit knapper GPU-Flotte: ohne Queue startet Training auf derselben Node-Gruppe wie vLLM. Der Chat wird langsam, das Training ist nicht fertig, im Audit fehlt, wer die Karte hielt. NVIDIA A100 MIG teilt eine Karte in bis zu sieben Instanzen.
Was Queue und Schnitt belegen, ohne 69-Prozent-Branchenzahl
Zahlen aus NVIDIA-Docs und dem Festpreis. Keine 69-Prozent-Branchenzahl, keine erfundenen GPU-Euro.
Ab wann sich GPU-Scheduling auf Kubernetes lohnt
Wo die GPU wartet, und wo sie reserviert bleibt
Kueue vor Training und Batch
Teams bekommen GPU-Budget im Cluster. Jobs ohne Team- und Modell-Label bleiben in der Queue oder fallen durch Admission.
MIG wo Isolation zählt
Hardware-Scheiben zwischen Teams. Time-Slicing nur wo Latenz das aushält. Volle Karte für Training mit großem Kontext.
vLLM auf reserviertem Pool
Serving als Deployment. Kueue hält Training davon fern. Die Engine steht auf der Inferenz-Seite, nicht hier.
Nachweis im Audit
Wer hatte die GPU, welches Modell, welche Datenresidenz des Checkpoints. Ohne Label kein Schedule.
Passt Kueue auf Ihre GPU-Nodes?
Die Queue muss auf GPU-Operator, Node-Pools und Serving-Pools passen, auf AKS ebenso wie on-prem.
Queue und Label
Schnitt und Serving
Wie Kueue funktioniert
Wann braucht GPU-Sharing auf Kubernetes eine Queue?
Wie läuft der GPU-Scheduling-Pilot in sechs Wochen?
Time-Slicing, MIG oder volle GPU, eine Queue davor
Time-Slicing gewinnt nicht immer. Kueue entscheidet wer wartet. vLLM läuft daneben, nicht durch die Queue. Keine 69-Prozent-Zahl.
| Schnitt | Was er teilt | Isolation | Passt, wenn |
|---|---|---|---|
| Time-Slicing | Viele kleine Workloads auf einer Karte | Weich, kein Speicher-/Fault-Isolation | Dev, kleine Inferenz, Latenz darf wackeln |
| MIG | Hardware-Scheiben auf einer Karte | Härter, eigene GPU-Instanz, A100 bis 7 | Störungswände zwischen Teams |
| Volle GPU | Eine Karte, ein Job | Maximal | Training, großer Kontext |
| Kueue davor | Wer die Karte bekommt | Quota und Fair-Share, kein Gerät | Training und Batch, nicht der Chat |
| Passt, wenn | Sie teilen müssen | Sie Isolation nachweisen müssen | Sie Idle senken und den Audit bestehen wollen |
Was kostet Kueue-GPU-Scheduling bei Pexon Consulting?
Der Pilot gilt für einen GPU-Cluster: Queue, Schnitt, Label, Nachweis. Endpreis nach Scoping, wenn mehrere Pools oder ein Hardware-Kauf dazukommen.
Enthalten · Kueue-Pfad, Schnitt-Entscheidung, Nachweis, Übergabe.
Einstieg · Architektur-Sprechstunde ab 450 EUR, 90 Minuten.
Nicht enthalten · GPU-Kauf, 69-Prozent-Versprechen, 24/7. Hardware auf der GPU-Cluster-Seite. Foundation ab 30.000 EUR.
Häufige Fragen zu GPU-Scheduling und Kueue
Was ist Kueue auf Kubernetes?
GPU Time-Slicing oder MIG?
Was kostet GPU-Scheduling mit Kueue?
Läuft das auf Azure Kubernetes Service?
Senkt das die GPU-Kosten automatisch um zwei Drittel?
Soll Inferenz durch Kueue laufen?
Nachricht senden
Kein passender Termin? Schreiben Sie uns, wir melden uns innerhalb von 24 Stunden.
Sie suchen einen Partner für Ihr Projekt?
Wir analysieren Ihren individuellen Bedarf, geben erste Empfehlungen zu Umsetzungsstrategien und bieten Ihnen transparente Einblicke in unsere Methoden, Technologien und Referenzen.
Vertrieb kontaktieren

