Blog
GPUs auf Kubernetes: was man vorher wissen sollte
Was vor dem Anbinden einer GPU an einen Cluster zu wissen ist: Device Plugin, GPU Operator, MIG oder Time-Slicing, Quotas und Observability.
Hidora-Artikel vom 17. März 2026. Zahlen, Preise und Vergleiche gelten zu diesem Datum.
Der Blickwinkel dieses Artikels: was eine Entscheiderin klären muss, bevor ein GPU-Cluster eröffnet wird, wozu es dient, was es in der Organisation ändert, was es an Kompetenzen kostet. Er enthält keine Anleitung. Für das Teilen zwischen Teams Schritt für Schritt siehe MIG, Time-Slicing und Quoten; für die Kosten je Job GPU-FinOps.
Einleitung
Die Verbreitung von KI-Workloads, Modelltraining, Inferenz im grossen Massstab, hybride Pipelines, beschleunigt die Nachfrage nach GPUs in Cloud- und On-Premises-Umgebungen. Während Unternehmen ihre KI-Plattformen industrialisieren wollen, setzt sich Kubernetes als Referenz-Orchestrator durch, um Deployment, Skalierbarkeit und Zuteilung der Beschleuniger zu vereinen. In einem Umfeld, in dem GPUs knappe und teure Ressourcen bleiben, wird ihre effiziente Nutzung zu einer strategischen Frage von Leistung und Kostenkontrolle.
Angesichts dieser Anforderungen legen mehrere Akteure des Kubernetes-Ökosystems, Hardwarehersteller, Anbieter von KI-Operatoren, Cloud-Provider, gute Praktiken und technische Bausteine für die Optimierung der GPU-Nutzung dar. Diese Empfehlungen reichen von der Knotenkonfiguration über die Netzabstimmung bis zur Ressourcen-Governance und Observability.
GPU-Unterstützung ist in Kubernetes inzwischen strukturiert
Seit der Stabilisierung des Device Plugin Framework stellt Kubernetes spezialisierte Hardwareressourcen standardisiert bereit, darunter GPUs von NVIDIA und AMD sowie weitere Beschleuniger. NVIDIA gibt an, dass sein GPU Operator, inzwischen die bevorzugte Methode zur Einbindung von GPUs in einen Cluster, die Installation der Treiber, der CUDA-Runtime, des Device Plugin und von Monitoring-Werkzeugen wie DCGM (Data Center GPU Manager) automatisiert. Der Operator erkennt die auf jedem Knoten vorhandenen GPUs und veröffentlicht sie als Ressourcen nvidia.com/gpu, die Pods über eine einfache Ressourcenanforderung nutzen.
Diese native Einbindung erlaubt dem Scheduler, KI-Lasten auf passenden Knoten zu platzieren und die exklusive Zuteilung einer oder mehrerer GPUs je Container zu sichern. Leichte Inferenzlasten können auf Funktionen wie Multi-Instance GPU (MIG) setzen, verfügbar auf den NVIDIA-Architekturen A100 und H100, während verteiltes Training mehrere GPUs innerhalb eines Knotens oder über Knoten hinweg nutzen kann.
Das Aufkommen alternativer Beschleuniger (AMD Instinct, Habana Gaudi, eigene NPUs) bewegt die Anbieter ebenfalls dazu, eigene Device Plugins zu veröffentlichen, was die Fähigkeiten von Kubernetes in diesem Bereich erweitert.
Wesentliche technische Konfiguration für maximale Leistung
1. Die GPU-Knoten vorbereiten
Die gute Praxis empfiehlt:
eine GPU-fähige Runtime wie containerd mit NVIDIA Container Runtime,
eine Kernel- und Treiberversion, die zum verlangten CUDA-Stack passt,
das Aktivieren schneller Interconnects wie PCIe Gen4/Gen5 oder NVLink, wo verfügbar,
lokale NVMe-Volumes, um die Zugriffslatenz auf die Datensätze zu minimieren.
In verteilten Umgebungen sollten KI-Knoten idealerweise über Netzschnittstellen mit RDMA oder RoCEv2 verfügen, was die Synchronisation zwischen GPUs bei parallelem Training beschleunigt (DeepSpeed, Horovod, Megatron-LM und weitere).
2. Kubernetes für optimales Scheduling konfigurieren
Kubernetes bietet mehrere Mechanismen zur Optimierung der Platzierung:
NodeFeatureDiscovery (NFD), um Hardwarefähigkeiten zu erkennen und Labels zu setzen,
Affinitäten und Anti-Affinitäten, um GPU-Lasten kontrolliert zu verteilen,
Taints und Tolerations, um GPU-Knoten von Nicht-KI-Lasten abzuschirmen,
Topology Manager, um CPU, Speicher und GPU auf NUMA-Ebene auszurichten,
passende Pod Resource Requests (weder zu gross noch zu klein).
NVIDIA hält zudem fest, dass Time-Slicing oder GPU-Sharing Inferenzlasten oder Mehrbenutzerumgebungen vorbehalten bleiben sollte und für latenzempfindliches verteiltes Training nicht zu empfehlen ist.
3. Machine-Learning-Lasten orchestrieren
Mehrere Operatoren erweitern Kubernetes für intensive Lasten:
Kubeflow Training Operator für Jobs mit TensorFlow, PyTorch oder MXNet,
Ray für verteilte Inferenz oder parallelisierte Rechenpipelines,
MPI Operator für HPC-Lasten mit Bedarf an knotenübergreifender Kommunikation mit tiefer Latenz.
Diese Operatoren übernehmen nativ das Anlegen der Worker, die Synchronisation, die Wiederaufnahme nach einem Vorfall und die Verwaltung der auf NVMe oder verteiltem Storage abgelegten Checkpoints (CephFS, Longhorn, Lustre und weitere). Sie automatisieren zudem die horizontale Skalierung und Multi-GPU-Szenarien.
4. Observability und GPU-Monitoring
Zur Leistungsoptimierung empfehlen die Anbieter folgende Komponenten:
DCGM Exporter, um präzise GPU-Metriken zu erfassen, SM-Auslastung, Speicher, NVLink, Temperatur, ECC-Fehler,
Prometheus und Grafana, um Auslastungsgrade sichtbar zu machen und Engpässe zu erkennen,
die Analyse des NVMe-Durchsatzes, um I/O-gebundene Lasten zu erkennen,
die Netzüberwachung, um eine für grosse Modelle taugliche Latenz zwischen Knoten zu sichern.
Mit diesen Metriken lassen sich Batch-Grössen anpassen, die Platzierung der Pods neu festlegen oder Ressourcen zwischen Training und Inferenz umverteilen.
Wirkung und Nutzen für Unternehmen
Eine optimierte GPU-Architektur auf Kubernetes bringt mehrere konkrete Gewinne:
höhere Leistung bei verteiltem Training und hochfrequenter Inferenz,
tiefere Kosten durch feingranulare GPU-Zuteilung und die Möglichkeit, Beschleuniger über MIG zu partitionieren,
bessere Lastdichte in Multi-Tenant-Umgebungen,
stärkere Governance über ResourceQuota, LimitRange oder Policies von Gatekeeper und Kyverno,
Zuverlässigkeit dank der nativen Selbstheilungs- und Rescheduling-Mechanismen von Kubernetes.
Unternehmen in sensiblen Branchen, Finanzwesen, Gesundheit, Industrie, Forschung, Cybersicherheit, erhalten damit eine stabilere Plattform, um ihre KI-Lösungen zu entwickeln und zu betreiben.
Fazit, ein wesentlicher Baustein moderner KI-Plattformen
Die Verbindung von Kubernetes und GPUs bildet heute ein zentrales Fundament für KI-Architekturen. In einem Markt, in dem Modelle komplexer werden und die Nachfrage die Verfügbarkeit der Beschleuniger regelmässig übersteigt, wird die Optimierung des Clusters zu einem Schlüsselelement von Leistung und Betriebskontrolle. Die von den Herstellern angekündigten nächsten Schritte: verbessertes topologiebewusstes Scheduling, breitere Unterstützung heterogener Beschleuniger und das Erstarken der MLOps-Operatoren, bestätigen diesen Weg.
IT-Verantwortliche und technische Teams verfügen heute über sämtliche Bausteine, um eine robuste, skalierbare und optimierte KI-Plattform aufzubauen. In diesem Zusammenhang sind Kubernetes-Umgebungen mit GPUs, intern betrieben oder über einen souveränen Cloud-Anbieter, ein wesentlicher Hebel, um KI-Lasten der nächsten Generation zu industrialisieren.
Weiterlesen
Bereit für 100 % Schweizer Infrastruktur?
14-Tage-Trial, keine Karte. GPUs inklusive.