- Published on
KubeVirt für GPU-Clouds: Multi-Tenant mit DRA und NUMA
- Authors

- Name
- Phillip Pham
- @ddppham
KubeVirt: Virtualisierung als Tenancy-Layer für GPU-Workloads
TL;DR
AI-Workloads sprengen klassische Kubernetes-GPU-Muster. Statische Device-Plugins weisen eine GPU fest zu — bis jemand manuell eingreift. Für Teams, die zwischen Passthrough, vGPU und MIG wechseln müssen, ist das zu starr. Die Antwort: DRA für flexible Zuweisung und KubeVirt als Tenancy-Layer — ein Control Plane für Container und VMs, mit NUMA-Topology-Awareness für echte Performance.
Was KubeVirt ist
KubeVirt ist ein Virtualisierungs-Add-on auf Kubernetes. VMs laufen innerhalb von Containern (QEMU/KVM). Ergebnis: ein gemeinsames Control Plane für Container und VMs — statt zwei paralleler Welten. Der Release-Zyklus ist an Kubernetes angeglichen; CNCF-Graduation rückt näher, Produktions-Adoption ist bereits breit.
Warum AI die GPU-Verwaltung bricht
Das alte Muster: Device-Plugin → GPU fest einer Allokationsart zugewiesen. Das AI-Problem: Workloads brauchen Flexibilität — mal Passthrough für volle Leistung, mal vGPU für Teilung, mal MIG für Isolation. Statische Zuweisung bremst Velocity und verschwendet teure Karten.
DRA (Dynamic Resource Allocation) präsentiert Geräte dem Scheduler als verfügbar. Workloads fragen „Rezepte" an; die Zuweisung erfolgt dynamisch. NVIDIA hat seinen DRA-Driver an die Open-Source-Community gespendet — das Ökosystem wächst nicht nur vendor-intern.
Multi-Tenant-Architektur
Der häufigste Einsatz bei GPU-Cloud-Betreibern:
Kubernetes (Basis)
└── KubeVirt (Tenancy / Virtualisierung)
└── Tenant-VMs
└── Kubernetes in der VM → Pods nutzen GPUs
- Betreiber stellen KubeVirt bereit und geben Tenants VMs.
- In den VMs läuft eigenes Kubernetes — Pods greifen kontrolliert auf GPUs zu.
- Alternativ (Serverless/Security): KubeVirt-VM als Kernel-Wrapper um Workloads — VM-Grenze statt reiner Container.
KubeVirt 1.8 bringt Alpha-Support für GPU via DRA: Passthrough, vGPU und MIG in virtualisierten Umgebungen — Ziel: GPUs in VMs so flexibel wie an Pods.
NUMA ist kein Detail
Für leistungssensible AI/ML- und HPC-Workloads muss die NUMA-Alignment von GPU und NIC stimmen. Falsche Topologie bricht Throughput und Latenz. Topology-Awareness stellt sicher, dass Geräte auf dem richtigen NUMA-Knoten landen — Voraussetzung für ernsthafte AI-Adoption, nicht Nice-to-have. Das schließt an CDI/DRA und PCIe-Alignment an.
Die ehrliche Einordnung:
- Statische GPU-Allokation ist der Flaschenhals — AI-Velocity braucht DRA.
- KubeVirt reift weiter — Graduation und Release-Disziplin beachten.
- NUMA falsch = Performance tot — Architektur-Arbeit, kein Tuning-Afterthought.
- Virtualisierung hat Overhead — nur wo Tenancy oder Security es erfordern.
- DRA in VMs ist noch jung — Alpha/Beta mitplanen, nicht als fertig verkaufen.
Häufige Fragen
Brauchen wir KubeVirt für jede KI-Plattform?
Nein. Für einen Team-Cluster mit klaren Pods reicht oft GPU-Partitionierung. KubeVirt lohnt bei Multi-Tenant-GPU-Clouds oder harter Mandanten-Isolation.
Container oder VM für Agents?
Wo untrusted Code läuft, helfen VM-Grenzen — vgl. Kata/Agent Sandbox. KubeVirt ist die Orchestrierungs-Schicht dafür auf Kubernetes.
Ist DRA produktionsreif?
Für viele GPU-Use-Cases auf dem Cluster-Level ja/nahe. In KubeVirt-VMs noch früher im Lebenszyklus — schrittweise einführen.
Fazit
Wer eine GPU-Cloud (privat oder als interner Shared Service) baut, braucht eine saubere Tenancy-Ebene und flexible GPU-Zuweisung. KubeVirt plus DRA liefern genau das — mit NUMA als Performance-Fundament.
Ergänzend: AI at Scale und NVIDIA GPU-Server-Familien. Wir beraten, ob KubeVirt+DRA zu Ihrer Tenancy-Strategie passt, und betreiben die Architektur mit Topology-Optimierung und Audit.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
GPU in Containern: CDI, Sharing-Strategien und DRA
GPUs in Containern brauchen CDI. Time-Slicing, MPS und MIG haben klare Trade-offs. DRA ersetzt starre Device-Plugins — der Deep-Dive für effizienten GPU-Betrieb.
Kubernetes für AI at Scale: von Cloud Native zu Accelerator Native
66 % der Kubernetes-Organisationen hosten GenAI. DRA, LLMD und Inference Gateway machen Hardware-Topologie zum Kern — der Leitfaden für KI-Plattformen auf Kubernetes.
Vom Docker-Compose-Pilot auf Kubernetes: wann es fällig ist
Compose trägt weiter als gedacht. Die vier Auslöser für den Umzug — und warum die meisten Mittelständler ihn nicht brauchen.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)