Modell allein reicht nicht. Fünf Schichten — Infrastruktur, Modell, Daten/RAG, Orchestrierung, Application — entscheiden über Qualität, Tempo, Kosten und Sicherheit.
GPUs in Containern brauchen CDI. Time-Slicing, MPS und MIG haben klare Trade-offs. DRA ersetzt starre Device-Plugins — der Deep-Dive für effizienten GPU-Betrieb.
AI bricht starre GPU-Allokation. KubeVirt als Tenancy-Layer plus DRA ermöglicht flexible Passthrough-, vGPU- und MIG-Zuweisung in Multi-Tenant-GPU-Clouds.