KV-Cache frisst VRAM mit jedem Token und jedem parallelen Nutzer. Warum eine 24-GB-Karte bei 8k reicht und bei 128k scheitert — und was Sie an der GPU-Wahl ändern.
AMD für lokale KI 2026: RX 9070 XT mit 16 GB gegen RX 7900 XTX mit 24 GB, ROCm unter Linux, Vulkan unter Windows — und wann NVIDIA die einfachere Karte bleibt.
Rund 90 % der Modell-Lebenszeit ist Inference. Kosten, Strom und Latenz entscheiden über Hardware, Quantisierung und Middleware — der Leitfaden für den Mittelstand.
Modell allein reicht nicht. Fünf Schichten — Infrastruktur, Modell, Daten/RAG, Orchestrierung, Application — entscheiden über Qualität, Tempo, Kosten und Sicherheit.