KV-Cache frisst VRAM mit jedem Token und jedem parallelen Nutzer. Warum eine 24-GB-Karte bei 8k reicht und bei 128k scheitert — und was Sie an der GPU-Wahl ändern.
AMD für lokale KI 2026: RX 9070 XT mit 16 GB gegen RX 7900 XTX mit 24 GB, ROCm unter Linux, Vulkan unter Windows — und wann NVIDIA die einfachere Karte bleibt.
Eine gebrauchte RTX 3090 bietet 24 GB VRAM für lokale LLMs. Wir analysieren Preis-Leistung, Risiken und zeigen, für welche KI-Modelle sie sich 2026 lohnt.