VRAM ist der Engpass für lokale KI. Dieser Leitfaden zeigt vier Wege, wie Mittelständler ihren GPU-Speicher erhöhen können – und warum BIOS-Tricks und Registry-Hacks nicht funktionieren.
Die Community erzielt auf dem NVIDIA DGX Spark mit Qwen3.8-27B und NVFP4-Quantisierung 34–38 Tokens pro Sekunde — rund 30 % schneller als mit FP8 bei kleinerem Speicherbedarf. Was Mittelständler über NVFP4, SGLang und die Stolperfallen wissen müssen.