- Published on
Die Community erzielt auf dem NVIDIA DGX Spark mit Qwen3.8-27B und NVFP4-Quantisierung 34–38 Tokens pro Sekunde — rund 30 % schneller als mit FP8 bei kleinerem Speicherbedarf. Was Mittelständler über NVFP4, SGLang und die Stolperfallen wissen müssen.