Published on2. August 2026Mamba-Hybrid: KV-Cache bei langem Kontextllm-inferenzvramself-hostedragmittelstanddeutschlandDer KV-Cache frisst bei 32k Kontext mehr VRAM als das Modell selbst. Was Mamba-Hybride wie Soofi S daran ändern — und wann FP8 die billigere Antwort ist.
Published on2. August 2026MoE erklärt: warum 30B nicht 30B VRAM brauchtmoellmgpuvrammittelstanddeutschlandEin 30B-MoE belegt die vollen 19 GB VRAM — sparsam ist nur die Rechenlast pro Token. Die Speicherrechnung Posten für Posten, mit Modelltabelle.