Published on4. August 2026Welche GPU für welches Modell — Kosten je Million TokengpukostenvraminferenztcomittelstanddeutschlandDie Rechnung vor jedem GPU-Kauf: Vollkosten je Karte, realistischer Durchsatz, Kosten je Million Token — und der ehrliche Cloud-Vergleich.
Published on2. August 2026Mamba-Hybrid: KV-Cache bei langem Kontextllm-inferenzvramself-hostedragmittelstanddeutschlandDer KV-Cache frisst bei 32k Kontext mehr VRAM als das Modell selbst. Was Mamba-Hybride wie Soofi S daran ändern — und wann FP8 die billigere Antwort ist.
Published on2. August 2026MoE erklärt: warum 30B nicht 30B VRAM brauchtmoellmgpuvrammittelstanddeutschlandEin 30B-MoE belegt die vollen 19 GB VRAM — sparsam ist nur die Rechenlast pro Token. Die Speicherrechnung Posten für Posten, mit Modelltabelle.