KI on-premise mit eigenen GPUs: Wann sich eigene Hardware lohnt, welche GPUs für welche Modelle, Kostenrechnung über 3 Jahre und der komplette Software-Stack 2026.
Der KV-Cache frisst bei 32k Kontext mehr VRAM als das Modell selbst. Was Mamba-Hybride wie Soofi S daran ändern — und wann FP8 die billigere Antwort ist.