Published on2. August 2026KI on-premise betreiben: der Einstiegon-premiseki-serverself-hostedgrundlagenmittelstanddeutschlandWas KI on-premise wirklich verlangt: Hardware, Stellplatz, Betrieb, Update-Konzept — und die drei Einstiegsszenarien, die in vier Wochen stehen.
Published on2. August 2026Mamba-Hybrid: KV-Cache bei langem Kontextllm-inferenzvramself-hostedragmittelstanddeutschlandDer KV-Cache frisst bei 32k Kontext mehr VRAM als das Modell selbst. Was Mamba-Hybride wie Soofi S daran ändern — und wann FP8 die billigere Antwort ist.
Published on2. August 2026Soofi S selbst hosten: welche GPU reicht wirklich?soofillmgpuself-hostedmittelstanddeutschlandSoofi S hat 3,2 Mrd. aktive Parameter, braucht aber VRAM für 31,6 Mrd. Was das für die GPU-Wahl heißt — mit offener Rechnung und Stand der Tools.
Published on2. August 2026Soofi S vs Llama 3 vs Qwen für deutschen Textllmopen-sourceself-hostedsoofimittelstanddeutschlandSoofi S, Llama 3.3 und Qwen3.5 im Vergleich für deutsche Texte: Lizenz, VRAM, Verfügbarkeit — und ein Testaufbau mit den eigenen Dokumenten.
Published on2. August 2026Souveräne KI: was der Begriff technisch heißtsouveraenitaetcompliancecloudself-hostedmittelstanddeutschlandDatenresidenz, Betriebssouveränität, Technologiewahl: was souveräne KI wirklich meint — mit Prüfliste für Anbieter und offener Kostenrechnung.