DeepSeek V4 Flash offiziell (FP8) auf zwei DGX Spark im Cluster: TP=2, MTP, 200K Kontext. Das komplette Setup aus dem NVIDIA-Forum mit echten Messwerten, Gotchas und Kosten.
Der offene KI-Standard für den deutschen Mittelstand: LiteLLM Gateway, eigene GPUs, Wissensbasis, Governance. 3 Optionen — Copilot (Sitzpreis), KI-Tools von der Stange, offener Standard. TCO ab 124.600 EUR (3 Jahre) statt 469.600 EUR Copilot.
KI-Server konfigurieren Schritt für Schritt: Linux, GPU-Treiber, Ollama oder vLLM, Open WebUI und Monitoring. Die praktische Anleitung für den Mittelstand 2026.