Published on4. August 2026DeepSeek V4 Flash selbst hosten: VRAM, Setup, Durchsatzdeepseekopen-weightsvllmgpuon-premisemittelstanddeutschland284 Milliarden Parameter unter MIT-Lizenz. Was der Betrieb im eigenen Rechenzentrum wirklich kostet — Speicherrechnung, Konfiguration, Grenzen.
Published on4. August 2026Von Ollama zu vLLM: wann der Pilot produktiv werden mussollamavllmmigrationinferenzproduktivbetriebmittelstanddeutschlandOllama trägt den Piloten, nicht den Betrieb. Die vier Signale für den Wechsel auf vLLM — und die Migration Schritt für Schritt.
Published on4. August 2026JSON aus dem LLM erzwingen statt hoffen: Schema-Zwangjson-schemastructured-outputvllmautomatisierungmittelstanddeutschlandWer erzeugtes JSON parst und auf Gültigkeit hofft, baut eine Fehlerquelle ein. Wie Sie das Format technisch erzwingen — lokal und in der Cloud.
Published on4. August 2026vLLM vs. SGLang vs. TensorRT-LLM: welcher Server wofürvllmsglangtensorrt-llminferenzdurchsatzmittelstanddeutschlandDrei Inferenzserver im Vergleich. Wo die Unterschiede real sind, wo sie in Benchmarks größer wirken als im Betrieb — und was Sie selbst messen müssen.
Published on18. Juli 2026KI-Server-API-Design: OpenAI-kompatible APIs im Unternehmenapiopenai-compatibelvllmollamaki-serverOpenAI-kompatible APIs für den KI-Server: vLLM, Ollama und LiteLLM im Vergleich — API-Design, Authentifizierung und Enterprise-Integration.