Published on29. Juli 2026Ollama Load-Balancer ohne Kubernetes einrichtenollamaself-hostedgpunginxmittelstanddeutschlandOllama serialisiert Anfragen pro Modell. Mehrere Instanzen hinter nginx mit least_conn: systemd-Units, Config und die Timeouts, die wirklich zählen.
Published on29. Juli 2026Server für KI-Anwendungen: Sizing nach Use-Caseki-serverhardwareragself-hostedmittelstanddeutschlandRAG, Chat, OCR, Code oder Sichtprüfung — jede Anwendung braucht anderes Sizing. Fünf Faustformeln plus die KV-Cache-Rechnung, die 70B-Pläne killt.
Published on29. Juli 2026Was ist ein KI-Server? Definition und Einsatzki-servergpuself-hostedgrundlagenmittelstanddeutschlandKI-Server erklärt: Was ihn von einem normalen Server unterscheidet, welche drei Bauformen es gibt und wann die Cloud die bessere Wahl bleibt.
Published on18. Juli 2026DeepSeek-v3 on-premise: Chinas Open-Source-LLM für deutsche Unternehmendeepseekopen-weightchinese-llmself-hostedki-serverDeepSeek-v3 auf eigenem Server betreiben: Chinas Open-Source-LLM mit 671B Parametern — für deutsche Unternehmen mit Datenschutz-Bedenken.
Published on18. Juli 2026Gemma 2 27B auf eigenem Server: Googles Open-Weight-Modell on-premisegemmagoogleopen-weightself-hostedki-serverGemma 2 27B von Google auf dem eigenen Server: Open-Weight-Modell mit hervorragender Sprachqualität. Hardware, Performance und Deployment-Guide.