Published on29. Juli 2026Ollama-Cluster über mehrere Rechner: Shardingollamallama-cppself-hostedgpumittelstanddeutschlandEin LLM über zwei Rechner verteilen: Ollama kann es nicht, llama.cpp schon. Befehle, echte Benchmarks — und warum meist eine größere GPU gewinnt.
Published on29. Juli 2026Ollama Load-Balancer ohne Kubernetes einrichtenollamaself-hostedgpunginxmittelstanddeutschlandOllama serialisiert Anfragen pro Modell. Mehrere Instanzen hinter nginx mit least_conn: systemd-Units, Config und die Timeouts, die wirklich zählen.
Published on29. Juli 2026Server für KI-Anwendungen: Sizing nach Use-Caseki-serverhardwareragself-hostedmittelstanddeutschlandRAG, Chat, OCR, Code oder Sichtprüfung — jede Anwendung braucht anderes Sizing. Fünf Faustformeln plus die KV-Cache-Rechnung, die 70B-Pläne killt.
Published on29. Juli 2026Was ist ein KI-Server? Definition und Einsatzki-servergpuself-hostedgrundlagenmittelstanddeutschlandKI-Server erklärt: Was ihn von einem normalen Server unterscheidet, welche drei Bauformen es gibt und wann die Cloud die bessere Wahl bleibt.
Published on28. Juli 2026KI Engpassprognose Redispatch 2.0: Bis zu 15% Netzkosten sparenredispatch-2.0engpassprognoseenergieversorgersmart-gridnetzausbaumittelstanddeutschlandNetzbetreiber optimieren Redispatch 2.0 mit KI-Engpassprognosen. Senken Sie Betriebskosten um bis zu 15% und steigern die Netzstabilität für eine sichere Energiewende.