Published on29. Juli 2026Ollama-Cluster über mehrere Rechner: Shardingollamallama-cppself-hostedgpumittelstanddeutschlandEin LLM über zwei Rechner verteilen: Ollama kann es nicht, llama.cpp schon. Befehle, echte Benchmarks — und warum meist eine größere GPU gewinnt.
Published on29. Juli 2026Ollama Load-Balancer ohne Kubernetes einrichtenollamaself-hostedgpunginxmittelstanddeutschlandOllama serialisiert Anfragen pro Modell. Mehrere Instanzen hinter nginx mit least_conn: systemd-Units, Config und die Timeouts, die wirklich zählen.
Published on29. Juli 2026Was ist ein KI-Server? Definition und Einsatzki-servergpuself-hostedgrundlagenmittelstanddeutschlandKI-Server erklärt: Was ihn von einem normalen Server unterscheidet, welche drei Bauformen es gibt und wann die Cloud die bessere Wahl bleibt.
Published on18. Juli 2026KI-Server-GPU-Vergleich: RTX 4090 vs A6000 vs L40S im Praxistestgpuvergleichrtx-4090a6000l40smittelstandRTX 4090 vs RTX A6000 vs L40S: Der komplette GPU-Vergleich für KI-Server — Performance, VRAM, Stromverbrauch und welche GPU für welchen Use Case passt.
Published on2. Juli 2026GPU für LLM-Inferenz: RTX 4090 vs A6000 vs L40Ski-serverhardwaregpullm-inferenzmittelstanddeutschlandGPU für LLM-Inferenz wählen: RTX 4090, RTX A6000, RTX 6000 Ada und L40S im Vergleich — VRAM, Bandbreite, TDP, Preis und welche Modellgröße passt.