Published on4. August 2026Von Ollama zu vLLM: wann der Pilot produktiv werden mussollamavllmmigrationinferenzproduktivbetriebmittelstanddeutschlandOllama trägt den Piloten, nicht den Betrieb. Die vier Signale für den Wechsel auf vLLM — und die Migration Schritt für Schritt.
Published on29. Juli 2026Ollama-Cluster über mehrere Rechner: Shardingollamallama-cppself-hostedgpumittelstanddeutschlandEin LLM über zwei Rechner verteilen: Ollama kann es nicht, llama.cpp schon. Befehle, echte Benchmarks — und warum meist eine größere GPU gewinnt.
Published on29. Juli 2026Ollama Load-Balancer ohne Kubernetes einrichtenollamaself-hostedgpunginxmittelstanddeutschlandOllama serialisiert Anfragen pro Modell. Mehrere Instanzen hinter nginx mit least_conn: systemd-Units, Config und die Timeouts, die wirklich zählen.
Published on18. Juli 2026KI-Server-API-Design: OpenAI-kompatible APIs im Unternehmenapiopenai-compatibelvllmollamaki-serverOpenAI-kompatible APIs für den KI-Server: vLLM, Ollama und LiteLLM im Vergleich — API-Design, Authentifizierung und Enterprise-Integration.
Published on18. Juli 2026Ollama vs vLLM vs LM Studio: Welches LLM-Frontend für den Mittelstand?ollamavllmlm-studiollm-frontendsself-hostedOllama, vLLM und LM Studio im Vergleich: Welches LLM-Frontend passt für den deutschen Mittelstand? Performance, Features, Deployment und Kosten.