- Published on
KI-Server konfigurieren: Die Schritt-für-Schritt-Anleitung 2026
- Authors

- Name
- Phillip Pham
- @ddppham
Kurzantwort: KI-Server in 6 Schritten konfigurieren
Einen KI-Server zu konfigurieren dauert mit dieser Anleitung einen Arbeitstag: Ubuntu 24.04 installieren, NVIDIA-Treiber und CUDA einrichten, Ollama oder vLLM als Modell-Server installieren, ein Modell laden, Open WebUI als Benutzeroberfläche aufsetzen und Monitoring aktivieren. Die Grundkonfiguration kostet kein Geld (alles Open Source) und funktioniert auf jeder GPU-Hardware ab einer RTX 4090. Nach Schritt 6 können die ersten Mitarbeiter den Server produktiv nutzen.
Dieser Beitrag ist die praktische Anleitung für IT-Verantwortliche im Mittelstand — ohne Vorwissen vorauszusetzen, aber mit allen Kommandos und Fallstricken.
Voraussetzungen: Was Sie brauchen
| Voraussetzung | Empfehlung |
|---|---|
| Hardware | GPU-Server ab RTX 4090 (24 GB VRAM), 64 GB RAM, 2 TB NVMe |
| Betriebssystem | Ubuntu Server 24.04 LTS |
| Zugriff | SSH-Zugang mit Root oder sudo |
| Netzwerk | Feste IP oder Domain, Firewall-Ports geplant |
| Zeit | 4-8 Stunden für die Grundkonfiguration |
Die Hardware-Wahl ist die halbe Miete: KI-Server kaufen: Der Leitfaden 2026 und der Hardware-Guide helfen bei der Auswahl.
Schritt 1: Ubuntu Server installieren
Die Basis für jeden KI-Server ist ein sauberes Linux. Ubuntu Server 24.04 LTS ist die Standardwahl, weil Treiber und Tools am besten unterstützt werden.
- Ubuntu Server 24.04 ISO herunterladen und auf USB-Stick schreiben
- Installation mit LVM oder ZFS (empfohlen für Snapshots)
- SSH-Server während der Installation aktivieren
- System aktualisieren:
sudo apt update && sudo apt upgrade -y - Hostname setzen:
sudo hostnamectl set-hostname ki-server
Wichtiger Hinweis: Die SSD-Aufteilung für Modelle einplanen — ein 70B-Modell braucht 40-150 GB. Die Storage-Strategien für KI-Server helfen bei der Planung.
Schritt 2: NVIDIA-Treiber und CUDA einrichten
Ohne korrekte GPU-Treiber passiert nichts. Der sauberste Weg auf Ubuntu:
# NVIDIA-Treiber installieren (empfohlen: 550+)
sudo apt install -y nvidia-driver-550
sudo reboot
# Prüfen, ob die GPU erkannt wird
nvidia-smi
# CUDA-Toolkit (für vLLM und Training)
sudo apt install -y nvidia-cuda-toolkit
Fallstrick: Nach dem Treiber-Installation nvidia-smi prüfen. Wenn kein Treiber geladen ist, Secure Boot deaktivieren oder die Treiber signieren. Die GPU-Treiber-Probleme sind der häufigste Grund für hängende KI-Server-Setups.
Schritt 3: Modell-Server installieren (Ollama oder vLLM)
Für den Start ist Ollama am einfachsten, für Produktions-Durchsatz vLLM. Beide lassen sich parallel betreiben.
Ollama (einfacher Einstieg)
curl -fsSL https://ollama.com/install.sh | sh
# Modell laden und testen
ollama pull llama3.1:8b
ollama run llama3.1:8b "Was ist ein KI-Server?"
vLLM (Produktions-Durchsatz)
# Python-Umgebung
sudo apt install -y python3-venv python3-pip
python3 -m venv /opt/vllm
source /opt/vllm/bin/activate
# vLLM installieren
pip install vllm
# Server starten (OpenAI-kompatible API)
vllm serve meta-llama/Llama-3.3-70B-Instruct --gpu-memory-utilization 0.9
Der Vergleich der Engines: Ollama vs. vLLM vs. LM Studio und der Durchsatz-Benchmark. Die ausführliche vLLM-Anleitung: vLLM-Server für den Mittelstand.
Schritt 4: Open WebUI als Benutzeroberfläche
Die Mitarbeiter sollen nicht in der Kommandozeile arbeiten. Open WebUI ist die Standard-Chat-Oberfläche:
# Docker installieren (falls noch nicht vorhanden)
curl -fsSL https://get.docker.com | sh
# Open WebUI starten
docker run -d -p 3000:8080 \
-v open-webui:/app/backend/data \
-e OLLAMA_BASE_URL=http://localhost:11434 \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main
Danach ist die Oberfläche unter http://<server-ip>:3000 erreichbar. Die vollständige Anleitung: Open WebUI mit Docker installieren.
Schritt 5: Netzwerk, Firewall und Zugriffssicherung
Ein KI-Server ist ein Server mit sensiblen Daten — die Absicherung gehört zur Konfiguration:
# Firewall: Nur SSH und Open WebUI freigeben
sudo ufw allow 22/tcp
sudo ufw allow 3000/tcp
sudo ufw enable
# Reverse-Proxy mit HTTPS (empfohlen)
# Caddy oder Nginx vor Open WebUI setzen
Der komplette Hardening-Leitfaden für LLM-Deployments beschreibt Firewall, API-Absicherung, Benutzerverwaltung und Updates. Wer mehrere Modelle über eine API bereitstellt, nutzt einen Load Balancer oder LiteLLM als Gateway.
Schritt 6: Monitoring und Betrieb
Ohne Monitoring ist der KI-Server ein Blindflug. Die Standard-Kombination:
- Prometheus + Grafana + DCGM: GPU-Auslastung, Temperatur, VRAM, Token-Durchsatz. Anleitung: KI-Server-Monitoring.
- Langfuse (optional): LLM-Tracing für Qualität und Kosten je Anfrage. Anleitung: Langfuse Self-Hosted.
- Backup-Routine: Modelle und Vektordatenbanken regelmäßig sichern. Strategien: Backup für Vektordatenbanken.
Die laufende Wartung (Updates, Logs, Temperatur-Checks) gehört zum Betrieb: KI-Server-Wartung mit Linux.
Erweiterte Konfiguration: Was nach der Grundkonfiguration kommt
| Erweiterung | Wann | Anleitung |
|---|---|---|
| RAG / Wissensdatenbank | Chat-Assistent soll eigene Dokumente kennen | RAG vom PDF zur Wissensdatenbank |
| Docker-Container | Mehrere Dienste sauber trennen | KI-Server mit Docker |
| Mehrere GPUs / Cluster | 70B+ Modelle oder viele Nutzer | vLLM-Cluster für 70B-Modelle |
| API für eigene Anwendungen | Integration in Fachanwendungen | OpenAI-kompatible API |
| Kubernetes | Mehrere Server orchestrieren | Ollama auf Kubernetes |
Typische Fehler bei der Konfiguration
- Secure Boot blockiert Treiber: NVIDIA-Treiber laden nicht → Secure Boot deaktivieren oder Treiber signieren.
- Falsche GPU-Nutzung: vLLM mit
--gpu-memory-utilization 0.9statt Default — sonst bleibt VRAM ungenutzt. - Swap statt VRAM: Große Modelle auf den Swap zu schieben, macht den Server unbrauchbar langsam. Lieber ein kleineres Modell wählen.
- Offene Ports: Ollama lauscht standardmäßig auf 11434 ohne Auth — Firewall vor dem Internet-Zugriff schließen.
- Kein Backup: Nach der Konfiguration sofort die Backup-Strategie einrichten.
FAQ
Wie konfiguriere ich einen KI-Server?
In 6 Schritten: Ubuntu 24.04 installieren, NVIDIA-Treiber einrichten, Ollama oder vLLM installieren, Modell laden, Open WebUI aufsetzen, Monitoring aktivieren. Die komplette Anleitung mit allen Kommandos steht in diesem Beitrag.
Was kostet die Konfiguration eines KI-Servers?
Die Software ist komplett Open Source (Ollama, vLLM, Open WebUI, Prometheus, Grafana). Es fallen nur Arbeitszeit an: 4-8 Stunden für die Grundkonfiguration, etwa 2-4 Stunden/Monat für Wartung. Alternativ übernimmt ein managed KI-Server die Konfiguration gegen Monatspauschale.
Welches Betriebssystem für einen KI-Server?
Ubuntu Server 24.04 LTS ist die Standardwahl — beste Treiber-Unterstützung, größte Community, alle KI-Tools getestet. Andere Distributionen funktionieren, bringen aber mehr Konfigurationsaufwand.
Ollama oder vLLM: Was soll ich installieren?
Ollama für den schnellen Start und wenige Nutzer, vLLM für Produktions-Durchsatz mit vielen parallelen Requests. Beide können parallel laufen: Ollama für Tests, vLLM für den produktiven Betrieb.
Wie sichere ich meinen KI-Server ab?
Firewall nur für SSH und das Web-Frontend öffnen, HTTPS per Reverse-Proxy, API-Ports nicht ins Internet exponieren, Updates regelmäßig einspielen, Benutzerverwaltung aktivieren. Der Hardening-Leitfaden deckt alle Punkte ab.
Wie lange dauert die Konfiguration?
Die Grundkonfiguration (Schritte 1-6) dauert mit dieser Anleitung 4-8 Stunden. Danach ist der Server produktiv nutzbar. Erweiterungen wie RAG oder Cluster-Ausbau kommen je nach Komplexität mit 1-3 Tagen dazu.
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
KI-Server kaufen: Der komplette Leitfaden 2026 für den Mittelstand
KI-Server kaufen für den Mittelstand: Kaufentscheidung, Hardware, Kosten, Anbieter und ROI. Der komplette Leitfaden 2026 mit Vergleich kaufen vs. mieten vs. selbst bauen.
Von Ollama zu vLLM: wann der Pilot produktiv werden muss
Ollama trägt den Piloten, nicht den Betrieb. Die vier Signale für den Wechsel auf vLLM — und die Migration Schritt für Schritt.
vLLM vs Ollama: Durchsatz-Benchmark self-hosted 2026
vLLM vs Ollama im Durchsatz-Benchmark: bis 19x mehr Tokens/s unter Last durch Continuous Batching. Welches Tool wann self-hosted passt.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)