- Published on
Ollama auf NVIDIA DGX Spark installieren — komplette Anleitung 2026
- Authors

- Name
- Phillip Pham
- @ddppham
Ollama auf NVIDIA DGX Spark installieren — komplette Anleitung 2026
Der NVIDIA DGX Spark mit 128 GB Unified Memory ist das erste Gerät, auf dem ein 70B-Modell mit einem einzigen Befehl läuft. Die Community nutzt dafür meistens Ollama — weil es die einfachste Möglichkeit ist, aus dem GB10 einen vollwertigen lokalen KI-Server zu machen.
Dieser Beitrag zeigt Schritt für Schritt, wie Sie Ollama auf dem Spark installieren, Modelle laden und die API für Ihre Anwendungen freigeben. Wer den klassischen Weg auf Ubuntu sucht, findet ihn in der Ollama-Ubuntu-Anleitung — hier geht es speziell um den GB10-Chip.
Vorbereitung: DGX OS und die ersten Schritte
Der Spark läuft mit DGX OS (Ubuntu-basiert). Vor der Ollama-Installation:
System aktualisieren:
sudo apt update && sudo apt upgrade -yCUDA-Treiber prüfen:
nvidia-smiErwartete Ausgabe: NVIDIA GB10, CUDA 12.x, ca. 96 GB GPU-Speicher (der Rest des Unified Memory geht an CPU und System).
Freien Speicher prüfen: Modelle brauchen Platz — ein 70B-Modell in 4-Bit ca. 40 GB, plus System. Eine NVMe mit 2 TB ist die sinnvolle Basis.
Ollama installieren — drei Wege
Weg 1: Offizielles Installationsskript (schnellster Weg)
curl -fsSL https://ollama.com/install.sh | sh
Das Skript erkennt die Ubuntu-Basis von DGX OS, installiert Ollama als Systemdienst und aktiviert GPU-Beschleunigung automatisch.
Weg 2: Docker-Container (empfohlen für produktiven Betrieb)
Ollama läuft als Container auf dem Spark — mit GPU-Zugriff über das NVIDIA Container Toolkit:
# NVIDIA Container Toolkit (falls nicht vorinstalliert)
sudo apt install -y nvidia-container-toolkit
sudo systemctl restart docker
# Ollama-Container starten
docker run -d --gpus all \
-v ollama:/root/.ollama \
-p 11434:11434 \
--name ollama \
--restart unless-stopped \
ollama/ollama
Der Vorteil gegenüber Weg 1: Updates sind ein docker pull entfernt, und Backups laufen über den Volume — die Details zur Ollama-Docker-Installation gelten hier unverändert.
Weg 3: Manuelle Installation (volle Kontrolle)
# Abhängigkeiten
sudo apt install -y curl python3-pip
# Ollama-Binary direkt laden
curl -fsSL -o /tmp/ollama.tar.gz https://ollama.com/download/ollama-linux-amd64.tgz
sudo tar -C /usr/local -xzf /tmp/ollama.tar.gz
Modelle laden und betreiben
Die 70B-Klasse — der Spark-Vorteil
Der entscheidende Unterschied zu Consumer-GPUs: 70B-Modelle passen in den Unified Memory.
# Llama 3.3 70B (4-Bit) — das Flaggschiff-Szenario
ollama pull llama3.3:70b
# Qwen 2.5 72B
ollama pull qwen2.5:72b
Beide laufen mit akzeptabler Geschwindigkeit (ca. 10-20 Token/s) — deutlich langsamer als ein 8B-Modell, aber für RAG, Dokumentenanalyse und Agenten-Workflows völlig ausreichend.
Der Alltag: kleinere Modelle parallel
Weil 128 GB Platz bieten, lohnt sich Multi-Modell-Betrieb:
# Drei spezialisierte Modelle parallel laden
ollama pull llama3.3:8b # Schnelle Antworten
ollama pull qwen2.5:14b # Qualitäts-Allrounder
ollama pull nomic-embed-text # Embeddings für RAG
So entsteht die RAG-Pipeline komplett auf einem Gerät: Embedding-Modell + Generationsmodell + Routing.
Nemotron — NVIDIAs eigene Modelle
Der Spark ist auf NVIDIAs Modellfamilie optimiert. Nemotron-Modelle laufen über Ollama:
ollama pull nemotron
Für den produktiven Enterprise-Betrieb mit feingetuntem Setup ist der Nemotron-Enterprise-Guide die passende Ergänzung.
API einrichten für Anwendungen
Ollama startet standardmäßig die OpenAI-kompatible API auf Port 11434:
# Dienst-Status prüfen
systemctl status ollama
# oder bei Docker:
docker logs ollama
# API testen
curl http://localhost:11434/api/tags
Von außen erreichbar machen
Für den Zugriff aus dem Firmennetzwerk (nicht das Internet!):
# In /etc/systemd/system/ollama.service oder als Docker-Env
OLLAMA_HOST=0.0.0.0:11434
Performance-Einstellungen für den GB10
# Kontext-Länge erhöhen (Standard: 4096)
# In der Modell-Datei oder beim Laden:
ollama run llama3.3:70b --num-ctx 32768
Die vLLM-Alternative liefert bei hohem Durchsatz mehr Token/s, ist aber deutlich komplexer in der Einrichtung. Für die meisten Mittelstands-Szenarien reicht Ollama.
Achtung Sackgassen
1. Nicht alle Modelle sind für ARM/Grace optimiert. Der GB10 nutzt eine ARM-CPU (Grace). Die meisten Ollama-Modelle laufen, aber einige exotische Quantisierungen können Probleme machen — bei Fehlern ein Standard-Modell (llama3.3, qwen2.5) testen.
2. 128 GB ≠ 128 GB fürs Modell. Realistisch stehen ca. 100-110 GB zur Verfügung. Ein 120B-Modell in 8-Bit passt nicht — vorher mit ollama list und der VRAM-Rechnung prüfen.
3. Update-Verhalten. Nach einem DGX-OS-Update können CUDA-Treiber und Ollama-Container neu abgeglichen werden müssen. Der Wartungsleitfaden hilft bei der Produktionsstabilität.
Häufige Fragen
Läuft Ollama standardmäßig auf dem DGX Spark?
Nein. Ollama muss installiert werden — entweder per Installationsskript, als Docker-Container oder manuell. Die GPU-Beschleunigung wird bei der Installation automatisch erkannt.
Welche Modelle kann ich auf dem Spark mit Ollama betreiben?
70B-Modelle wie Llama 3.3 70B und Qwen 72B in 4-Bit-Quantisierung laufen dank 128 GB Unified Memory. Mehrere kleinere Modelle können parallel betrieben werden.
Wie schnell ist ein 70B-Modell auf dem Spark?
Ca. 10-20 Token/s bei 4-Bit-Quantisierung. Das reicht für RAG, Dokumentenanalyse und Agenten — nicht für Echtzeit-Chat mit vielen gleichzeitigen Nutzern.
Kann ich Ollama auf dem Spark mit Docker betreiben?
Ja, das ist der empfohlene Weg für produktiven Betrieb. Mit dem NVIDIA Container Toolkit läuft Ollama als GPU-beschleunigter Container mit persistente Volume.
Brauche ich zwei Sparks für 70B-Modelle?
Nein, ein Spark reicht für 70B in 4-Bit (ca. 40 GB von 128 GB). Zwei Sparks lohnen sich erst für 140B+ Modelle oder parallele Workloads — Details im Cluster-Leitfaden.
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
DGX Spark Cluster: 2× GB10 mit Kubernetes für 140B+ Modelle
DGX Spark Cluster: Zwei GB10-Supercomputer mit Kubernetes verbinden für 140B+ Modelle. Netzwerk, Setup, Modell-Verteilung und was wirklich skaliert.
NVIDIA DGX Spark: Der lokale KI-Supercomputer für den Mittelstand
NVIDIA DGX Spark (GB10): Der persönliche KI-Supercomputer mit 128 GB Unified Memory für den Mittelstand. Was er kann, was er kostet und wo die Grenzen liegen.
KI-Server konfigurieren: Die Schritt-für-Schritt-Anleitung 2026
KI-Server konfigurieren Schritt für Schritt: Linux, GPU-Treiber, Ollama oder vLLM, Open WebUI und Monitoring. Die praktische Anleitung für den Mittelstand 2026.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)