- Published on
Ollama Windows GPU: nativ oder WSL2 einrichten
- Authors

- Name
- Phillip Pham
- @ddppham
TL;DR
Ollama ist unter Windows eine native Anwendung mit GPU-Unterstützung für NVIDIA und AMD Radeon. Der Installer braucht laut Herstellerdokumentation kein Administratorkonto und legt die API auf http://localhost:11434. WSL2 brauchen Sie nur, wenn Sie denselben Linux-Pfad wie auf dem Server fahren oder Ollama in Docker unter Linux betreiben. Für CUDA in WSL2 gilt die NVIDIA-Regel: nur den Windows-Treiber installieren, keinen Linux-NVIDIA-Treiber in der Distro.
Warum Windows-Arbeitsplätze im Ollama-Cluster zählen
Viele IT-Leiter im Mittelstand starten lokale LLMs nicht auf dem ersten GPU-Server, sondern auf einem Windows-Rechner in der Konstruktion, im Einkauf oder in der IT. Die Suchanfrage ist dann nicht „KI-Server kaufen“, sondern „Ollama Windows“: Läuft das Modell auf der eingebauten RTX, und wann muss WSL2 dazwischen?
Die offizielle Windows-Dokumentation von Ollama beschreibt den nativen Pfad als Standard. WSL2 ist der Tochter-Pfad, wenn Sie Linux-Werkzeuge, Docker mit NVIDIA Container Toolkit oder denselben Ablauf wie auf Ubuntu brauchen. Beide Wege gehören zum Cluster, der bereits über Ollama Download und Ollama Port 11434 angebunden ist. Wer später auf einen eigenen Rechner wechselt, bleibt bei derselben API.
Zwei Wege: nativ oder WSL2
| Weg | Wann er passt | GPU kommt von |
|---|---|---|
| Nativer Windows-Installer | Einzelplatz, schnelle Prüfung, Fachabteilung ohne Linux | Windows-Treiber (NVIDIA oder AMD) |
| WSL2 plus Linux-Ollama | Gleicher Ablauf wie Ubuntu-Server, Linux-CLI, systemd-Nähe | Windows-Treiber, in WSL als libcuda.so durchgereicht |
| Docker in WSL2 | Isolierung, gleiches Compose wie auf dem Server | Windows-Treiber plus NVIDIA Container Toolkit in Linux |
Kein Weg ist ein Ranking. Es ist eine Betriebsentscheidung: Bleibt der Rechner ein Arbeitsplatz, oder soll das Setup später auf einen Linux-KI-Server wandern? Für die Hardware-Seite des Servers bleibt der KI-Server-Hardware-Guide der Einstieg, nicht dieser Artikel.
Voraussetzungen laut Herstellerdoku
Ollama Windows (Stand der Windows-Dokumentation, gelesen 2026-10-06):
- Windows 10 22H2 oder neuer, Home oder Pro
- NVIDIA-Treiber 551.61 oder neuer, falls eine NVIDIA-Karte steckt
- AMD: ROCm v7 / HIP7-fähiger Treiberstapel für ROCm, sonst ein Vulkan-fähiger Radeon-Treiber
- Mindestens 4 GB frei für die Binary-Installation
- Zusätzlicher Speicher für Modelle: die Doku spricht von zehn bis Hunderten Gigabyte, abhängig vom Modell
NVIDIA für WSL2 (CUDA-on-WSL-Leitfaden, Archiv 13.2.2):
- Aktuellen Windows-x86-Produktionstreiber installieren
- CUDA-Unterstützung für WSL 2 ab Treiberzweig R495
- Pascal oder neuer
- In WSL keinen Linux-NVIDIA-Anzeigetreiber installieren
- WSL mit
wsl.exe --installanlegen und mitwsl.exe --updateaktuell halten
AMD unter Windows: Einige RDNA2-Karten der RX-6000-Klasse, einschließlich RX-6800-Klasse, stellen ROCm v7 auf den aktuellen Windows-Treibern nicht bereit. Vulkan ist dann laut Ollama der vorgesehene Fallback. Bei gemischter iGPU/dGPU, die eine instabile iGPU wählt, setzt die Doku GGML_VK_VISIBLE_DEVICES auf den Index der diskreten Karte.
Weg 1: Ollama nativ unter Windows
- Den Installer
OllamaSetup.exevon der Ollama-Downloadseite holen. Die Windows-Doku nennt das den einfachsten Weg; ein Administratorkonto ist nicht vorgeschrieben. Ein anderes Installationsverzeichnis geht mitOllamaSetup.exe /DIR="d:\some\location". - Nach der Installation läuft Ollama im Hintergrund.
ollamasteht incmd, PowerShell oder einem anderen Terminal bereit. Die API liegt aufhttp://localhost:11434. - Modell speichern, wenn das Benutzerprofil zu klein ist: Umgebungsvariable
OLLAMA_MODELSim Benutzerkonto setzen, Tray-App beenden, Ollama neu starten. - Prüfung in PowerShell, Beispiel aus der Doku:
(Invoke-WebRequest -method POST -Body '{"model":"llama3.2", "prompt":"Warum ist der Himmel blau?", "stream": false}' -uri http://localhost:11434/api/generate ).Content | ConvertFrom-json
- Logs und Binaries, falls die GPU nicht greift:
explorer %LOCALAPPDATA%\Ollama—app.log,server.log,upgrade.logexplorer %LOCALAPPDATA%\Programs\Ollama— Binaries (der Installer hängt den Ordner an den Benutzer-PATH)explorer %HOMEPATH%\.ollama— Modelle und Konfiguration
Für den Betrieb als Windows-Dienst nennt die Doku das Standalone-Paket ollama-windows-amd64.zip plus bei Bedarf ollama-windows-amd64-rocm.zip (AMD) oder ollama-windows-amd64-mlx.zip (MLX/CUDA) und ollama serve über ein Dienst-Werkzeug wie NSSM. Vor einem Upgrade alte Verzeichnisse entfernen.
Weg 2: GPU in WSL2, wenn Linux der Zielpfad ist
WSL2 ist sinnvoll, wenn dasselbe Team später Ubuntu-Server bedient oder Docker-Compose aus dem Linux-Alltag übernimmt. Die GPU bleibt die Windows-Karte.
- Windows-NVIDIA-Treiber installieren. Keinen Linux-NVIDIA-Treiber in WSL nachziehen — CUDA erscheint in WSL 2 als
libcuda.soaus dem Windows-Treiber. wsl.exe --install, danachwsl.exe --update.- In der Distro Ollama wie unter Linux installieren:
curl -fsSL https://ollama.com/install.sh | sh
- GPU prüfen:
nvidia-smiin WSL. Der CUDA-Leitfaden warnt vor einem eingeschränkten Feature-Set vonnvidia-smiunter WSL 2; eine leere Ausgabe ist nicht automatisch „keine GPU“, aber eine Fehlermeldung nach einem Linux-Treiber im Gast ist ein klassischer Bruch. - Dienst wie auf dem Server: die Linux-Doku legt eine systemd-Unit
ollama.servicean und startet sie mitsystemctl enable/start.
Wer CUDA-Toolkit in WSL kompiliert, soll laut NVIDIA das WSL-Ubuntu-Paket nehmen, nicht das Standard-Toolkit, das den durchgereichten Treiber überschreiben kann. Für den reinen Ollama-Betrieb reicht der Windows-Treiber.
Docker unter Windows: gleiche API, anderer Host
Wenn die Fachabteilung Windows nutzt, der Betrieb aber Container will, liegt Docker typischerweise in WSL2. Die Ollama-Docker-Dokumentation startet die NVIDIA-Variante so:
docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama
Voraussetzung in Linux: NVIDIA Container Toolkit, danach
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
Compose, Volumes und Port-Mapping stehen in Ollama Docker installieren. Den Port nach der Freigabe im LAN absichern Sie wie in der Port-Anleitung: Ollama bringt für den lokalen Server keine eingebaute Anmeldung mit.
Prüfen, ob die GPU wirklich arbeitet
Drei unabhängige Checks, ohne erfundene Tokenraten:
- Prozess und Port.
ollama -vbzw.curl http://localhost:11434/api/tags. Keine Antwort heißt: Dienst nicht gestartet oder anderer Port. - Herstellerlog. Unter Windows
server.logim Ordner%LOCALAPPDATA%\Ollama. Unter Linuxjournalctl -e -u ollama. Meldungen zu fehlendem GPU-Support odernvidia-smi command failedgehören vor das nächste Modell, nicht danach. - Windows-Taskmanager oder
nvidia-smi. Steigt die Auslastung der diskreten Karte währendollama run, arbeitet die GPU. Bleibt nur die CPU lastig, liegt meist ein zu alter Treiber, eine iGPU-Wahl oder ein Linux-Treiber in WSL vor.
Modelle und Speicherort: Native Windows-Installation schreibt nach %HOMEPATH%\.ollama, solange OLLAMA_MODELS nicht gesetzt ist. In Docker liegt der Bestand im Volume /root/.ollama. Beides nicht mischen, sonst zieht Ollama dasselbe Modell zweimal.
Typische Brüche im Mittelstand
Zwei Instanzen auf Port 11434. Native Tray-App und WSL-Ollama gleichzeitig binden denselben Port. Eine Instanz beenden oder OLLAMA_HOST verschieben.
Linux-NVIDIA-Treiber in WSL. Das überschreibt den Windows-Stub. Symptom: nvidia-smi im Gast bricht, Ollama fällt auf CPU zurück. Behebung: Linux-Treiber entfernen, Windows-Treiber behalten, WSL neu starten.
ROCm erwartet, Vulkan nötig. RX-6000 unter Windows ohne ROCm v7: Vulkan nicht abschalten, diskrete Karte per GGML_VK_VISIBLE_DEVICES wählen.
Profilplatte voll. Der Installer selbst braucht laut Doku 4 GB. Modelle füllen schnell die Systempartition. OLLAMA_MODELS auf ein Datenlaufwerk legen, bevor der erste 70B-Download die C-Platte füllt.
Server-Umzug. Windows-nativ ist der Pilot. Sobald mehrere Nutzer oder eine Firewall-Zone dazukommen, gehört der Dienst auf Linux — Treiber und CUDA dann nach NVIDIA-Treiber und CUDA auf Ubuntu.
FAQ
Brauche ich WSL2, damit Ollama unter Windows die GPU nutzt?
Nein. Die Windows-Dokumentation beschreibt Ollama als native Anwendung mit NVIDIA- und AMD-GPU-Unterstützung. WSL2 ist der Linux-Pfad, nicht die Voraussetzung für GPU-Offload.
Welchen NVIDIA-Treiber verlangt Ollama unter Windows?
Die Windows-Dokumentation nennt Treiber 551.61 oder neuer. Für CUDA in WSL 2 nennt NVIDIA den Zweig R495 als Untergrenze. In der Praxis installieren Sie den aktuellen Windows-Produktionstreiber, nicht einen Aufsatz nur für WSL.
Wie deinstalliere ich Ollama unter Windows?
Über „Apps und Features“. Modelle außerhalb des Standardpfads, die Sie per OLLAMA_MODELS verschoben haben, entfernt der Uninstaller laut Doku nicht.
Kann ich Ollama in WSL und nativ parallel betreiben?
Technisch ja, betrieblich schlecht. Beide wollen Port 11434. Eine Instanz reichen, die andere beenden. Clients (Open WebUI, Skripte) zeigen auf genau eine Basis-URL.
Welcher Weg gilt für den späteren GPU-Server?
WSL2 plus Linux-Installer oder Docker. Der Befehl curl -fsSL https://ollama.com/install.sh | sh ist derselbe wie auf Ubuntu. Windows-nativ bleibt der Arbeitsplatz-Pilot.
Fazit
„Ollama Windows“ ist zuerst ein Treiber- und Pfadproblem, kein zweiter Hardware-Kaufguide. Nativer Installer für den Arbeitsplatz, WSL2 oder Docker wenn der Linux-Server das Ziel ist, GPU immer über den Windows-Treiber. Port, Modelle und Logs prüfen, bevor Sie ein zweites Tool auf dieselbe API setzen.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
Gemma 4 mit Ollama lokal: Welches Modell passt zu Ihrer GPU?
Gemma 4 in Ollama: E2B, E4B, 12B, 26B MoE oder 31B? VRAM-Bedarf, Kosten und Hardware-Empfehlung für den deutschen Mittelstand – inklusive DSGVO-Einordnung.
Ollama-Cluster über mehrere Rechner: Sharding
Ein LLM über zwei Rechner verteilen: Ollama kann es nicht, llama.cpp schon. Befehle, echte Benchmarks — und warum meist eine größere GPU gewinnt.
Ollama: Port 11434 ändern & Firewall konfigurieren
Ändern Sie den Ollama Standard-Port 11434. Unsere Anleitung zeigt, wie Sie den Port für den Server-Betrieb anpassen und via UFW-Firewall absichern.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)