- Published on
Cursor mit Ollama: lokales LLM im Editor
- Authors

- Name
- Phillip Pham
- @ddppham
Cursor mit Ollama: lokales LLM im Editor
TL;DR
Cursor kann gegen ein lokal laufendes Modell sprechen — über Ollama, ohne Token-Rechnung an einen US-API-Anbieter. Der Haken: Cursor will oft eine öffentlich erreichbare Base-URL, nicht localhost. Viele Anleitungen lösen das mit ngrok. Für echte Private AI im Team ist ein VPN oder Reverse-Proxy die sauberere Brücke. Hardware: ein 12B-Modell braucht eine GPU mit genug VRAM, sonst wird der Rechner zur Turbine.
Was Sie damit gewinnen — und was nicht
Gewinn: Code und Prompts bleiben auf der Maschine, sobald die Inferenz lokal läuft. Kein Token-Abo für den Alltag. Modellwahl liegt bei Ihnen (etwa Gemma 3 12B über ollama pull).
Grenze: 12B ist nicht Frontier. Für harte Architektur- und Sicherheitsreviews bleibt ein Cloud-Modell hinter dem Gateway sinnvoll. Lokale Inferenz auf einer Workstation ist spürbar langsamer als eine Datacenter-API.
Ollama als Runtime: llama.cpp vs. Ollama. VRAM-Klasse: Lokale KI 2026: GPU-Wahl 16 GB vs. 24 GB.
Setup in sechs Schritten
- Cursor installieren.
- Ollama installieren, Daemon laufen lassen.
- Modell laden, z. B.
ollama pull gemma3:12b— Größe an die Karte anpassen, nicht an den Marketing-Namen. - Server mit erlaubten Origins:
OLLAMA_ORIGINS=* ollama serve(Standardport11434). Läuft schon ein Ollama im Hintergrund, zuerst beenden, sonst Bind-Error. - Erreichbarkeit: Cursor akzeptiert
localhostje nach Version nicht. ngrok tunnelt11434nach außen (ngrok http 11434 --host-header=localhost:11434). Die Forwarding-URL plus/v1wird zur OpenAI-Base-URL. - In Cursor: Modell hinzufügen, Base-URL setzen, API-Key z. B.
ollama(kein Secret), Verify.
Die Verify-Falle
Der erste Verify scheitert oft mit 404, weil Cursor intern gpt-4o testet — das lokal nicht existiert. Workaround: alle anderen Modelle abwählen, nur das lokale aktiv, erneut Verify. Fragil, kann nach Updates brechen. Wenn es hakt: Base-URL und Modellname gegen curl auf den Ollama-/v1/models-Endpoint prüfen, bevor Sie Cursor die Schuld geben.
ngrok ist eine Brücke, kein Datenschutz
Die Inferenz läuft lokal. Die ngrok-URL ist trotzdem eine öffentliche Tür zum lokalen Port, solange der Tunnel steht. Für einen Laptop-Test akzeptabel. Für ein Team mit Mandantencode: VPN (Tailscale, WireGuard) oder ein Reverse-Proxy im Firmennetz, nicht ein Random-Host im Internet.
OLLAMA_ORIGINS=* ist dasselbe Muster: praktisch zum Testen, in Produktion zu weit. Origins auf die Editor-Origins und das interne Netz begrenzen.
Vom Einzelplatz zum GPU-Server
Stufe 1 ist dieser Artikel: ein Entwickler, eine Workstation, Ollama. Stufe 2: gemeinsamer GPU-Server, vLLM statt Desktop-Ollama, Open WebUI. Stufe 3: Kubernetes-Inference — siehe LLM Self-Hosting auf Kubernetes und GPUs in Kubernetes.
Wer den Editor an einen echten Server hängt, braucht kein ngrok mehr: feste interne HTTPS-URL, SSO, Audit.
Häufige Fragen
Reicht mein Laptop?
Ein 12B-Modell in Q4 braucht grob eine 12–16-GB-Klasse, besser 24 GB wenn Kontext und parallel andere Last dazukommen. Ohne GPU wird es langsam. Die Karte entscheidet, nicht die IDE.
Bleibt der Code wirklich lokal?
Die Tokens erzeugt Ollama auf Ihrer Maschine. Sobald ngrok oder eine Cloud-URL dazwischenliegt, existiert ein zweiter Pfad. Für Audit: Tunnel weglassen, VPN nutzen, Cloud-Modelle in Cursor abschalten.
Kann ich Frontier und lokal mischen?
Ja — über ein Gateway (LiteLLM), nicht über fünf Base-URLs in der IDE. Routing: günstiges lokales Modell für Boilerplate, Frontier für die zehn Prozent harter Aufgaben.
Warum nicht einfach die Cloud-Modelle in Cursor lassen?
Wenn der Code das Haus nicht verlassen darf, ist lokal der Default. Wenn Tempo und Qualität vorgehen und Verträge/AVV sitzen, bleibt Cloud legitim. Beides ist eine Policy-Frage, kein Feature-Vergleich.
Fazit und nächster Schritt
Cursor plus Ollama ist der schnellste Weg, Private AI in den Editor zu holen. ngrok ist nur der Türöffner. Wer das ernst meint, ersetzt den Tunnel durch VPN und die Workstation später durch einen GPU-Server.
Wenn Sie vom Laptop-Setup auf einen betreibbaren Team-Endpoint wollen: Sprechen Sie uns an. Wir setzen Runtime, Netz und Modellgröße so, dass der Editor schnell bleibt und der Code im Haus.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
Ollama-Cluster über mehrere Rechner: Sharding
Ein LLM über zwei Rechner verteilen: Ollama kann es nicht, llama.cpp schon. Befehle, echte Benchmarks — und warum meist eine größere GPU gewinnt.
AMD-GPU für lokale KI: RX 9070 XT und ROCm
AMD für lokale KI 2026: RX 9070 XT mit 16 GB gegen RX 7900 XTX mit 24 GB, ROCm unter Linux, Vulkan unter Windows — und wann NVIDIA die einfachere Karte bleibt.
Ollama Load-Balancer ohne Kubernetes einrichten
Ollama serialisiert Anfragen pro Modell. Mehrere Instanzen hinter nginx mit least_conn: systemd-Units, Config und die Timeouts, die wirklich zählen.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)