Published on

Cursor mit Ollama: lokales LLM im Editor

Authors

Cursor mit Ollama: lokales LLM im Editor

TL;DR

Cursor kann gegen ein lokal laufendes Modell sprechen — über Ollama, ohne Token-Rechnung an einen US-API-Anbieter. Der Haken: Cursor will oft eine öffentlich erreichbare Base-URL, nicht localhost. Viele Anleitungen lösen das mit ngrok. Für echte Private AI im Team ist ein VPN oder Reverse-Proxy die sauberere Brücke. Hardware: ein 12B-Modell braucht eine GPU mit genug VRAM, sonst wird der Rechner zur Turbine.

Was Sie damit gewinnen — und was nicht

Gewinn: Code und Prompts bleiben auf der Maschine, sobald die Inferenz lokal läuft. Kein Token-Abo für den Alltag. Modellwahl liegt bei Ihnen (etwa Gemma 3 12B über ollama pull).

Grenze: 12B ist nicht Frontier. Für harte Architektur- und Sicherheitsreviews bleibt ein Cloud-Modell hinter dem Gateway sinnvoll. Lokale Inferenz auf einer Workstation ist spürbar langsamer als eine Datacenter-API.

Ollama als Runtime: llama.cpp vs. Ollama. VRAM-Klasse: Lokale KI 2026: GPU-Wahl 16 GB vs. 24 GB.

Setup in sechs Schritten

  1. Cursor installieren.
  2. Ollama installieren, Daemon laufen lassen.
  3. Modell laden, z. B. ollama pull gemma3:12b — Größe an die Karte anpassen, nicht an den Marketing-Namen.
  4. Server mit erlaubten Origins: OLLAMA_ORIGINS=* ollama serve (Standardport 11434). Läuft schon ein Ollama im Hintergrund, zuerst beenden, sonst Bind-Error.
  5. Erreichbarkeit: Cursor akzeptiert localhost je nach Version nicht. ngrok tunnelt 11434 nach außen (ngrok http 11434 --host-header=localhost:11434). Die Forwarding-URL plus /v1 wird zur OpenAI-Base-URL.
  6. In Cursor: Modell hinzufügen, Base-URL setzen, API-Key z. B. ollama (kein Secret), Verify.

Die Verify-Falle

Der erste Verify scheitert oft mit 404, weil Cursor intern gpt-4o testet — das lokal nicht existiert. Workaround: alle anderen Modelle abwählen, nur das lokale aktiv, erneut Verify. Fragil, kann nach Updates brechen. Wenn es hakt: Base-URL und Modellname gegen curl auf den Ollama-/v1/models-Endpoint prüfen, bevor Sie Cursor die Schuld geben.

ngrok ist eine Brücke, kein Datenschutz

Die Inferenz läuft lokal. Die ngrok-URL ist trotzdem eine öffentliche Tür zum lokalen Port, solange der Tunnel steht. Für einen Laptop-Test akzeptabel. Für ein Team mit Mandantencode: VPN (Tailscale, WireGuard) oder ein Reverse-Proxy im Firmennetz, nicht ein Random-Host im Internet.

OLLAMA_ORIGINS=* ist dasselbe Muster: praktisch zum Testen, in Produktion zu weit. Origins auf die Editor-Origins und das interne Netz begrenzen.

Vom Einzelplatz zum GPU-Server

Stufe 1 ist dieser Artikel: ein Entwickler, eine Workstation, Ollama. Stufe 2: gemeinsamer GPU-Server, vLLM statt Desktop-Ollama, Open WebUI. Stufe 3: Kubernetes-Inference — siehe LLM Self-Hosting auf Kubernetes und GPUs in Kubernetes.

Wer den Editor an einen echten Server hängt, braucht kein ngrok mehr: feste interne HTTPS-URL, SSO, Audit.

Häufige Fragen

Reicht mein Laptop?

Ein 12B-Modell in Q4 braucht grob eine 12–16-GB-Klasse, besser 24 GB wenn Kontext und parallel andere Last dazukommen. Ohne GPU wird es langsam. Die Karte entscheidet, nicht die IDE.

Bleibt der Code wirklich lokal?

Die Tokens erzeugt Ollama auf Ihrer Maschine. Sobald ngrok oder eine Cloud-URL dazwischenliegt, existiert ein zweiter Pfad. Für Audit: Tunnel weglassen, VPN nutzen, Cloud-Modelle in Cursor abschalten.

Kann ich Frontier und lokal mischen?

Ja — über ein Gateway (LiteLLM), nicht über fünf Base-URLs in der IDE. Routing: günstiges lokales Modell für Boilerplate, Frontier für die zehn Prozent harter Aufgaben.

Warum nicht einfach die Cloud-Modelle in Cursor lassen?

Wenn der Code das Haus nicht verlassen darf, ist lokal der Default. Wenn Tempo und Qualität vorgehen und Verträge/AVV sitzen, bleibt Cloud legitim. Beides ist eine Policy-Frage, kein Feature-Vergleich.

Fazit und nächster Schritt

Cursor plus Ollama ist der schnellste Weg, Private AI in den Editor zu holen. ngrok ist nur der Türöffner. Wer das ernst meint, ersetzt den Tunnel durch VPN und die Workstation später durch einen GPU-Server.

Wenn Sie vom Laptop-Setup auf einen betreibbaren Team-Endpoint wollen: Sprechen Sie uns an. Wir setzen Runtime, Netz und Modellgröße so, dass der Editor schnell bleibt und der Code im Haus.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen