Published on

DGX Spark: Claude Code lokal mit 128 GB

Authors

DGX Spark: Claude Code lokal mit 128 GB

TL;DR

Der DGX Spark ist kein zweiter Überblick-Artikel. Es ist ein Mini-Rechner mit 128 GB Unified Memory (rund 120 GB nutzbar) und 250 W über USB-C, der 100B-Klasse lokal trägt. Im Praxistest liefen ein 30B-Coder (160K Kontext) und ein 122B-Modell (130K) parallel, zusammen etwa 93 GB. Claude Code zeigt auf LM Studio (localhost:1234). Für interaktives Coding bleibt eine RTX 5090 schneller. Der Spark gewinnt bei Speicher, Batch über Nacht und zwei Modellen gleichzeitig. Remote nur über Tailscale, nicht über offenes Büro-WLAN.

Hardware-Überblick: NVIDIA DGX Spark. Software-Fallen: DGX Spark CUDA-Realität.

Was der Spark hier konkret kann

Die Specs kennen Sie: GB10, Unified Memory, DGX OS, CUDA. Der Clou im Alltag ist nicht die TOPS-Zahl, sondern dass CPU und GPU denselben Speicher sehen. Ein 122B-Quant muss nicht über PCIe-Offload hüpfen.

Im dokumentierten Aufbau:

Wert
Unified Memory128 GB, davon ca. 120 GB für Modelle
Strom250 W, ein USB-C-Kabel (kleinerer Adapter = weniger Takt)
Zwei Modelle30B-Coder 160K + 122B mit 130K ≈ 93 GB
ZugriffRemote (HDMI bleibt meist ungenutzt)
ReiseMini-PC, ein Kabel

Zwei Modelle gleichzeitig ist der Punkt, den eine 32-GB-Karte nicht kauft. Die RTX 5090 ist beim Token-Takt vorne. Beim Speicher verliert sie klar.

Spark oder 5090?

Die kurze Antwort: Speed gegen Speicher.

DGX SparkRTX 5090-Rig
Speicher128 GB unified32 GB VRAM
Interaktives Codinglangsamerschneller
70B / 100B+ lokaljanein (ohne Offload)
Batch über Nachtja, Speicher reichtModell muss passen
FormfaktorRucksack, ein KabelTower, 575 W-Klasse
CUDA / Fine-Tune kleinjaInference-lastig

Wer den ganzen Tag im Agent-Loop sitzt und auf jedes Token wartet, kauft die 5090. Wer 1.000 Dokumente nachts durchschiebt oder Coder plus großes Modell im RAM halten will, kauft den Spark. Beides ist Private AI, nicht dieselbe Stufe: Lokale KI 2026: GPU-Wahl.

Ein Budget-Pfad unter 1.000 Euro bleibt ein anderes Gerät: Lokale KI unter 1.000 Euro.

Claude Code gegen LM Studio

Cursor gegen Ollama ist ein anderer Pfad (Cursor mit Ollama). Hier: Claude Code auf dem Laptop, Inferenz auf dem Spark.

  1. LM Studio auf dem Spark, Modelle laden (im Test: Qwen-Coder 30B, Qwen 122B).
  2. Claude-Code-settings.json auf die lokale OpenAI-kompatible URL, Port 1234.
  3. CLAUDE.md im Repo: Alltag auf 30B, schwere Fragen auf 122B (big brain oder automatisch).
  4. Zwei tmux-Sessions: Cloud-Opus für Tempo, lokaler Coder für Daten, die das Haus nicht verlassen.
{
  "env": {
    "ANTHROPIC_BASE_URL": "http://127.0.0.1:1234/v1"
  }
}

Die genaue Schlüsselbezeichnung hängt an der Claude-Code-Version. Entscheidend ist: die Base-URL zeigt auf LM Studio, nicht auf api.anthropic.com. Modellnamen in LM Studio und in CLAUDE.md müssen zusammenpassen.

Vom MacBook mit 48 GB aus reicht LM Link: die Modelle bleiben auf dem Spark, der Editor spricht remote. Das ist kein Cluster, es ist ein Arbeitsplatz.

Zwei Modelle, ein Speicherbudget

Der 30B-Coder macht den Alltag. Das 122B-Modell kommt nur, wenn die Frage schwer ist. Beide parallel: rund 93 GB von 120 GB. Der Rest ist OS, Runtime, KV-Cache. Wer den Kontext auf 250K aufdreht, frisst den Puffer und die Tokenrate bricht ein — dasselbe Muster wie auf jeder GPU: KV-Cache und GPU-Wahl.

Claude Code selbst belegt schon vor der ersten Nutzerzeile rund 32.000 Tokens Systemkontext. In der Cloud ist das Geld. Lokal ist es Zeit: Prefill wird länger, der Lüfter hörbarer.

Auto-Mode statt Warten am Prompt

Lokales Coding war 2024 mühsam, weil jedes Token sichtbar war. Mit Auto-Mode läuft der Agent 30–60 Minuten allein. Im Test hat das Modell einen Port-Konflikt auf 8080 selbst gefunden und behoben — nicht weil es schlauer ist als Opus, sondern weil der Token-Deckel lokal wegfällt und die Harness hartnäckig bleibt.

Der Preis: Sub-Agents laufen sequenziell, nicht als Cloud-Fan-Out. Wer zwanzig parallele Tasks plant, wartet Stunden. Ein Job, ein Agent, oder bewusst batchen.

Agent-Orchestrierung in der Cloud: Claude Code vs. Codex.

Tailscale, nicht das Büro-WLAN

SSH im Gäste-WLAN plus Passwort ist kein Setup. Tailscale (Tailnet, 2FA) schließt den Spark. Open WebUI auf dem Handy über 5G ist dann derselbe Tunnel, kein Port-Forward ins Internet.

Das ist die Mindestsicherheit für ein Gerät, auf dem Mandanten- oder Quellcode liegt. Wer das zum Team-Dienst macht, ist nicht mehr bei einem Mini-PC, sondern bei Gateway, RBAC und Kubernetes: LLM Self-Hosting auf Kubernetes, NVIDIA-Serverfamilien.

Stufenweg, ohne den Spark zu überschätzen

StufeHardwareRolle
1Spark oder 5090ein Entwickler, Private-AI-Start
2GPU-Server, mehrere KartenTeam, ein Modelldienst
3Kubernetes-InferenzMulti-User, Audit, Routing

Der Spark ist Stufe 1 mit ungewöhnlich viel Speicher. Er ersetzt keinen HGX-Knoten. Zwei Sparks als Mini-Cluster sind ein eigener Pfad: 2× GB10 unter Kubernetes.

Häufige Fragen

Reicht ein DGX Spark für lokale KI?

Für 70B- bis 100B-Klasse und zwei Modelle im RAM: ja. Für schnelles Tipp-Feedback im Editor: oft nein, dann 5090. Strom nach Hardwarekauf ist die laufende Rechnung, keine Token-API.

Kann Claude Code wirklich lokale Modelle nutzen?

Ja, über eine OpenAI-kompatible API. LM Studio auf 1234 ist der kurze Weg. Auto-Mode macht langsame Inferenz erträglich. Sub-Agents nicht wie in der Cloud parallel erwarten.

Was kostet der Betrieb?

Das Gerät einmal, dann Watt. 250 W über USB-C, schwächeres Netzteil auf Reisen kostet Takt. Listenpreise 2026 liegen grob bei 3.000–3.500 Euro netto, je nach Händler. Keine Token-Rechnung, solange die Gewichte im Haus bleiben.

Braucht das Linux-Erfahrung?

Ja. Der Spark ist kein Windows-Appliance. Treiber- und CUDA-Lücken sind dokumentiert. Wer nur Chat will, ist mit Ollama auf einer Consumer-GPU oft schneller am Ziel. llama.cpp vs. vLLM.

Fazit und nächster Schritt

128 GB Unified Memory machen Frontier-große Open Weights auf dem Schreibtisch möglich. Claude Code plus LM Studio plus zwei Modelle ist ein belastbarer Einzelplatz. Es ist nicht die schnellste Coding-Karte und kein Unternehmens-Cluster.

Wenn Sie Spark gegen 5090 gegen GPU-Server an Ihrer Last messen wollen (Coding, Batch, Mandantendaten): Speicher, Tokenrate, nicht das Datenblatt.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen