- Published on
DGX Spark: Claude Code lokal mit 128 GB
- Authors

- Name
- Phillip Pham
- @ddppham
DGX Spark: Claude Code lokal mit 128 GB
TL;DR
Der DGX Spark ist kein zweiter Überblick-Artikel. Es ist ein Mini-Rechner mit 128 GB Unified Memory (rund 120 GB nutzbar) und 250 W über USB-C, der 100B-Klasse lokal trägt. Im Praxistest liefen ein 30B-Coder (160K Kontext) und ein 122B-Modell (130K) parallel, zusammen etwa 93 GB. Claude Code zeigt auf LM Studio (localhost:1234). Für interaktives Coding bleibt eine RTX 5090 schneller. Der Spark gewinnt bei Speicher, Batch über Nacht und zwei Modellen gleichzeitig. Remote nur über Tailscale, nicht über offenes Büro-WLAN.
Hardware-Überblick: NVIDIA DGX Spark. Software-Fallen: DGX Spark CUDA-Realität.
Was der Spark hier konkret kann
Die Specs kennen Sie: GB10, Unified Memory, DGX OS, CUDA. Der Clou im Alltag ist nicht die TOPS-Zahl, sondern dass CPU und GPU denselben Speicher sehen. Ein 122B-Quant muss nicht über PCIe-Offload hüpfen.
Im dokumentierten Aufbau:
| Wert | |
|---|---|
| Unified Memory | 128 GB, davon ca. 120 GB für Modelle |
| Strom | 250 W, ein USB-C-Kabel (kleinerer Adapter = weniger Takt) |
| Zwei Modelle | 30B-Coder 160K + 122B mit 130K ≈ 93 GB |
| Zugriff | Remote (HDMI bleibt meist ungenutzt) |
| Reise | Mini-PC, ein Kabel |
Zwei Modelle gleichzeitig ist der Punkt, den eine 32-GB-Karte nicht kauft. Die RTX 5090 ist beim Token-Takt vorne. Beim Speicher verliert sie klar.
Spark oder 5090?
Die kurze Antwort: Speed gegen Speicher.
| DGX Spark | RTX 5090-Rig | |
|---|---|---|
| Speicher | 128 GB unified | 32 GB VRAM |
| Interaktives Coding | langsamer | schneller |
| 70B / 100B+ lokal | ja | nein (ohne Offload) |
| Batch über Nacht | ja, Speicher reicht | Modell muss passen |
| Formfaktor | Rucksack, ein Kabel | Tower, 575 W-Klasse |
| CUDA / Fine-Tune klein | ja | Inference-lastig |
Wer den ganzen Tag im Agent-Loop sitzt und auf jedes Token wartet, kauft die 5090. Wer 1.000 Dokumente nachts durchschiebt oder Coder plus großes Modell im RAM halten will, kauft den Spark. Beides ist Private AI, nicht dieselbe Stufe: Lokale KI 2026: GPU-Wahl.
Ein Budget-Pfad unter 1.000 Euro bleibt ein anderes Gerät: Lokale KI unter 1.000 Euro.
Claude Code gegen LM Studio
Cursor gegen Ollama ist ein anderer Pfad (Cursor mit Ollama). Hier: Claude Code auf dem Laptop, Inferenz auf dem Spark.
- LM Studio auf dem Spark, Modelle laden (im Test: Qwen-Coder 30B, Qwen 122B).
- Claude-Code-
settings.jsonauf die lokale OpenAI-kompatible URL, Port 1234. CLAUDE.mdim Repo: Alltag auf 30B, schwere Fragen auf 122B (big brainoder automatisch).- Zwei tmux-Sessions: Cloud-Opus für Tempo, lokaler Coder für Daten, die das Haus nicht verlassen.
{
"env": {
"ANTHROPIC_BASE_URL": "http://127.0.0.1:1234/v1"
}
}
Die genaue Schlüsselbezeichnung hängt an der Claude-Code-Version. Entscheidend ist: die Base-URL zeigt auf LM Studio, nicht auf api.anthropic.com. Modellnamen in LM Studio und in CLAUDE.md müssen zusammenpassen.
Vom MacBook mit 48 GB aus reicht LM Link: die Modelle bleiben auf dem Spark, der Editor spricht remote. Das ist kein Cluster, es ist ein Arbeitsplatz.
Zwei Modelle, ein Speicherbudget
Der 30B-Coder macht den Alltag. Das 122B-Modell kommt nur, wenn die Frage schwer ist. Beide parallel: rund 93 GB von 120 GB. Der Rest ist OS, Runtime, KV-Cache. Wer den Kontext auf 250K aufdreht, frisst den Puffer und die Tokenrate bricht ein — dasselbe Muster wie auf jeder GPU: KV-Cache und GPU-Wahl.
Claude Code selbst belegt schon vor der ersten Nutzerzeile rund 32.000 Tokens Systemkontext. In der Cloud ist das Geld. Lokal ist es Zeit: Prefill wird länger, der Lüfter hörbarer.
Auto-Mode statt Warten am Prompt
Lokales Coding war 2024 mühsam, weil jedes Token sichtbar war. Mit Auto-Mode läuft der Agent 30–60 Minuten allein. Im Test hat das Modell einen Port-Konflikt auf 8080 selbst gefunden und behoben — nicht weil es schlauer ist als Opus, sondern weil der Token-Deckel lokal wegfällt und die Harness hartnäckig bleibt.
Der Preis: Sub-Agents laufen sequenziell, nicht als Cloud-Fan-Out. Wer zwanzig parallele Tasks plant, wartet Stunden. Ein Job, ein Agent, oder bewusst batchen.
Agent-Orchestrierung in der Cloud: Claude Code vs. Codex.
Tailscale, nicht das Büro-WLAN
SSH im Gäste-WLAN plus Passwort ist kein Setup. Tailscale (Tailnet, 2FA) schließt den Spark. Open WebUI auf dem Handy über 5G ist dann derselbe Tunnel, kein Port-Forward ins Internet.
Das ist die Mindestsicherheit für ein Gerät, auf dem Mandanten- oder Quellcode liegt. Wer das zum Team-Dienst macht, ist nicht mehr bei einem Mini-PC, sondern bei Gateway, RBAC und Kubernetes: LLM Self-Hosting auf Kubernetes, NVIDIA-Serverfamilien.
Stufenweg, ohne den Spark zu überschätzen
| Stufe | Hardware | Rolle |
|---|---|---|
| 1 | Spark oder 5090 | ein Entwickler, Private-AI-Start |
| 2 | GPU-Server, mehrere Karten | Team, ein Modelldienst |
| 3 | Kubernetes-Inferenz | Multi-User, Audit, Routing |
Der Spark ist Stufe 1 mit ungewöhnlich viel Speicher. Er ersetzt keinen HGX-Knoten. Zwei Sparks als Mini-Cluster sind ein eigener Pfad: 2× GB10 unter Kubernetes.
Häufige Fragen
Reicht ein DGX Spark für lokale KI?
Für 70B- bis 100B-Klasse und zwei Modelle im RAM: ja. Für schnelles Tipp-Feedback im Editor: oft nein, dann 5090. Strom nach Hardwarekauf ist die laufende Rechnung, keine Token-API.
Kann Claude Code wirklich lokale Modelle nutzen?
Ja, über eine OpenAI-kompatible API. LM Studio auf 1234 ist der kurze Weg. Auto-Mode macht langsame Inferenz erträglich. Sub-Agents nicht wie in der Cloud parallel erwarten.
Was kostet der Betrieb?
Das Gerät einmal, dann Watt. 250 W über USB-C, schwächeres Netzteil auf Reisen kostet Takt. Listenpreise 2026 liegen grob bei 3.000–3.500 Euro netto, je nach Händler. Keine Token-Rechnung, solange die Gewichte im Haus bleiben.
Braucht das Linux-Erfahrung?
Ja. Der Spark ist kein Windows-Appliance. Treiber- und CUDA-Lücken sind dokumentiert. Wer nur Chat will, ist mit Ollama auf einer Consumer-GPU oft schneller am Ziel. llama.cpp vs. vLLM.
Fazit und nächster Schritt
128 GB Unified Memory machen Frontier-große Open Weights auf dem Schreibtisch möglich. Claude Code plus LM Studio plus zwei Modelle ist ein belastbarer Einzelplatz. Es ist nicht die schnellste Coding-Karte und kein Unternehmens-Cluster.
Wenn Sie Spark gegen 5090 gegen GPU-Server an Ihrer Last messen wollen (Coding, Batch, Mandantendaten): Speicher, Tokenrate, nicht das Datenblatt.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
Lokale KI 2026: GPU-Wahl 16 GB vs. 24 GB
Lokale KI 2026: Welche GPU reicht wirklich — 16 GB MoE oder 24 GB Qwen? Quantisierung, Runtime und wann ein Cluster Überkauf ist.
KI-Server gebraucht kaufen: Sparpotenzial, Risiken & Checkliste 2026
KI-Server gebraucht kaufen: Bis zu 60% sparen mit gebrauchten GPUs. Worauf beim Kauf achten, welche GPUs sich lohnen, welche Risiken bestehen — mit Checkliste 2026.
Was ist ein KI-Server? Definition und Einsatz
KI-Server erklärt: Was ihn von einem normalen Server unterscheidet, welche drei Bauformen es gibt und wann die Cloud die bessere Wahl bleibt.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)