Published on

2 GPUs für 70B: wann eine Karte nicht reicht

Authors

2 GPUs für 70B: wann eine Karte nicht reicht

TL;DR

Ein dichtes 70B in Q4 liegt bei etwa 35–40 GB nur für die Gewichte, plus KV-Cache. Eine RTX 4090 oder 5090 mit 24 bzw. 32 GB trägt das nicht ohne Offload. Drei Kaufwege: zwei 24-GB-Karten (48 GB), eine 48-GB-Workstation-Karte, oder 128 GB Unified Memory im DGX Spark. Zwei Consumer-Karten haben kein NVLink. Beim Serving reicht PCIe oft. Beim Training nicht. Die meisten Mittelstands-Lasten brauchen 70B nicht — 24 GB plus MoE sind günstiger.

VRAM-Formel: VRAM-Rechner. 24-GB-Einstieg: Lokale KI 2026: 16 vs. 24 GB.

Die Kante, an der eine Karte endet

Der Einstieg ist der KI-Server-Kauf mit einer GPU. Der bricht bei 70B. 8B und 14B in Q4 liegen in 12–16 GB. Ein dichtes 32B in Q4 will 24 GB. 70B in Q4 ist die nächste Stufe, nicht die gleiche Stückliste mit teurerer SKU.

Faustformel, grob, ohne langen Kontext:

70e9 Parameter × 0,5 Byte (Q4)35 GB Gewichte
+ KV-Cache (Kontext × Nutzer) + Runtime

Bei 8k Kontext und einem Nutzer bleibt eine 48-GB-Karte luftig. Bei 32k und drei parallelen Chats ist 48 GB die Kante. Spark mit 128 GB unified schiebt das Problem nach hinten, nicht die Tokenrate.

Drei Stücklisten, eine Frage

zwei 24 GB (z. B. 4090)eine 48 GB (Ada/PRO)DGX Spark
Speicher für 70B Q4ja, Tensor-Parallelja, eine Karteja, unified
Interaktiv (tok/s)hoch, wenn der Split sitzthochniedriger
Stecker / Netzteilzwei 12VHPWR, 1000 W+ein Slot-Pfad250 W USB-C
VerbindungPCIe, kein NVLinkentfällteine GPU
BetriebvLLM -tp 2vLLM -tp 1vLLM/Ollama
RolleSelbstbau, gebrauchtweniger BastelnSpeicher, Mini-PC

Gebrauchte 24-GB-Karten: RTX 3090 gebraucht. Spark-Alltag: DGX Spark.

Zwei 4090 im Desktop sind die übliche Foren-Antwort. Sie funktionieren für Inferenz, wenn Mainboard, Netzteil und Gehäuse zwei volle Karten tragen. Ohne NVLink synchronisiert Tensor-Parallel über PCIe. Beim Serving merken Sie das weniger als beim Fine-Tune. Wer Gewichte wirklich trainiert, kauft oder mietet anders: GPU-Server Training.

Wann Sie 70B gar nicht kaufen sollten

Open-Weight-70B ist ein Statuskauf, wenn die Aufgabe ein 32B oder ein MoE mit 3–8 Milliarden aktiven Parametern löst. Qwen-Coder 30B-A3B auf einem Spark liefert im Coding-Rezept über 70 tok/s, ohne zwei Towers: Qwen3-Coder auf Spark.

70B lohnt, wenn Sie ein konkretes dichtes Modell brauchen (Llama 70B, interne Evaluierung, ein Kunden-Mandat) und Offload unakzeptabel ist. Offload auf CPU heißt einstellige Tokens/Sekunde. Das ist kein Assistent, das ist eine Demo.

Budget unter 1.000 Euro bleibt 16–24 GB und MoE, nicht 70B: Lokale KI unter 1.000 Euro.

Der Betrieb mit zwei Karten

vLLM, nicht Ollama, sobald zwei Karten ein Modell teilen. Ollama kann Schichten splitten, der Produktionsweg ist Tensor-Parallel und ein OpenAI-Port.

vllm serve /models/llama-70b-q4 \
  --tensor-parallel-size 2 \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.90

Beide Karten sollen die gleiche SKU haben. 4090 plus 3090 endet in Synchronisationsärger. nvidia-smi vor dem Kauf: zwei volle x16-Slots, nicht ein x16 und ein x4 hinter einem Chipset.

Strom: zwei 450-W-Karten plus CPU sind keine Steckdosenfrage fürs Büro, sondern USV und Kreis: KI-Server Stromkosten.

Häufige Fragen

Reicht eine RTX 5090 für 70B?

32 GB reichen für 70B Q4 nicht. MoE mit weniger Gesamtgewicht oder ein kleineres Quant mit Qualitätseinbuße. Für echtes 70B Q4: zweite Karte, 48-GB-Karte oder Spark.

Ist zwei mal 24 GB schneller als ein Spark?

Beim Decode meist ja. Der Spark gewinnt beim Speicher (zwei Modelle, langer Kontext) und beim Stecker. Coding-Speed: 5090 oder zwei 4090.

Kann ich später eine zweite 4090 nachrüsten?

Nur wenn Netzteil, Slots und Kühlung von Tag 1 dafür gebaut sind. Eine 4090 in einem 650-W-Büro-PC nachrüsten ist ein Fehlkauf. Lieber zuerst 24 GB und MoE, dann bewusst Stufe 2.

Fazit

70B ist die Stelle, an der „eine gute GPU“ aufhört. Kaufen Sie zwei 24-GB, eine 48-GB-Karte oder Spark — oder bleiben Sie bei 32B/MoE auf einer Karte. Die teuerste Variante ist 70B auf 24 GB mit Offload und der Hoffnung, es werde schon.

Nächster Schritt: Modell festlegen, dann die Stufe, nicht umgekehrt.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen