- Published on
2 GPUs für 70B: wann eine Karte nicht reicht
- Authors

- Name
- Phillip Pham
- @ddppham
2 GPUs für 70B: wann eine Karte nicht reicht
TL;DR
Ein dichtes 70B in Q4 liegt bei etwa 35–40 GB nur für die Gewichte, plus KV-Cache. Eine RTX 4090 oder 5090 mit 24 bzw. 32 GB trägt das nicht ohne Offload. Drei Kaufwege: zwei 24-GB-Karten (48 GB), eine 48-GB-Workstation-Karte, oder 128 GB Unified Memory im DGX Spark. Zwei Consumer-Karten haben kein NVLink. Beim Serving reicht PCIe oft. Beim Training nicht. Die meisten Mittelstands-Lasten brauchen 70B nicht — 24 GB plus MoE sind günstiger.
VRAM-Formel: VRAM-Rechner. 24-GB-Einstieg: Lokale KI 2026: 16 vs. 24 GB.
Die Kante, an der eine Karte endet
Der Einstieg ist der KI-Server-Kauf mit einer GPU. Der bricht bei 70B. 8B und 14B in Q4 liegen in 12–16 GB. Ein dichtes 32B in Q4 will 24 GB. 70B in Q4 ist die nächste Stufe, nicht die gleiche Stückliste mit teurerer SKU.
Faustformel, grob, ohne langen Kontext:
70e9 Parameter × 0,5 Byte (Q4) ≈ 35 GB Gewichte
+ KV-Cache (Kontext × Nutzer) + Runtime
Bei 8k Kontext und einem Nutzer bleibt eine 48-GB-Karte luftig. Bei 32k und drei parallelen Chats ist 48 GB die Kante. Spark mit 128 GB unified schiebt das Problem nach hinten, nicht die Tokenrate.
Drei Stücklisten, eine Frage
| zwei 24 GB (z. B. 4090) | eine 48 GB (Ada/PRO) | DGX Spark | |
|---|---|---|---|
| Speicher für 70B Q4 | ja, Tensor-Parallel | ja, eine Karte | ja, unified |
| Interaktiv (tok/s) | hoch, wenn der Split sitzt | hoch | niedriger |
| Stecker / Netzteil | zwei 12VHPWR, 1000 W+ | ein Slot-Pfad | 250 W USB-C |
| Verbindung | PCIe, kein NVLink | entfällt | eine GPU |
| Betrieb | vLLM -tp 2 | vLLM -tp 1 | vLLM/Ollama |
| Rolle | Selbstbau, gebraucht | weniger Basteln | Speicher, Mini-PC |
Gebrauchte 24-GB-Karten: RTX 3090 gebraucht. Spark-Alltag: DGX Spark.
Zwei 4090 im Desktop sind die übliche Foren-Antwort. Sie funktionieren für Inferenz, wenn Mainboard, Netzteil und Gehäuse zwei volle Karten tragen. Ohne NVLink synchronisiert Tensor-Parallel über PCIe. Beim Serving merken Sie das weniger als beim Fine-Tune. Wer Gewichte wirklich trainiert, kauft oder mietet anders: GPU-Server Training.
Wann Sie 70B gar nicht kaufen sollten
Open-Weight-70B ist ein Statuskauf, wenn die Aufgabe ein 32B oder ein MoE mit 3–8 Milliarden aktiven Parametern löst. Qwen-Coder 30B-A3B auf einem Spark liefert im Coding-Rezept über 70 tok/s, ohne zwei Towers: Qwen3-Coder auf Spark.
70B lohnt, wenn Sie ein konkretes dichtes Modell brauchen (Llama 70B, interne Evaluierung, ein Kunden-Mandat) und Offload unakzeptabel ist. Offload auf CPU heißt einstellige Tokens/Sekunde. Das ist kein Assistent, das ist eine Demo.
Budget unter 1.000 Euro bleibt 16–24 GB und MoE, nicht 70B: Lokale KI unter 1.000 Euro.
Der Betrieb mit zwei Karten
vLLM, nicht Ollama, sobald zwei Karten ein Modell teilen. Ollama kann Schichten splitten, der Produktionsweg ist Tensor-Parallel und ein OpenAI-Port.
vllm serve /models/llama-70b-q4 \
--tensor-parallel-size 2 \
--max-model-len 8192 \
--gpu-memory-utilization 0.90
Beide Karten sollen die gleiche SKU haben. 4090 plus 3090 endet in Synchronisationsärger. nvidia-smi vor dem Kauf: zwei volle x16-Slots, nicht ein x16 und ein x4 hinter einem Chipset.
Strom: zwei 450-W-Karten plus CPU sind keine Steckdosenfrage fürs Büro, sondern USV und Kreis: KI-Server Stromkosten.
Häufige Fragen
Reicht eine RTX 5090 für 70B?
32 GB reichen für 70B Q4 nicht. MoE mit weniger Gesamtgewicht oder ein kleineres Quant mit Qualitätseinbuße. Für echtes 70B Q4: zweite Karte, 48-GB-Karte oder Spark.
Ist zwei mal 24 GB schneller als ein Spark?
Beim Decode meist ja. Der Spark gewinnt beim Speicher (zwei Modelle, langer Kontext) und beim Stecker. Coding-Speed: 5090 oder zwei 4090.
Kann ich später eine zweite 4090 nachrüsten?
Nur wenn Netzteil, Slots und Kühlung von Tag 1 dafür gebaut sind. Eine 4090 in einem 650-W-Büro-PC nachrüsten ist ein Fehlkauf. Lieber zuerst 24 GB und MoE, dann bewusst Stufe 2.
Fazit
70B ist die Stelle, an der „eine gute GPU“ aufhört. Kaufen Sie zwei 24-GB, eine 48-GB-Karte oder Spark — oder bleiben Sie bei 32B/MoE auf einer Karte. Die teuerste Variante ist 70B auf 24 GB mit Offload und der Hoffnung, es werde schon.
Nächster Schritt: Modell festlegen, dann die Stufe, nicht umgekehrt.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
16 GB GPU 2026: 5080, 9070 XT, 4060 Ti
16 GB VRAM 2026: RTX 5080, 5070 Ti, RX 9070 XT und 4060 Ti 16 GB — welche Karte MoE trägt, welche am 27B-Quant scheitert, und warum 16 GB kein 24-GB-Ersatz ist.
KV-Cache: warum Kontext die GPU sprengt
KV-Cache frisst VRAM mit jedem Token und jedem parallelen Nutzer. Warum eine 24-GB-Karte bei 8k reicht und bei 128k scheitert — und was Sie an der GPU-Wahl ändern.
AMD-GPU für lokale KI: RX 9070 XT und ROCm
AMD für lokale KI 2026: RX 9070 XT mit 16 GB gegen RX 7900 XTX mit 24 GB, ROCm unter Linux, Vulkan unter Windows — und wann NVIDIA die einfachere Karte bleibt.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)