- Published on
VRAM-Rechner für KI-Modelle: Welche GPU braucht welches Modell?
- Authors

- Name
- Phillip Pham
- @ddppham
Kurzantwort: So viel VRAM braucht ein KI-Modell
Die VRAM-Formel für LLMs lautet: Parameter × Bytes pro Parameter = VRAM-Bedarf. Ein 8B-Modell in 16-Bit braucht 16 GB, in 4-Bit-Quantisierung nur 4-5 GB. Ein 70B-Modell braucht in 4-Bit etwa 40 GB, in voller Präzision 140+ GB. Dazu kommen 10-20% Overhead für KV-Cache und Kontext. Die Faustregel für den Mittelstand 2026: Für Modelle bis 8B reicht eine RTX 4060/4070 (12-16 GB), für 32B eine RTX 4090 (24 GB), für 70B zwei RTX 4090 oder eine A6000 (48 GB). Dieser Leitfaden zeigt die Formel, die Tabellen für alle gängigen Modelle und die GPU-Wahl danach.
Die meisten Angaben im Netz sind vage. Dieser Beitrag rechnet konkret: Formel, Beispiele für Llama, DeepSeek, Qwen, Mistral und GLM, plus die GPU-Empfehlung für jede Modellklasse.
Die VRAM-Formel verstehen
Die Berechnung des VRAM-Bedarfs ist einfacher als gedacht. Die Grundformel:
VRAM = Parameteranzahl × Bytes pro Parameter × (1 + Overhead)
Bytes pro Parameter nach Präzision:
| Präzision | Bytes/Parameter | Beispiel 8B | Beispiel 70B |
|---|---|---|---|
| FP32 (voll) | 4 Bytes | 32 GB | 280 GB |
| FP16/BF16 | 2 Bytes | 16 GB | 140 GB |
| INT8 (Quantisierung) | 1 Byte | 8 GB | 70 GB |
| INT4 (Quantisierung) | 0,5 Bytes | 4 GB | 35 GB |
Overhead: Dazu kommen 10-20% für KV-Cache (Kontext), Aktivierungen und Inferenz-Puffer. Bei langen Kontexten (128k+) kann der KV-Cache den Bedarf deutlich erhöhen — bei sehr langen Kontexten sogar verdoppeln.
VRAM-Tabelle: Die gängigsten Modelle 2026
| Modell | Parameter | INT4 VRAM | FP16 VRAM | Empfohlene GPU |
|---|---|---|---|---|
| Llama 3.1 8B | 8B | 5-6 GB | 16-18 GB | RTX 4060/4070 (12-16 GB) |
| Qwen 2.5 7B | 7B | 4-5 GB | 14-16 GB | RTX 4060/4070 |
| Mistral 7B | 7B | 4-5 GB | 14-16 GB | RTX 4060/4070 |
| DeepSeek-R1-Distill 14B | 14B | 8-10 GB | 28-32 GB | RTX 4070/4080 |
| Llama 3.3 70B (INT4) | 70B | 35-42 GB | 140+ GB | 2x RTX 4090 oder 1x A6000 |
| Qwen 2.5 72B (INT4) | 72B | 36-43 GB | 144+ GB | 2x RTX 4090 oder 1x A6000 |
| Mistral Large 2 | 123B | 62-74 GB | 246+ GB | 2x A6000 oder 4x RTX 4090 |
| DeepSeek V3 | 671B (MoE) | 100-150 GB aktiv | 1,3 TB | 4-8x A6000/H100 |
| DeepSeek V4 Flash | 284B (MoE) | 80-120 GB aktiv | 570+ GB | 4x A6000/L40S |
| GLM-5.2 | 120B+ | 60-80 GB | 240+ GB | 2-4x A6000 |
Wichtig bei MoE-Modellen (DeepSeek, GLM): Nur die aktiven Experten laden in den VRAM — der Gesamtspeicherbedarf liegt trotzdem oft über 100 GB. Die Praxis zeigt der DeepSeek-V4-Flash-VRAM-Leitfaden.
Die 5 Schritte zur GPU-Wahl
- Modell wählen: Welches Modell löst den Use Case? (Deutsch, Agenten, Bild, Code?)
- Präzision bestimmen: INT4 für den Einstieg, FP16 wenn Qualität kritisch ist. Die meisten Produktiv-Setups nutzen INT4/INT8.
- VRAM berechnen: Parameter × Bytes (INT4: 0,5) × 1,15 Overhead.
- Kontext einplanen: Bei RAG mit langen Dokumenten 20-50% mehr VRAM einplanen.
- GPU wählen: Aus der Tabelle unten. Bei mehreren GPUs: VRAM addiert sich.
Die GPU-Modelle im Detail: RTX 4090 vs. A6000 vs. L40S und GPU-LLM-Inferenz im Praxistest.
GPU-Auswahl nach VRAM
| VRAM-Bedarf | GPU-Option | Kosten (Richtwert) |
|---|---|---|
| 8-12 GB | RTX 4060 Ti 16 GB, RTX 4070 | 500-800 EUR |
| 16-24 GB | RTX 4090 | 1.800-2.000 EUR |
| 24-48 GB | 2x RTX 4090, A6000 (48 GB) | 3.500-6.000 EUR |
| 48-96 GB | 2x A6000, 4x RTX 4090 | 7.000-12.000 EUR |
| 96-160 GB | 4x A6000/L40S, DGX Spark | 15.000-40.000 EUR |
| 160+ GB | H100/A100 Systeme | 60.000-250.000 EUR |
Wichtig: Bei mehreren GPUs muss die Software den VRAM über Model Parallelism verteilen können. vLLM und Tensor Parallelism können das. Ollama nutzt bei großen Modellen automatisch mehrere GPUs.
Praxisbeispiele: Die VRAM-Rechnung durchspielen
Beispiel 1: Chat-Assistent mit RAG (Llama 3.1 8B)
- Modell: 8B in INT4 = 4 GB
- KV-Cache für 8k Kontext: 1-2 GB
- Overhead + Aktivierungen: 1 GB
- Gesamt: 6-7 GB → RTX 4060/4070 reicht
Beispiel 2: 70B-Modell produktiv (Llama 3.3 70B)
- Modell: 70B in INT4 = 35 GB
- KV-Cache für 32k Kontext: 4-8 GB
- Overhead: 3-5 GB
- Gesamt: 42-48 GB → 2x RTX 4090 (48 GB) oder 1x A6000
Beispiel 3: DeepSeek V4 Flash (284B MoE)
- Aktive Parameter: ~30-40B effektiv, aber Gesamtgewicht 284B
- INT4 Gesamt: 140 GB, mit aktivem Expert-Slicing 80-120 GB
- Gesamt: 100-140 GB → 4x A6000/L40S oder GPU-Cloud
Die Rechenbeispiele für die deutschen Markt-Favoriten: DeepSeek V4 Flash VRAM, GLM-5.2 Hardware und SOOFI selbst hosten.
Kontextfenster: Der unterschätzte VRAM-Fresser
Der KV-Cache skaliert linear mit der Kontextlänge. Faustregeln:
- 8k Kontext: +1-2 GB (kleine Modelle), +4-8 GB (70B)
- 32k Kontext: +4-8 GB (kleine), +16-32 GB (70B)
- 128k Kontext: +16-32 GB (kleine), +64-128 GB (70B)
Wer mit langen Dokumenten arbeitet (RAG, Vertragsanalyse), sollte den Kontextbedarf vor der GPU-Wahl kennen. Die RAG-Architektur zeigt, wie man Kontext effizient nutzt. Tipp: Chunking und Retrieval reduzieren den Kontextbedarf deutlich — oft reicht dann eine kleinere GPU.
Quantisierung: Der Hebel für weniger VRAM
Quantisierung reduziert den VRAM-Bedarf drastisch:
| Quantisierung | VRAM (70B) | Qualitätsverlust |
|---|---|---|
| FP16 | 140 GB | Keiner |
| INT8 | 70 GB | Minimal |
| INT4 | 35-42 GB | Gering, für die meisten Use Cases akzeptabel |
| INT3/2bit | 26-30 GB | Deutlich, nur Tests |
Die Praxis der Modell-Optimierung: Ollama Modelfile erstellen zeigt, wie Quantisierungsstufen in Ollama konfiguriert werden. Der Durchsatz-Benchmark zeigt die Performance-Unterschiede.
Tools zum VRAM-Berechnen
Neben der Formel helfen diese Tools:
- HuggingFace Memory Calculator (online): Parameter + Präzision → VRAM
- Ollama Modell-Info:
ollama show llama3.3:70bzeigt Parameter und Quantisierung - nvidia-smi: Zeigt den tatsächlichen VRAM-Verbrauch im Betrieb
- vLLM Logs: Zeigen bei Start den benötigten VRAM inkl. KV-Cache
Die Überwachung im Betrieb: Prometheus + Grafana + DCGM visualisiert die VRAM-Auslastung laufend — damit sieht man sofort, ob die GPU-Wahl passt oder ob ein Upgrade nötig ist.
FAQ
Wie viel VRAM braucht ein 7B-Modell?
Ein 7B-Modell braucht in INT4-Quantisierung 4-5 GB, in FP16 14-16 GB. Mit Overhead und Kontext sind 8-12 GB VRAM realistisch — eine RTX 4060/4070 mit 12-16 GB reicht.
Wie viel VRAM braucht Llama 3.3 70B?
Llama 3.3 70B braucht in INT4 etwa 35-42 GB VRAM (mit Overhead), in FP16 140+ GB. Empfohlen: 2x RTX 4090 (48 GB) oder eine A6000 (48 GB) für den INT4-Betrieb.
Wie berechne ich den VRAM-Bedarf eines KI-Modells?
Parameter × Bytes pro Parameter (INT4: 0,5 / INT8: 1 / FP16: 2) × 1,15 Overhead. Dazu den KV-Cache für die gewünschte Kontextlänge addieren (bei 70B: ca. 4-8 GB pro 32k Kontext).
Reichen 16 GB VRAM für KI?
Für Modelle bis 14B in Quantisierung ja. Für 32B-Modelle wird es eng (braucht 16-20 GB), für 70B reichen 16 GB nicht. Wer mit großen Modellen arbeiten will, braucht 24 GB (RTX 4090) oder mehr.
Wie viel VRAM braucht DeepSeek V4 Flash?
DeepSeek V4 Flash (284B, MoE) braucht in INT4 etwa 80-140 GB VRAM, je nach aktivem Expert-Slicing. Empfohlen: 4x A6000/L40S oder eine GPU-Cloud. Die Detail-Rechnung steht im DeepSeek-V4-VRAM-Leitfaden.
Kann ich mehrere GPUs für ein Modell kombinieren?
Ja. Modelle über 40 GB VRAM lassen sich auf mehrere GPUs verteilen — vLLM nutzt Tensor Parallelism, Ollama lädt automatisch auf mehrere GPUs. Die Multi-GPU-Anleitung zeigt die Konfiguration.
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
KI-Server gebraucht kaufen: Sparpotenzial, Risiken & Checkliste 2026
KI-Server gebraucht kaufen: Bis zu 60% sparen mit gebrauchten GPUs. Worauf beim Kauf achten, welche GPUs sich lohnen, welche Risiken bestehen — mit Checkliste 2026.
MoE erklärt: warum 30B nicht 30B VRAM braucht
Ein 30B-MoE belegt die vollen 19 GB VRAM — sparsam ist nur die Rechenlast pro Token. Die Speicherrechnung Posten für Posten, mit Modelltabelle.
KI-Server kaufen: Der komplette Leitfaden 2026 für den Mittelstand
KI-Server kaufen für den Mittelstand: Kaufentscheidung, Hardware, Kosten, Anbieter und ROI. Der komplette Leitfaden 2026 mit Vergleich kaufen vs. mieten vs. selbst bauen.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)