Published on

VRAM-Rechner für KI-Modelle: Welche GPU braucht welches Modell?

Authors

Kurzantwort: So viel VRAM braucht ein KI-Modell

Die VRAM-Formel für LLMs lautet: Parameter × Bytes pro Parameter = VRAM-Bedarf. Ein 8B-Modell in 16-Bit braucht 16 GB, in 4-Bit-Quantisierung nur 4-5 GB. Ein 70B-Modell braucht in 4-Bit etwa 40 GB, in voller Präzision 140+ GB. Dazu kommen 10-20% Overhead für KV-Cache und Kontext. Die Faustregel für den Mittelstand 2026: Für Modelle bis 8B reicht eine RTX 4060/4070 (12-16 GB), für 32B eine RTX 4090 (24 GB), für 70B zwei RTX 4090 oder eine A6000 (48 GB). Dieser Leitfaden zeigt die Formel, die Tabellen für alle gängigen Modelle und die GPU-Wahl danach.

Die meisten Angaben im Netz sind vage. Dieser Beitrag rechnet konkret: Formel, Beispiele für Llama, DeepSeek, Qwen, Mistral und GLM, plus die GPU-Empfehlung für jede Modellklasse.

Die VRAM-Formel verstehen

Die Berechnung des VRAM-Bedarfs ist einfacher als gedacht. Die Grundformel:

VRAM = Parameteranzahl × Bytes pro Parameter × (1 + Overhead)

Bytes pro Parameter nach Präzision:

PräzisionBytes/ParameterBeispiel 8BBeispiel 70B
FP32 (voll)4 Bytes32 GB280 GB
FP16/BF162 Bytes16 GB140 GB
INT8 (Quantisierung)1 Byte8 GB70 GB
INT4 (Quantisierung)0,5 Bytes4 GB35 GB

Overhead: Dazu kommen 10-20% für KV-Cache (Kontext), Aktivierungen und Inferenz-Puffer. Bei langen Kontexten (128k+) kann der KV-Cache den Bedarf deutlich erhöhen — bei sehr langen Kontexten sogar verdoppeln.

VRAM-Tabelle: Die gängigsten Modelle 2026

ModellParameterINT4 VRAMFP16 VRAMEmpfohlene GPU
Llama 3.1 8B8B5-6 GB16-18 GBRTX 4060/4070 (12-16 GB)
Qwen 2.5 7B7B4-5 GB14-16 GBRTX 4060/4070
Mistral 7B7B4-5 GB14-16 GBRTX 4060/4070
DeepSeek-R1-Distill 14B14B8-10 GB28-32 GBRTX 4070/4080
Llama 3.3 70B (INT4)70B35-42 GB140+ GB2x RTX 4090 oder 1x A6000
Qwen 2.5 72B (INT4)72B36-43 GB144+ GB2x RTX 4090 oder 1x A6000
Mistral Large 2123B62-74 GB246+ GB2x A6000 oder 4x RTX 4090
DeepSeek V3671B (MoE)100-150 GB aktiv1,3 TB4-8x A6000/H100
DeepSeek V4 Flash284B (MoE)80-120 GB aktiv570+ GB4x A6000/L40S
GLM-5.2120B+60-80 GB240+ GB2-4x A6000

Wichtig bei MoE-Modellen (DeepSeek, GLM): Nur die aktiven Experten laden in den VRAM — der Gesamtspeicherbedarf liegt trotzdem oft über 100 GB. Die Praxis zeigt der DeepSeek-V4-Flash-VRAM-Leitfaden.

Die 5 Schritte zur GPU-Wahl

  1. Modell wählen: Welches Modell löst den Use Case? (Deutsch, Agenten, Bild, Code?)
  2. Präzision bestimmen: INT4 für den Einstieg, FP16 wenn Qualität kritisch ist. Die meisten Produktiv-Setups nutzen INT4/INT8.
  3. VRAM berechnen: Parameter × Bytes (INT4: 0,5) × 1,15 Overhead.
  4. Kontext einplanen: Bei RAG mit langen Dokumenten 20-50% mehr VRAM einplanen.
  5. GPU wählen: Aus der Tabelle unten. Bei mehreren GPUs: VRAM addiert sich.

Die GPU-Modelle im Detail: RTX 4090 vs. A6000 vs. L40S und GPU-LLM-Inferenz im Praxistest.

GPU-Auswahl nach VRAM

VRAM-BedarfGPU-OptionKosten (Richtwert)
8-12 GBRTX 4060 Ti 16 GB, RTX 4070500-800 EUR
16-24 GBRTX 40901.800-2.000 EUR
24-48 GB2x RTX 4090, A6000 (48 GB)3.500-6.000 EUR
48-96 GB2x A6000, 4x RTX 40907.000-12.000 EUR
96-160 GB4x A6000/L40S, DGX Spark15.000-40.000 EUR
160+ GBH100/A100 Systeme60.000-250.000 EUR

Wichtig: Bei mehreren GPUs muss die Software den VRAM über Model Parallelism verteilen können. vLLM und Tensor Parallelism können das. Ollama nutzt bei großen Modellen automatisch mehrere GPUs.

Praxisbeispiele: Die VRAM-Rechnung durchspielen

Beispiel 1: Chat-Assistent mit RAG (Llama 3.1 8B)

  • Modell: 8B in INT4 = 4 GB
  • KV-Cache für 8k Kontext: 1-2 GB
  • Overhead + Aktivierungen: 1 GB
  • Gesamt: 6-7 GB → RTX 4060/4070 reicht

Beispiel 2: 70B-Modell produktiv (Llama 3.3 70B)

  • Modell: 70B in INT4 = 35 GB
  • KV-Cache für 32k Kontext: 4-8 GB
  • Overhead: 3-5 GB
  • Gesamt: 42-48 GB → 2x RTX 4090 (48 GB) oder 1x A6000

Beispiel 3: DeepSeek V4 Flash (284B MoE)

  • Aktive Parameter: ~30-40B effektiv, aber Gesamtgewicht 284B
  • INT4 Gesamt: 140 GB, mit aktivem Expert-Slicing 80-120 GB
  • Gesamt: 100-140 GB → 4x A6000/L40S oder GPU-Cloud

Die Rechenbeispiele für die deutschen Markt-Favoriten: DeepSeek V4 Flash VRAM, GLM-5.2 Hardware und SOOFI selbst hosten.

Kontextfenster: Der unterschätzte VRAM-Fresser

Der KV-Cache skaliert linear mit der Kontextlänge. Faustregeln:

  • 8k Kontext: +1-2 GB (kleine Modelle), +4-8 GB (70B)
  • 32k Kontext: +4-8 GB (kleine), +16-32 GB (70B)
  • 128k Kontext: +16-32 GB (kleine), +64-128 GB (70B)

Wer mit langen Dokumenten arbeitet (RAG, Vertragsanalyse), sollte den Kontextbedarf vor der GPU-Wahl kennen. Die RAG-Architektur zeigt, wie man Kontext effizient nutzt. Tipp: Chunking und Retrieval reduzieren den Kontextbedarf deutlich — oft reicht dann eine kleinere GPU.

Quantisierung: Der Hebel für weniger VRAM

Quantisierung reduziert den VRAM-Bedarf drastisch:

QuantisierungVRAM (70B)Qualitätsverlust
FP16140 GBKeiner
INT870 GBMinimal
INT435-42 GBGering, für die meisten Use Cases akzeptabel
INT3/2bit26-30 GBDeutlich, nur Tests

Die Praxis der Modell-Optimierung: Ollama Modelfile erstellen zeigt, wie Quantisierungsstufen in Ollama konfiguriert werden. Der Durchsatz-Benchmark zeigt die Performance-Unterschiede.

Tools zum VRAM-Berechnen

Neben der Formel helfen diese Tools:

  • HuggingFace Memory Calculator (online): Parameter + Präzision → VRAM
  • Ollama Modell-Info: ollama show llama3.3:70b zeigt Parameter und Quantisierung
  • nvidia-smi: Zeigt den tatsächlichen VRAM-Verbrauch im Betrieb
  • vLLM Logs: Zeigen bei Start den benötigten VRAM inkl. KV-Cache

Die Überwachung im Betrieb: Prometheus + Grafana + DCGM visualisiert die VRAM-Auslastung laufend — damit sieht man sofort, ob die GPU-Wahl passt oder ob ein Upgrade nötig ist.

FAQ

Wie viel VRAM braucht ein 7B-Modell?

Ein 7B-Modell braucht in INT4-Quantisierung 4-5 GB, in FP16 14-16 GB. Mit Overhead und Kontext sind 8-12 GB VRAM realistisch — eine RTX 4060/4070 mit 12-16 GB reicht.

Wie viel VRAM braucht Llama 3.3 70B?

Llama 3.3 70B braucht in INT4 etwa 35-42 GB VRAM (mit Overhead), in FP16 140+ GB. Empfohlen: 2x RTX 4090 (48 GB) oder eine A6000 (48 GB) für den INT4-Betrieb.

Wie berechne ich den VRAM-Bedarf eines KI-Modells?

Parameter × Bytes pro Parameter (INT4: 0,5 / INT8: 1 / FP16: 2) × 1,15 Overhead. Dazu den KV-Cache für die gewünschte Kontextlänge addieren (bei 70B: ca. 4-8 GB pro 32k Kontext).

Reichen 16 GB VRAM für KI?

Für Modelle bis 14B in Quantisierung ja. Für 32B-Modelle wird es eng (braucht 16-20 GB), für 70B reichen 16 GB nicht. Wer mit großen Modellen arbeiten will, braucht 24 GB (RTX 4090) oder mehr.

Wie viel VRAM braucht DeepSeek V4 Flash?

DeepSeek V4 Flash (284B, MoE) braucht in INT4 etwa 80-140 GB VRAM, je nach aktivem Expert-Slicing. Empfohlen: 4x A6000/L40S oder eine GPU-Cloud. Die Detail-Rechnung steht im DeepSeek-V4-VRAM-Leitfaden.

Kann ich mehrere GPUs für ein Modell kombinieren?

Ja. Modelle über 40 GB VRAM lassen sich auf mehrere GPUs verteilen — vLLM nutzt Tensor Parallelism, Ollama lädt automatisch auf mehrere GPUs. Die Multi-GPU-Anleitung zeigt die Konfiguration.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen