- Published on
RTX 5090 VRAM: Wie viel VRAM hat die RTX 50er-Serie wirklich?
- Authors

- Name
- Phillip Pham
- @ddppham
RTX 5090 VRAM: Wie viel VRAM hat die RTX 50er-Serie wirklich?
Die kurze Antwort: Die RTX 5090 hat 32 GB GDDR7-VRAM, die RTX 5080 16 GB, die RTX 5070 Ti 16 GB und die RTX 5070 12 GB. Für KI-Server ist vor allem die RTX 5090 mit 32 GB interessant — sie ist die erste Consumer-GPU, die ein 70B-Modell in 4-Bit-Quantisierung komplett in den Speicher bekommt.
Die eigentliche Frage hinter der Suche ist aber meistens eine andere: Reicht der VRAM der RTX 5090 für mein KI-Modell? Dieser Beitrag beantwortet das mit konkreten Zahlen — für alle vier Karten der 50er-Serie, im Vergleich zur Vorgänger-Generation und mit einer klaren Modell-VRAM-Tabelle für den eigenen KI-Server.
Die VRAM-Werte der RTX 50er-Serie im Überblick
| GPU | VRAM | Speichertyp | Speicherbandbreite | Strom (TGP) |
|---|---|---|---|---|
| RTX 5090 | 32 GB | GDDR7 | 1.792 GB/s | 575 W |
| RTX 5080 | 16 GB | GDDR7 | 960 GB/s | 360 W |
| RTX 5070 Ti | 16 GB | GDDR7 | 896 GB/s | 300 W |
| RTX 5070 | 12 GB | GDDR7 | 672 GB/s | 250 W |
| RTX 4090 (Vergleich) | 24 GB | GDDR6X | 1.008 GB/s | 450 W |
| RTX 4080 Super | 16 GB | GDDR6X | 736 GB/s | 320 W |
Die wichtigste Zahl: Die RTX 5090 verdoppelt den VRAM der RTX 4090 nicht — sie erhöht ihn von 24 GB auf 32 GB, also um ein Drittel. Zusammen mit der deutlich höheren Bandbreite (1.792 GB/s statt 1.008 GB/s) ist sie für LLM-Inferenz spürbar schneller pro Modell.
Was bedeutet das für KI-Server?
Der VRAM entscheidet, welches Modell in die Karte passt. Die Faustregel: 1 GB VRAM pro Milliarde Parameter bei 4-Bit-Quantisierung, 2 GB pro Milliarde bei 8-Bit.
| Modell | Parameter | VRAM bei 4-Bit | RTX 5090 (32 GB) | RTX 5080 (16 GB) |
|---|---|---|---|---|
| Llama 3.1 8B | 8 Mrd | ~6 GB | ✅ passt locker | ✅ passt |
| Qwen 2.5 14B | 14 Mrd | ~10 GB | ✅ passt | ✅ passt |
| Llama 3.3 70B | 70 Mrd | ~40 GB | ❌ zu groß | ❌ |
| Llama 3.3 70B (quantisiert, Q4) | 70 Mrd | ~35 GB | ❌ knapp daneben | ❌ |
| DeepSeek-V3 (MoE, aktiv 37B) | 671 Mrd | ~34 GB (aktiv) | ✅ passt (MoE) | ❌ |
| Mistral Small 3.2 | 24 Mrd | ~14 GB | ✅ passt | ✅ passt |
Die entscheidende Erkenntnis für den Mittelstand: Die RTX 5090 mit 32 GB erreicht die magische Grenze, ab der die interessantesten Open-Weight-Modelle laufen — aber 70B-Modelle wie Llama 3.3 brauchen selbst quantisiert mehr als 32 GB. Wer 70B-Modelle lokal betreiben will, landet bei zwei RTX 5090 im Verbund oder einer A100 mit 80 GB.
RTX 5090 vs. RTX 4090 für KI: Der echte Unterschied
| Kriterium | RTX 5090 | RTX 4090 |
|---|---|---|
| VRAM | 32 GB GDDR7 | 24 GB GDDR6X |
| Bandbreite | 1.792 GB/s | 1.008 GB/s |
| Preis (Straße, 2026) | ca. 2.000–2.400 EUR | ca. 1.600–1.800 EUR |
| Strom (TGP) | 575 W | 450 W |
| NVLink | Nein | Nein |
| 30B-Modell (4-Bit) | ✅ komfortabel | ✅ knapp |
| 70B-Modell (4-Bit) | ❌ | ❌ |
Für Token-Speed bei gleichem Modell ist die RTX 5090 dank der Bandbreite rund 40–60 % schneller als die RTX 4090. Für den Preisunterschied von ca. 400–600 EUR lohnt sich das bei produktiver Nutzung fast immer — die Details stehen im GPU-Vergleich für KI-Inferenz.
Achtung Sackgassen: Die drei häufigsten VRAM-Fehler
1. "Mehr VRAM ist immer besser." Nicht für den Mittelstand. Wer nur 7B-14B-Modelle braucht, kauft mit der 5090 Leistung, die ungenutzt bleibt. Die RTX 5070 Ti mit 16 GB reicht für die meisten Einstiegs-Szenarien — und kostet ein Drittel.
2. "Quantisierung löst alles." 4-Bit-Quantisierung halbiert den VRAM-Bedarf, aber große Modelle (70B+) passen trotzdem nicht in 32 GB. Und stark quantisierte Modelle verlieren messbar Qualität. Die Quantisierungs-Rechnung zeigt, wo die Grenze sinnvoll ist.
3. "Die 5090 kann 70B-Modelle." Nein. 70B braucht ~35 GB bei Q4 — das passt nicht in 32 GB. Wer 70B will, braucht zwei GPUs oder eine Datacenter-Karte. Das ist der am häufigsten unterschätzte Punkt bei der 5090.
Schritt für Schritt: VRAM-Bedarf vor dem Kauf berechnen
Schritt 1: Modell wählen
Das Open-Weight-Modell, das Ihre Anwendung braucht (Llama, Qwen, Mistral). Die Modellauswahl für On-Premise finden Sie im Modell-Vergleich.
Schritt 2: VRAM-Bedarf rechnen
Parameter × Bytes pro Parameter = VRAM-Bedarf
70 Mrd × 0,5 Byte (4-Bit) = 35 GB
70 Mrd × 1,0 Byte (8-Bit) = 70 GB
Schritt 3: Kontext-Länge dazurechnen
Jede Einheit Kontext kostet zusätzlich VRAM. Faustregel: 2 GB Puffer für 128K Kontext plus Betriebssystem und WebUI.
Schritt 4: Karte wählen
| Bedarf | Karte | Preis (2026) |
|---|---|---|
| bis 12 GB | RTX 5070 | ca. 550–650 EUR |
| bis 16 GB | RTX 5080 / 5070 Ti | ca. 1.000–1.200 EUR |
| bis 24 GB | RTX 4090 (gebraucht) | ca. 1.200–1.400 EUR |
| bis 32 GB | RTX 5090 | ca. 2.000–2.400 EUR |
| über 32 GB | 2× RTX 5090 / A100 80GB | ab 4.000 EUR |
Schritt 5: Komplett-Konfiguration prüfen
VRAM allein reicht nicht: CPU, RAM und Netzteil müssen zur GPU passen, und die Stromkosten gehören in die Gesamtrechnung.
RTX 5090 kaufen: Was der VRAM kostet
| Konfiguration | Hardware-Kosten | 3-Jahres-TCO (inkl. Strom) |
|---|---|---|
| RTX 5070 (12 GB) | ca. 600 EUR | ca. 2.900 EUR |
| RTX 5080 (16 GB) | ca. 1.100 EUR | ca. 4.100 EUR |
| RTX 5090 (32 GB) | ca. 2.200 EUR | ca. 6.500 EUR |
| 2× RTX 5090 (64 GB) | ca. 4.400 EUR | ca. 11.500 EUR |
| Gebrauchte RTX 4090 (24 GB) | ca. 1.300 EUR | ca. 4.600 EUR |
Einordnung: Die RTX 5090 kostet in der Anschaffung fast das Doppelte der 5080, liefert aber die doppelte Bandbreite und den doppelten VRAM. Für Unternehmen, die täglich 30B-Modelle betreiben, ist das die wirtschaftlichste Einzelkarte — für den Einstieg reicht die 5080.
Entscheidungsmatrix: Welche RTX-Karte für welchen Zweck?
| Zweck | Karte | Begründung |
|---|---|---|
| Testen und Ausprobieren | RTX 5070 (12 GB) | Günstigster Einstieg, reicht für 8B-Modelle |
| RAG mit 14B-Modellen | RTX 5080 (16 GB) | 16 GB reichen für die meisten Mittelstands-Szenarien |
| Produktiver Betrieb, 30B-Modelle | RTX 5090 (32 GB) | Die einzige Consumer-Karte für 30B-Modelle |
| 70B-Modelle | 2× RTX 5090 oder A100 | 32 GB reichen nicht für 70B — das ist Fakt |
| Maximales Budget | A100 80GB (gebraucht) | ab ca. 9.000 EUR, Datacenter-Klasse |
Fazit: 32 GB sind die neue Grenze — aber nicht für 70B
Die RTX 5090 mit 32 GB GDDR7 ist 2026 die stärkste Consumer-GPU für KI-Server. Sie ist die erste Karte, die 30B-Modelle komfortabel und schnell lokal betreiben kann — ein klarer Sprung gegenüber der RTX 4090 mit 24 GB. Wer 70B-Modelle braucht, kommt um Multi-GPU oder Datacenter-Hardware nicht herum.
Für den Mittelstand gilt: Kaufen Sie nicht den größten VRAM, sondern den richtigen für Ihr Modell. Die RTX 5080 mit 16 GB reicht für die meisten Einstiegs- und RAG-Szenarien, die RTX 5090 lohnt sich, sobald 30B-Modelle produktiv laufen sollen.
Sie wollen den VRAM-Bedarf für Ihre konkreten Modelle durchrechnen lassen und die passende Hardware konfigurieren? Sprechen Sie uns an, und wir skizzieren gemeinsam die wirtschaftlichste KI-Server-Konfiguration.
Häufige Fragen
Wie viel VRAM hat die RTX 5090?
Die RTX 5090 hat 32 GB GDDR7-VRAM mit einer Speicherbandbreite von 1.792 GB/s. Das ist ein Drittel mehr VRAM als die RTX 4090 (24 GB) bei deutlich höherer Bandbreite.
Welche RTX-Karte hat wie viel VRAM?
RTX 5090: 32 GB. RTX 5080: 16 GB. RTX 5070 Ti: 16 GB. RTX 5070: 12 GB. Zum Vergleich: RTX 4090: 24 GB, RTX 4080 Super: 16 GB.
Reicht die RTX 5090 für 70B-Modelle?
Nein. Ein 70B-Modell braucht ca. 35 GB VRAM bei 4-Bit-Quantisierung — das passt nicht in die 32 GB der RTX 5090. Für 70B-Modelle brauchen Sie zwei RTX 5090 im Verbund oder eine A100 mit 80 GB.
Wie viel VRAM brauche ich für ein KI-Modell?
Faustregel: 1 GB VRAM pro Milliarde Parameter bei 4-Bit-Quantisierung, 2 GB pro Milliarde bei 8-Bit. Ein 8B-Modell braucht also ca. 6–12 GB, ein 30B-Modell ca. 20–40 GB.
Lohnt sich die RTX 5090 gegenüber der RTX 4090?
Für produktive KI-Nutzung ja: 32 GB statt 24 GB VRAM und rund 40–60 % mehr Token-Durchsatz dank höherer Bandbreite. Der Aufpreis von ca. 400–600 EUR amortisiert sich bei regelmäßiger Nutzung schnell.
Welche GPU brauche ich für einen KI-Server mit 30B-Modellen?
Die RTX 5090 mit 32 GB ist die einzige Consumer-GPU, die 30B-Modelle komfortabel betreiben kann. Alternativ zwei RTX 5080 oder eine gebrauchte A100 — die vollständige Übersicht finden Sie im GPU-VRAM-Rechner.
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
RTX 5090 vs A100 für KI-Server im Mittelstand — welcher GPU ist richtig?
RTX 5090 vs A100: Welcher GPU für KI-Server im Mittelstand? VRAM, Kosten, Performance, Stromverbrauch, On-Premise vs Datacenter. Entscheidungshilfe.
NVIDIA-Treiber & CUDA installieren: Das komplette GPU-Setup 2026
NVIDIA-Treiber und CUDA auf Ubuntu installieren: Die Schritt-für-Schritt-Anleitung für KI-Server 2026 — inklusive Secure Boot, Treiber-Wahl und Fehlerbehebung.
Nemotron 3 Ultra: NVIDIAs offenes Modell im Unternehmen
550 Milliarden Parameter unter einer Lizenz der Linux Foundation — mit offenen Trainingsdaten. Warum das für Compliance-Abteilungen den Unterschied macht.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)