Published on

RTX 5090 VRAM: Wie viel VRAM hat die RTX 50er-Serie wirklich?

Authors

RTX 5090 VRAM: Wie viel VRAM hat die RTX 50er-Serie wirklich?

Die kurze Antwort: Die RTX 5090 hat 32 GB GDDR7-VRAM, die RTX 5080 16 GB, die RTX 5070 Ti 16 GB und die RTX 5070 12 GB. Für KI-Server ist vor allem die RTX 5090 mit 32 GB interessant — sie ist die erste Consumer-GPU, die ein 70B-Modell in 4-Bit-Quantisierung komplett in den Speicher bekommt.

Die eigentliche Frage hinter der Suche ist aber meistens eine andere: Reicht der VRAM der RTX 5090 für mein KI-Modell? Dieser Beitrag beantwortet das mit konkreten Zahlen — für alle vier Karten der 50er-Serie, im Vergleich zur Vorgänger-Generation und mit einer klaren Modell-VRAM-Tabelle für den eigenen KI-Server.

Die VRAM-Werte der RTX 50er-Serie im Überblick

GPUVRAMSpeichertypSpeicherbandbreiteStrom (TGP)
RTX 509032 GBGDDR71.792 GB/s575 W
RTX 508016 GBGDDR7960 GB/s360 W
RTX 5070 Ti16 GBGDDR7896 GB/s300 W
RTX 507012 GBGDDR7672 GB/s250 W
RTX 4090 (Vergleich)24 GBGDDR6X1.008 GB/s450 W
RTX 4080 Super16 GBGDDR6X736 GB/s320 W

Die wichtigste Zahl: Die RTX 5090 verdoppelt den VRAM der RTX 4090 nicht — sie erhöht ihn von 24 GB auf 32 GB, also um ein Drittel. Zusammen mit der deutlich höheren Bandbreite (1.792 GB/s statt 1.008 GB/s) ist sie für LLM-Inferenz spürbar schneller pro Modell.

Was bedeutet das für KI-Server?

Der VRAM entscheidet, welches Modell in die Karte passt. Die Faustregel: 1 GB VRAM pro Milliarde Parameter bei 4-Bit-Quantisierung, 2 GB pro Milliarde bei 8-Bit.

ModellParameterVRAM bei 4-BitRTX 5090 (32 GB)RTX 5080 (16 GB)
Llama 3.1 8B8 Mrd~6 GB✅ passt locker✅ passt
Qwen 2.5 14B14 Mrd~10 GB✅ passt✅ passt
Llama 3.3 70B70 Mrd~40 GB❌ zu groß
Llama 3.3 70B (quantisiert, Q4)70 Mrd~35 GB❌ knapp daneben
DeepSeek-V3 (MoE, aktiv 37B)671 Mrd~34 GB (aktiv)✅ passt (MoE)
Mistral Small 3.224 Mrd~14 GB✅ passt✅ passt

Die entscheidende Erkenntnis für den Mittelstand: Die RTX 5090 mit 32 GB erreicht die magische Grenze, ab der die interessantesten Open-Weight-Modelle laufen — aber 70B-Modelle wie Llama 3.3 brauchen selbst quantisiert mehr als 32 GB. Wer 70B-Modelle lokal betreiben will, landet bei zwei RTX 5090 im Verbund oder einer A100 mit 80 GB.

RTX 5090 vs. RTX 4090 für KI: Der echte Unterschied

KriteriumRTX 5090RTX 4090
VRAM32 GB GDDR724 GB GDDR6X
Bandbreite1.792 GB/s1.008 GB/s
Preis (Straße, 2026)ca. 2.000–2.400 EURca. 1.600–1.800 EUR
Strom (TGP)575 W450 W
NVLinkNeinNein
30B-Modell (4-Bit)✅ komfortabel✅ knapp
70B-Modell (4-Bit)

Für Token-Speed bei gleichem Modell ist die RTX 5090 dank der Bandbreite rund 40–60 % schneller als die RTX 4090. Für den Preisunterschied von ca. 400–600 EUR lohnt sich das bei produktiver Nutzung fast immer — die Details stehen im GPU-Vergleich für KI-Inferenz.

Achtung Sackgassen: Die drei häufigsten VRAM-Fehler

1. "Mehr VRAM ist immer besser." Nicht für den Mittelstand. Wer nur 7B-14B-Modelle braucht, kauft mit der 5090 Leistung, die ungenutzt bleibt. Die RTX 5070 Ti mit 16 GB reicht für die meisten Einstiegs-Szenarien — und kostet ein Drittel.

2. "Quantisierung löst alles." 4-Bit-Quantisierung halbiert den VRAM-Bedarf, aber große Modelle (70B+) passen trotzdem nicht in 32 GB. Und stark quantisierte Modelle verlieren messbar Qualität. Die Quantisierungs-Rechnung zeigt, wo die Grenze sinnvoll ist.

3. "Die 5090 kann 70B-Modelle." Nein. 70B braucht ~35 GB bei Q4 — das passt nicht in 32 GB. Wer 70B will, braucht zwei GPUs oder eine Datacenter-Karte. Das ist der am häufigsten unterschätzte Punkt bei der 5090.

Schritt für Schritt: VRAM-Bedarf vor dem Kauf berechnen

Schritt 1: Modell wählen

Das Open-Weight-Modell, das Ihre Anwendung braucht (Llama, Qwen, Mistral). Die Modellauswahl für On-Premise finden Sie im Modell-Vergleich.

Schritt 2: VRAM-Bedarf rechnen

Parameter × Bytes pro Parameter = VRAM-Bedarf
70 Mrd × 0,5 Byte (4-Bit) = 35 GB
70 Mrd × 1,0 Byte (8-Bit) = 70 GB

Schritt 3: Kontext-Länge dazurechnen

Jede Einheit Kontext kostet zusätzlich VRAM. Faustregel: 2 GB Puffer für 128K Kontext plus Betriebssystem und WebUI.

Schritt 4: Karte wählen

BedarfKartePreis (2026)
bis 12 GBRTX 5070ca. 550–650 EUR
bis 16 GBRTX 5080 / 5070 Tica. 1.000–1.200 EUR
bis 24 GBRTX 4090 (gebraucht)ca. 1.200–1.400 EUR
bis 32 GBRTX 5090ca. 2.000–2.400 EUR
über 32 GB2× RTX 5090 / A100 80GBab 4.000 EUR

Schritt 5: Komplett-Konfiguration prüfen

VRAM allein reicht nicht: CPU, RAM und Netzteil müssen zur GPU passen, und die Stromkosten gehören in die Gesamtrechnung.

RTX 5090 kaufen: Was der VRAM kostet

KonfigurationHardware-Kosten3-Jahres-TCO (inkl. Strom)
RTX 5070 (12 GB)ca. 600 EURca. 2.900 EUR
RTX 5080 (16 GB)ca. 1.100 EURca. 4.100 EUR
RTX 5090 (32 GB)ca. 2.200 EURca. 6.500 EUR
2× RTX 5090 (64 GB)ca. 4.400 EURca. 11.500 EUR
Gebrauchte RTX 4090 (24 GB)ca. 1.300 EURca. 4.600 EUR

Einordnung: Die RTX 5090 kostet in der Anschaffung fast das Doppelte der 5080, liefert aber die doppelte Bandbreite und den doppelten VRAM. Für Unternehmen, die täglich 30B-Modelle betreiben, ist das die wirtschaftlichste Einzelkarte — für den Einstieg reicht die 5080.

Entscheidungsmatrix: Welche RTX-Karte für welchen Zweck?

ZweckKarteBegründung
Testen und AusprobierenRTX 5070 (12 GB)Günstigster Einstieg, reicht für 8B-Modelle
RAG mit 14B-ModellenRTX 5080 (16 GB)16 GB reichen für die meisten Mittelstands-Szenarien
Produktiver Betrieb, 30B-ModelleRTX 5090 (32 GB)Die einzige Consumer-Karte für 30B-Modelle
70B-Modelle2× RTX 5090 oder A10032 GB reichen nicht für 70B — das ist Fakt
Maximales BudgetA100 80GB (gebraucht)ab ca. 9.000 EUR, Datacenter-Klasse

Fazit: 32 GB sind die neue Grenze — aber nicht für 70B

Die RTX 5090 mit 32 GB GDDR7 ist 2026 die stärkste Consumer-GPU für KI-Server. Sie ist die erste Karte, die 30B-Modelle komfortabel und schnell lokal betreiben kann — ein klarer Sprung gegenüber der RTX 4090 mit 24 GB. Wer 70B-Modelle braucht, kommt um Multi-GPU oder Datacenter-Hardware nicht herum.

Für den Mittelstand gilt: Kaufen Sie nicht den größten VRAM, sondern den richtigen für Ihr Modell. Die RTX 5080 mit 16 GB reicht für die meisten Einstiegs- und RAG-Szenarien, die RTX 5090 lohnt sich, sobald 30B-Modelle produktiv laufen sollen.

Sie wollen den VRAM-Bedarf für Ihre konkreten Modelle durchrechnen lassen und die passende Hardware konfigurieren? Sprechen Sie uns an, und wir skizzieren gemeinsam die wirtschaftlichste KI-Server-Konfiguration.

Häufige Fragen

Wie viel VRAM hat die RTX 5090?

Die RTX 5090 hat 32 GB GDDR7-VRAM mit einer Speicherbandbreite von 1.792 GB/s. Das ist ein Drittel mehr VRAM als die RTX 4090 (24 GB) bei deutlich höherer Bandbreite.

Welche RTX-Karte hat wie viel VRAM?

RTX 5090: 32 GB. RTX 5080: 16 GB. RTX 5070 Ti: 16 GB. RTX 5070: 12 GB. Zum Vergleich: RTX 4090: 24 GB, RTX 4080 Super: 16 GB.

Reicht die RTX 5090 für 70B-Modelle?

Nein. Ein 70B-Modell braucht ca. 35 GB VRAM bei 4-Bit-Quantisierung — das passt nicht in die 32 GB der RTX 5090. Für 70B-Modelle brauchen Sie zwei RTX 5090 im Verbund oder eine A100 mit 80 GB.

Wie viel VRAM brauche ich für ein KI-Modell?

Faustregel: 1 GB VRAM pro Milliarde Parameter bei 4-Bit-Quantisierung, 2 GB pro Milliarde bei 8-Bit. Ein 8B-Modell braucht also ca. 6–12 GB, ein 30B-Modell ca. 20–40 GB.

Lohnt sich die RTX 5090 gegenüber der RTX 4090?

Für produktive KI-Nutzung ja: 32 GB statt 24 GB VRAM und rund 40–60 % mehr Token-Durchsatz dank höherer Bandbreite. Der Aufpreis von ca. 400–600 EUR amortisiert sich bei regelmäßiger Nutzung schnell.

Welche GPU brauche ich für einen KI-Server mit 30B-Modellen?

Die RTX 5090 mit 32 GB ist die einzige Consumer-GPU, die 30B-Modelle komfortabel betreiben kann. Alternativ zwei RTX 5080 oder eine gebrauchte A100 — die vollständige Übersicht finden Sie im GPU-VRAM-Rechner.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen