Published on

Video RAM vs. VRAM: So viel Grafikspeicher braucht Ihre KI wirklich

Authors

TL;DR: Dedizierter Video RAM (VRAM) ist 20–100x schneller als Shared Memory. Für ein 7B-Modell reichen 8–12 GB, für 13B–30B brauchen Sie 24–48 GB, für 70B+ sind 96–288 GB nötig. Mittelständische Unternehmen mit DSGVO-konformer KI setzen meist auf 24–48 GB GPUs (RTX 5090, L40S, A5000) oder mieten H100/B200 in der Cloud. Entscheidend ist: Das Modell muss komplett in den VRAM passen – ein Overflow in Shared Memory kostet 80–90 % Performance.

Video RAM vs. VRAM: Was ist der Unterschied?

Video RAM (VRAM) und dedizierter Grafikspeicher meinen dasselbe: den physischen Speicher auf Ihrer Grafikkarte, der nur für die GPU zugänglich ist. Der Begriff "Video RAM" stammt aus der Zeit, als GPUs ausschließlich für Video-Rendering genutzt wurden. Heute umfasst VRAM auch den Speicher für KI-Modell-Gewichte, KV-Cache und Zwischenergebnisse während der Inferenz.

Wichtig: Shared Memory (geteilter Systemspeicher) ist kein echter VRAM. Wenn Ihre GPU mehr Speicher braucht als sie hat, borgen Grafikkarten sich automatisch Systemspeicher (DDR5-RAM) über den PCIe-Bus. Dieser ist jedoch 20–100x langsamer – mit drastischen Folgen für KI-Inferenz.

EigenschaftDedizierter VRAMShared Memory
SpeichertypGDDR6, GDDR7, HBM3(e)DDR5 System-RAM
Bandbreite320–8.000 GB/s50–100 GB/s
LatenzNiedrig (on-chip)Hoch (PCIe-Bus)
CPI-Kosten (GPU-Kauf)Einmalig, 500–30.000 EUR0 EUR (vorhanden)
KI-TauglichkeitPflicht für LLM-InferenzNur Notlösung

Die Performance-Kluft ist kein gradueller Unterschied, sondern eine Wand: Ein Modell, das in 24 GB VRAM passt, läuft mit 40 Tokens/s. Sobald es in Shared Memory ausweicht, fällt die Geschwindigkeit auf 3–5 Tokens/s – ein Verlust von 90 %+ (Quelle: Spheron Benchmarks 2026).

VRAM-Bedarf nach LLM-Modell (praxisnah, 2026)

Die folgende Tabelle zeigt den minimalen VRAM-Bedarf für populäre Modelle in verschiedenen Quantisierungen. Werte sind Richtwerte für Batch Size 1 ohne KV-Cache-Overhead:

ModellParameterQ4 (GGUF)Q8/FP8FP16
Llama 3.2 3B3,2 Mrd.~2,5 GB~4 GB~6 GB
Qwen 2.5 7B7 Mrd.~5 GB~8 GB~14 GB
Llama 3 8B8 Mrd.~6 GB~9 GB~16 GB
Mistral 7B7 Mrd.~5 GB~8 GB~14 GB
Qwen 3.8 27B27 Mrd.~18 GB~28 GB~54 GB
Llama 3 70B70 Mrd.~40 GB~70 GB~140 GB
DeepSeek V3671B MoE~180 GB (aktiv ~37B)

Praxisregel: Für den deutschen Mittelstand reichen meist Modelle der 7B–30B-Klasse. Diese passen in 24–48 GB VRAM und decken 90 % der Use Cases ab (Chatbot, Dokumentenanalyse, Klassifikation).

GPU-Vergleichstabelle mit EUR-Preisen (Stand September 2026)

Workstation-/Consumer-GPUs (Kauf)

GPUVRAMBandbreiteLLM-KapazitätEUR-Preis (ca.)TDP
RTX 306012 GB GDDR6360 GB/s7B Q4, 3B FP16300–400 EUR170 W
RTX 4060 Ti16 GB GDDR7448 GB/s13B Q4450–550 EUR180 W
RTX 509032 GB GDDR71.792 GB/s27B Q4, 13B FP162.300–2.800 EUR575 W
RTX 409024 GB GDDR6X1.008 GB/s13B Q8, 27B Q41.800–2.400 EUR450 W
RTX 3090 (gebraucht)24 GB GDDR6X936 GB/s13B Q8, 27B Q4900–1.300 EUR350 W
RTX PRO 6000 Blackwell96 GB GDDR7~2.000 GB/s70B Q46.500–8.000 EUR~300 W
L40S48 GB GDDR6864 GB/s27B FP16, 70B Q4ca. 7.000 EUR300 W
A500024 GB GDDR6768 GB/s13B Q8, 27B Q4ca. 3.000 EUR250 W

Data-Center-GPUs (Kauf)

GPUVRAMBandbreiteEUR-PreisTDP
A100 80GB80 GB HBM2e2.000 GB/s12.000–20.000 EUR400 W
H100 80GB80 GB HBM33.350 GB/s30.000–40.000 EUR700 W
H200 141GB141 GB HBM3e4.800 GB/s35.000–50.000 EUR700 W
B200 192GB192 GB HBM3e8.000 GB/s55.000+ EUR1.000 W
B300 288GB288 GB HBM3e8.000 GB/s~80.000 EUR1.400 W

Cloud GPU-Miete (EUR/Stunde, Stand September 2026)

Für Unternehmen ohne Investitionsbudget oder als Übergangslösung:

GPUVRAMEUR/h (ca.)Geeignet für
RTX 409024 GB0,60–0,90 EUR/hEntwicklung, 13B-Modelle
RTX 509032 GB0,80–1,20 EUR/hMittelstand-Produktion
L40S48 GB1,20–1,80 EUR/hDSGVO-konform, 27B-Modelle
A10080 GB3,50–5,00 EUR/hTraining, 70B-Modelle
H10080 GB5,00–8,00 EUR/h70B+, großer KV-Cache
B200192 GB11,00–15,00 EUR/h400B MoE, 70B FP16

Praxisbeispiel: Ein produzierendes Unternehmen mit 5 Mitarbeitern, die täglich 8 Stunden einen KI-Assistenten nutzen, verbraucht ca. 0,5 Tokens/s pro Mitarbeiter. Ein RTX-5090-Server (32 GB VRAM) reicht für eine Qwen 3.8 27B im Q4, unterstützt 10+ parallele Nutzer und kostet einmalig ~2.500 EUR. Die Alternative (Cloud: RTX 5090, 0,80 EUR/h, 8h/Tag, 22 Tage) kostet ~140 EUR/Monat + Marge.

DSGVO-Einordnung für KI-VRAM-Kauf

Bei der Wahl des KI-Servers sind DSGVO-Aspekte entscheidend:

  • §203 StGB / §80 SGB X: Personenbezogene KI-Verarbeitung im Gesundheits- und Sozialwesen erzwingt On-Premise. Cloud-GPU-Miete ist nur mit AVV und EU-Hosting zulässig.
  • EU-AI-Act (Risk Level): Hochrisiko-KI-Systeme (z. B. Bonitätsprüfung, medizinische Diagnostik) benötigen dokumentierte Kontrolle über die gesamte Verarbeitungskette – inklusive GPU-Infrastruktur. On-Premise mit lokalen GPUs vereinfacht die Zertifizierung erheblich.
  • Stand der Technik: Der BSI empfiehlt für 2026 verschlüsselte Inferenz (Confidential Computing), die nur auf aktuellen Data-Center-GPUs (H100, B200) oder mit speziellen Lösungen möglich ist – nicht auf Consumer-GPUs.

DSGVO-Checkliste beim GPU-Kauf:

KriteriumOn-Premise (eigener VRAM)Cloud-GPU (Miete)
Datenverlassen den ServerNieJa → AVV nötig
Zertifizierung (ISO 27001)Im eigenen RZ möglichAuditor muss Cloud-Anbieter prüfen
Latenz (TTFT)Niedrig (lokal)Mittel (Netzwerk)
SkalierbarkeitHardware-KaufAuf Knopfdruck

Entscheidungsmatrix: Welche GPU für Ihr Unternehmen?

Use CaseEmpfohlene GPUVRAMModellbeispielBudget EUR
KI-Chatbot (5–20 MA)RTX 509032 GBQwen 3.8 27B Q42.500–3.000
KI-Chatbot (20–100 MA)L40S oder 2× RTX 509048–64 GB70B MoE Q47.000–14.000
Dokumenten-KI (OCR + RAG)RTX 4090 / A500024 GBLlama 3 8B + Embedding2.000–3.500
Bild-KI (Computer Vision)RTX 509032 GBVision LLM Q42.500–3.000
KI-Training (Fine-Tuning)A100 / H10080 GBLoRA auf 7B–13B12.000–40.000
Entwicklung/TestRTX 3090 (gebraucht)24 GBAlle Modelle Q41.000–1.300
DSGVO-kritisch (Gesundheit)L40S / RTX PRO 600048–96 GBLokal, verschlüsselt7.000+
Cloud-ÜbergangslösungH100 gemietet80 GBBeliebigab 5 EUR/h

Fazit

Video RAM und VRAM sind identisch – der entscheidende Faktor ist, ob Ihr KI-Modell komplett in den dedizierten GPU-Speicher passt. Ein Overflow in Shared Memory (System-RAM) vernichtet bis zu 90 % der LLM-Performance und ist für den Produktivbetrieb im Mittelstand nicht tragbar.

Für die meisten Unternehmen reichen 24–32 GB VRAM (RTX 4090 oder RTX 5090) für Modelle der 7B–27B-Klasse. Bei höheren Anforderungen oder DSGVO-Pflichten sind 48 GB professionelle GPUs (L40S) oder Cloud-Miete die richtige Wahl.

Aktuelle GPU-Mietpreise und VRAM-Konfigurationen ändern sich quartalsweise – ein regelmäßiger Hardware-Gap-Check hilft, die richtige Entscheidung zu treffen.

FAQ

Video RAM vs. VRAM – ist das nicht dasselbe? Ja. Video RAM ist die historische Bezeichnung für VRAM (Video Random Access Memory). Im KI-Kontext wird durchgängig von VRAM gesprochen – gemeint ist immer der dedizierte Grafikspeicher auf der GPU.

Kann ich Shared Memory statt VRAM für KI nutzen? Technisch ja, praktisch nein. Ein Modell, das statt 40 GB/s aus Shared Memory auf 1.000+ GB/s VRAM-Bandbreite zugreift, verliert 80–90 % seiner Tokens-pro-Sekunde.

Wieviel VRAM brauche ich für Llama 3 70B? In Q4-Quantisierung ca. 40 GB, in Q8 ca. 70 GB, in FP16 ca. 140 GB. Für den Mittelstand ist Llama 3 70B meist zu groß – Qwen 3.8 27B oder Llama 3 8B sind oft ausreichend und passen in günstigere GPUs.

Wie erkenne ich, ob mein Modell in den VRAM passt? VRAM-Bedarf ≈ Parameter × Bytes pro Parameter × 1,2 (KV-Cache-Overhead). Für Q4 sind das 0,5 Bytes pro Parameter, für Q8 1 Byte, für FP16 2 Bytes. Beispiel: 7B × 0,5 × 1,2 ≈ 4,5 GB Q4 – passt auf jede GPU mit 8+ GB VRAM.

Was kostet eine KI-GPU für den Mittelstand? Ein RTX-5090-KI-Server (32 GB, 2.500 EUR) reicht für 10+ Nutzer mit 27B-Modellen in Q4. Wer günstiger einsteigen will: Gebrauchte RTX 3090 (24 GB, ~1.000 EUR) für 7B–13B-Modelle. Cloud-Miete ab 0,60 EUR/h für Entwicklung.

Ist Cloud-GPU-Miete DSGVO-konform? Ja, mit Auftragsverarbeitungsvertrag (AVV) und EU-Hosting. Für personenbezogene Daten (Gesundheit, Personal) ist On-Premise mit dediziertem VRAM die sicherere Wahl.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen