- Published on
Video RAM vs. VRAM: So viel Grafikspeicher braucht Ihre KI wirklich
- Authors

- Name
- Phillip Pham
- @ddppham
TL;DR: Dedizierter Video RAM (VRAM) ist 20–100x schneller als Shared Memory. Für ein 7B-Modell reichen 8–12 GB, für 13B–30B brauchen Sie 24–48 GB, für 70B+ sind 96–288 GB nötig. Mittelständische Unternehmen mit DSGVO-konformer KI setzen meist auf 24–48 GB GPUs (RTX 5090, L40S, A5000) oder mieten H100/B200 in der Cloud. Entscheidend ist: Das Modell muss komplett in den VRAM passen – ein Overflow in Shared Memory kostet 80–90 % Performance.
Video RAM vs. VRAM: Was ist der Unterschied?
Video RAM (VRAM) und dedizierter Grafikspeicher meinen dasselbe: den physischen Speicher auf Ihrer Grafikkarte, der nur für die GPU zugänglich ist. Der Begriff "Video RAM" stammt aus der Zeit, als GPUs ausschließlich für Video-Rendering genutzt wurden. Heute umfasst VRAM auch den Speicher für KI-Modell-Gewichte, KV-Cache und Zwischenergebnisse während der Inferenz.
Wichtig: Shared Memory (geteilter Systemspeicher) ist kein echter VRAM. Wenn Ihre GPU mehr Speicher braucht als sie hat, borgen Grafikkarten sich automatisch Systemspeicher (DDR5-RAM) über den PCIe-Bus. Dieser ist jedoch 20–100x langsamer – mit drastischen Folgen für KI-Inferenz.
| Eigenschaft | Dedizierter VRAM | Shared Memory |
|---|---|---|
| Speichertyp | GDDR6, GDDR7, HBM3(e) | DDR5 System-RAM |
| Bandbreite | 320–8.000 GB/s | 50–100 GB/s |
| Latenz | Niedrig (on-chip) | Hoch (PCIe-Bus) |
| CPI-Kosten (GPU-Kauf) | Einmalig, 500–30.000 EUR | 0 EUR (vorhanden) |
| KI-Tauglichkeit | Pflicht für LLM-Inferenz | Nur Notlösung |
Die Performance-Kluft ist kein gradueller Unterschied, sondern eine Wand: Ein Modell, das in 24 GB VRAM passt, läuft mit 40 Tokens/s. Sobald es in Shared Memory ausweicht, fällt die Geschwindigkeit auf 3–5 Tokens/s – ein Verlust von 90 %+ (Quelle: Spheron Benchmarks 2026).
VRAM-Bedarf nach LLM-Modell (praxisnah, 2026)
Die folgende Tabelle zeigt den minimalen VRAM-Bedarf für populäre Modelle in verschiedenen Quantisierungen. Werte sind Richtwerte für Batch Size 1 ohne KV-Cache-Overhead:
| Modell | Parameter | Q4 (GGUF) | Q8/FP8 | FP16 |
|---|---|---|---|---|
| Llama 3.2 3B | 3,2 Mrd. | ~2,5 GB | ~4 GB | ~6 GB |
| Qwen 2.5 7B | 7 Mrd. | ~5 GB | ~8 GB | ~14 GB |
| Llama 3 8B | 8 Mrd. | ~6 GB | ~9 GB | ~16 GB |
| Mistral 7B | 7 Mrd. | ~5 GB | ~8 GB | ~14 GB |
| Qwen 3.8 27B | 27 Mrd. | ~18 GB | ~28 GB | ~54 GB |
| Llama 3 70B | 70 Mrd. | ~40 GB | ~70 GB | ~140 GB |
| DeepSeek V3 | 671B MoE | ~180 GB (aktiv ~37B) | – | – |
Praxisregel: Für den deutschen Mittelstand reichen meist Modelle der 7B–30B-Klasse. Diese passen in 24–48 GB VRAM und decken 90 % der Use Cases ab (Chatbot, Dokumentenanalyse, Klassifikation).
GPU-Vergleichstabelle mit EUR-Preisen (Stand September 2026)
Workstation-/Consumer-GPUs (Kauf)
| GPU | VRAM | Bandbreite | LLM-Kapazität | EUR-Preis (ca.) | TDP |
|---|---|---|---|---|---|
| RTX 3060 | 12 GB GDDR6 | 360 GB/s | 7B Q4, 3B FP16 | 300–400 EUR | 170 W |
| RTX 4060 Ti | 16 GB GDDR7 | 448 GB/s | 13B Q4 | 450–550 EUR | 180 W |
| RTX 5090 | 32 GB GDDR7 | 1.792 GB/s | 27B Q4, 13B FP16 | 2.300–2.800 EUR | 575 W |
| RTX 4090 | 24 GB GDDR6X | 1.008 GB/s | 13B Q8, 27B Q4 | 1.800–2.400 EUR | 450 W |
| RTX 3090 (gebraucht) | 24 GB GDDR6X | 936 GB/s | 13B Q8, 27B Q4 | 900–1.300 EUR | 350 W |
| RTX PRO 6000 Blackwell | 96 GB GDDR7 | ~2.000 GB/s | 70B Q4 | 6.500–8.000 EUR | ~300 W |
| L40S | 48 GB GDDR6 | 864 GB/s | 27B FP16, 70B Q4 | ca. 7.000 EUR | 300 W |
| A5000 | 24 GB GDDR6 | 768 GB/s | 13B Q8, 27B Q4 | ca. 3.000 EUR | 250 W |
Data-Center-GPUs (Kauf)
| GPU | VRAM | Bandbreite | EUR-Preis | TDP |
|---|---|---|---|---|
| A100 80GB | 80 GB HBM2e | 2.000 GB/s | 12.000–20.000 EUR | 400 W |
| H100 80GB | 80 GB HBM3 | 3.350 GB/s | 30.000–40.000 EUR | 700 W |
| H200 141GB | 141 GB HBM3e | 4.800 GB/s | 35.000–50.000 EUR | 700 W |
| B200 192GB | 192 GB HBM3e | 8.000 GB/s | 55.000+ EUR | 1.000 W |
| B300 288GB | 288 GB HBM3e | 8.000 GB/s | ~80.000 EUR | 1.400 W |
Cloud GPU-Miete (EUR/Stunde, Stand September 2026)
Für Unternehmen ohne Investitionsbudget oder als Übergangslösung:
| GPU | VRAM | EUR/h (ca.) | Geeignet für |
|---|---|---|---|
| RTX 4090 | 24 GB | 0,60–0,90 EUR/h | Entwicklung, 13B-Modelle |
| RTX 5090 | 32 GB | 0,80–1,20 EUR/h | Mittelstand-Produktion |
| L40S | 48 GB | 1,20–1,80 EUR/h | DSGVO-konform, 27B-Modelle |
| A100 | 80 GB | 3,50–5,00 EUR/h | Training, 70B-Modelle |
| H100 | 80 GB | 5,00–8,00 EUR/h | 70B+, großer KV-Cache |
| B200 | 192 GB | 11,00–15,00 EUR/h | 400B MoE, 70B FP16 |
Praxisbeispiel: Ein produzierendes Unternehmen mit 5 Mitarbeitern, die täglich 8 Stunden einen KI-Assistenten nutzen, verbraucht ca. 0,5 Tokens/s pro Mitarbeiter. Ein RTX-5090-Server (32 GB VRAM) reicht für eine Qwen 3.8 27B im Q4, unterstützt 10+ parallele Nutzer und kostet einmalig ~2.500 EUR. Die Alternative (Cloud: RTX 5090, 0,80 EUR/h, 8h/Tag, 22 Tage) kostet ~140 EUR/Monat + Marge.
DSGVO-Einordnung für KI-VRAM-Kauf
Bei der Wahl des KI-Servers sind DSGVO-Aspekte entscheidend:
- §203 StGB / §80 SGB X: Personenbezogene KI-Verarbeitung im Gesundheits- und Sozialwesen erzwingt On-Premise. Cloud-GPU-Miete ist nur mit AVV und EU-Hosting zulässig.
- EU-AI-Act (Risk Level): Hochrisiko-KI-Systeme (z. B. Bonitätsprüfung, medizinische Diagnostik) benötigen dokumentierte Kontrolle über die gesamte Verarbeitungskette – inklusive GPU-Infrastruktur. On-Premise mit lokalen GPUs vereinfacht die Zertifizierung erheblich.
- Stand der Technik: Der BSI empfiehlt für 2026 verschlüsselte Inferenz (Confidential Computing), die nur auf aktuellen Data-Center-GPUs (H100, B200) oder mit speziellen Lösungen möglich ist – nicht auf Consumer-GPUs.
DSGVO-Checkliste beim GPU-Kauf:
| Kriterium | On-Premise (eigener VRAM) | Cloud-GPU (Miete) |
|---|---|---|
| Datenverlassen den Server | Nie | Ja → AVV nötig |
| Zertifizierung (ISO 27001) | Im eigenen RZ möglich | Auditor muss Cloud-Anbieter prüfen |
| Latenz (TTFT) | Niedrig (lokal) | Mittel (Netzwerk) |
| Skalierbarkeit | Hardware-Kauf | Auf Knopfdruck |
Entscheidungsmatrix: Welche GPU für Ihr Unternehmen?
| Use Case | Empfohlene GPU | VRAM | Modellbeispiel | Budget EUR |
|---|---|---|---|---|
| KI-Chatbot (5–20 MA) | RTX 5090 | 32 GB | Qwen 3.8 27B Q4 | 2.500–3.000 |
| KI-Chatbot (20–100 MA) | L40S oder 2× RTX 5090 | 48–64 GB | 70B MoE Q4 | 7.000–14.000 |
| Dokumenten-KI (OCR + RAG) | RTX 4090 / A5000 | 24 GB | Llama 3 8B + Embedding | 2.000–3.500 |
| Bild-KI (Computer Vision) | RTX 5090 | 32 GB | Vision LLM Q4 | 2.500–3.000 |
| KI-Training (Fine-Tuning) | A100 / H100 | 80 GB | LoRA auf 7B–13B | 12.000–40.000 |
| Entwicklung/Test | RTX 3090 (gebraucht) | 24 GB | Alle Modelle Q4 | 1.000–1.300 |
| DSGVO-kritisch (Gesundheit) | L40S / RTX PRO 6000 | 48–96 GB | Lokal, verschlüsselt | 7.000+ |
| Cloud-Übergangslösung | H100 gemietet | 80 GB | Beliebig | ab 5 EUR/h |
Fazit
Video RAM und VRAM sind identisch – der entscheidende Faktor ist, ob Ihr KI-Modell komplett in den dedizierten GPU-Speicher passt. Ein Overflow in Shared Memory (System-RAM) vernichtet bis zu 90 % der LLM-Performance und ist für den Produktivbetrieb im Mittelstand nicht tragbar.
Für die meisten Unternehmen reichen 24–32 GB VRAM (RTX 4090 oder RTX 5090) für Modelle der 7B–27B-Klasse. Bei höheren Anforderungen oder DSGVO-Pflichten sind 48 GB professionelle GPUs (L40S) oder Cloud-Miete die richtige Wahl.
Aktuelle GPU-Mietpreise und VRAM-Konfigurationen ändern sich quartalsweise – ein regelmäßiger Hardware-Gap-Check hilft, die richtige Entscheidung zu treffen.
FAQ
Video RAM vs. VRAM – ist das nicht dasselbe? Ja. Video RAM ist die historische Bezeichnung für VRAM (Video Random Access Memory). Im KI-Kontext wird durchgängig von VRAM gesprochen – gemeint ist immer der dedizierte Grafikspeicher auf der GPU.
Kann ich Shared Memory statt VRAM für KI nutzen? Technisch ja, praktisch nein. Ein Modell, das statt 40 GB/s aus Shared Memory auf 1.000+ GB/s VRAM-Bandbreite zugreift, verliert 80–90 % seiner Tokens-pro-Sekunde.
Wieviel VRAM brauche ich für Llama 3 70B? In Q4-Quantisierung ca. 40 GB, in Q8 ca. 70 GB, in FP16 ca. 140 GB. Für den Mittelstand ist Llama 3 70B meist zu groß – Qwen 3.8 27B oder Llama 3 8B sind oft ausreichend und passen in günstigere GPUs.
Wie erkenne ich, ob mein Modell in den VRAM passt? VRAM-Bedarf ≈ Parameter × Bytes pro Parameter × 1,2 (KV-Cache-Overhead). Für Q4 sind das 0,5 Bytes pro Parameter, für Q8 1 Byte, für FP16 2 Bytes. Beispiel: 7B × 0,5 × 1,2 ≈ 4,5 GB Q4 – passt auf jede GPU mit 8+ GB VRAM.
Was kostet eine KI-GPU für den Mittelstand? Ein RTX-5090-KI-Server (32 GB, 2.500 EUR) reicht für 10+ Nutzer mit 27B-Modellen in Q4. Wer günstiger einsteigen will: Gebrauchte RTX 3090 (24 GB, ~1.000 EUR) für 7B–13B-Modelle. Cloud-Miete ab 0,60 EUR/h für Entwicklung.
Ist Cloud-GPU-Miete DSGVO-konform? Ja, mit Auftragsverarbeitungsvertrag (AVV) und EU-Hosting. Für personenbezogene Daten (Gesundheit, Personal) ist On-Premise mit dediziertem VRAM die sicherere Wahl.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
VRAM für KI: Warum GPU-Speicher 80% der Projekte bestimmt
VRAM ist der Engpass bei On-Premise KI. Verstehen Sie, warum der richtige GPU-Speicher über 80% Ihrer KI-Projekte entscheidet und wie Sie teure Fehlkäufe vermeiden.
VRAM erhöhen für KI: 4 Wege zu mehr GPU-Speicher für lokale LLMs im Mittelstand
VRAM ist der Engpass für lokale KI. Dieser Leitfaden zeigt vier Wege, wie Mittelständler ihren GPU-Speicher erhöhen können – und warum BIOS-Tricks und Registry-Hacks nicht funktionieren.
Gemma 4 mit Ollama lokal: Welches Modell passt zu Ihrer GPU?
Gemma 4 in Ollama: E2B, E4B, 12B, 26B MoE oder 31B? VRAM-Bedarf, Kosten und Hardware-Empfehlung für den deutschen Mittelstand – inklusive DSGVO-Einordnung.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)