- Published on
VRAM erhöhen für KI: 4 Wege zu mehr GPU-Speicher für lokale LLMs im Mittelstand
- Authors

- Name
- Phillip Pham
- @ddppham
VRAM erhöhen für KI: 4 Wege zu mehr GPU-Speicher für lokale LLMs im Mittelstand
TL;DR
VRAM (Video RAM) ist der häufigste Engpass bei lokalen KI-Installationen. Anders als Arbeitsspeicher lässt sich VRAM nicht nachträglich aufrüsten – Sie müssen entweder die GPU tauschen, auf CPU-Offloading setzen, mehrere GPUs kombinieren oder die Modell-Größe durch Quantisierung reduzieren. Dieser Leitfaden zeigt die vier funktionierenden Wege mit konkreten Kosten und DSGVO-Bewertung.
Sie haben einen lokalen KI-Server aufgesetzt – Ollama läuft, ein erstes Modell ist installiert. Doch sobald mehrere Mitarbeiter gleichzeitig Anfragen stellen oder Sie ein größeres Modell (30B+, 70B) ausprobieren wollen, kommt die Fehlermeldung: "CUDA out of memory". Ihre 12 GB oder 16 GB VRAM reichen nicht aus.
Die Frage ist: Können Sie VRAM nachträglich erhöhen?
Die kurze Antwort: Nein, VRAM ist auf der GPU fest verlötet. Es gibt keinen Slot, keinen Steckplatz und keine nachträgliche Aufrüstmöglichkeit – anders als bei RAM-Riegeln im Mainboard. Es gibt aber vier praktikable Wege, trotzdem mehr GPU-Speicher für Ihre KI-Workloads zu bekommen.
Dieser Leitfaden zeigt Ihnen alle Optionen mit konkreten Kosten, Aufwand und Eignung für den deutschen Mittelstand.
Die 4 Wege zu mehr GPU-Speicher für KI
Weg 1: Neue GPU mit mehr VRAM kaufen
Der einzig sichere Weg: Sie tauschen die Grafikkarte gegen ein Modell mit mehr VRAM.
| GPU | VRAM | Preis (neu) | Geeignet für |
|---|---|---|---|
| NVIDIA RTX 5090 | 32 GB | ca. 2.300 EUR | 13B–30B Modelle (Q4), bis 8k Kontext |
| NVIDIA RTX 4090 | 24 GB | ca. 1.600 EUR | 7B–13B Modelle, gute Token/s |
| NVIDIA RTX 5080 | 16 GB | ca. 1.200 EUR | 7B–8B Modelle, begrenzt auf kleinere Quantisierungen |
| NVIDIA RTX 3090 (gebraucht) | 24 GB | ca. 700–900 EUR | Beste Preis/VRAM-Relation, 2× möglich |
| NVIDIA A6000 (Ada) | 48 GB | ca. 5.500 EUR | 30B–70B Modelle, Enterprise |
| NVIDIA A100 (80 GB) | 80 GB | ca. 15.000 EUR | 70B+, Training, viele parallele Nutzer |
Faustformel: Für 7B-Modelle in Q4 reichen 8–12 GB. Für 13B brauchen Sie 16–24 GB. Für 30B+ sind 48–80 GB nötig. Die vollständige Tabelle finden Sie im VRAM-Rechner für KI-Modelle.
Vorteil: Einmalige Investition, keine Komplexität, volle Performance.
Nachteil: Höchste Kosten, GPU muss verbaut/kompatibel sein.
Weg 2: CPU-Offloading (Ollama, llama.cpp)
Moderne Inferenz-Engines wie Ollama und llama.cpp können einen Teil der Modell-Gewichte auf den Arbeitsspeicher (RAM) auslagern, wenn der VRAM nicht ausreicht.
So funktioniert es mit Ollama:
# Offloading auf CPU aktivieren (Ollama startet automatisch mit CPU-Fallback)
ollama pull llama3.1:70b
# Manuelle Steuerung der GPU-Layer (mehr Layer auf GPU = schneller)
# In der Ollama-Modellkonfiguration:
# parameter num_gpu 24 # ~24 Layer auf GPU, Rest auf CPU
# parameter num_ctx 4096 # kürzerer Kontext spart VRAM
# Alternative: llama.cpp mit GPU-Offloading
./llama-cli \
--model /models/llama-3.1-70b-q4.gguf \
--n-gpu-layers 24 \
--ctx-size 4096
Wichtig: CPU-Offloading ist langsam. Während die GPU Layer schnell berechnet, wird die CPU zum Flaschenhals. Rechnen Sie mit 2–5 Token/s statt 30–50 Token/s bei reiner GPU-Inferenz.
Voraussetzung: Ausreichend RAM (mindestens 32 GB, besser 64 GB+ für 70B-Modelle). Der RAM wird dabei doppelt belastet – sowohl für das Modell als auch für das Betriebssystem.
DSGVO-Hinweis: Da alle Daten lokal bleiben, ist CPU-Offloading aus Datenschutzsicht unbedenklich. Es gelten die gleichen Regelungen wie bei reiner GPU-Inferenz. Eine Auftragsverarbeitungsvereinbarung (AVV) ist nur nötig, wenn Sie externe Cloud-Ressourcen nutzen.
Vorteil: Keine Investition, nutzt vorhandene Hardware, sofort umsetzbar.
Nachteil: Deutlich langsamere Inferenz, hohe RAM-Auslastung.
Weg 3: Multi-GPU-Setup
Mehrere GPUs teilen sich die Modell-Layer. Verteilt auf 2, 4 oder 8 Karten können Sie auch 70B+ Modelle lokal betreiben.
Hardware-Beispiele:
| Setup | VRAM gesamt | Kosten | Token/s (70B Q4) |
|---|---|---|---|
| 2× RTX 3090 (gebraucht) | 48 GB | 1.400–1.800 EUR | 15–25 |
| 2× RTX 4090 | 48 GB | 3.200 EUR | 25–35 |
| 2× A6000 (Ada) | 96 GB | 11.000 EUR | 35–50 |
| 4× RTX 3090 | 96 GB | 2.800–3.600 EUR | 30–45 |
Multi-GPU mit Ollama:
# Ollama erkennt mehrere GPUs automatisch
# Manuelle Steuerung pro GPU:
ollama serve
# CUDA_VISIBLE_DEVICES=0,1 ollama run llama3.1:70b
# vLLM für bessere Auslastung bei Multi-GPU
vllm serve meta-llama/Llama-3.1-70B \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.90
Multi-GPU ist nicht trivial: Sie brauchen ein Mainboard mit genügend PCIe-Lanes, ein starkes Netzteil (für 2× RTX 3090: mindestens 1200W), und ausreichende Kühlung. Mehr dazu im Artikel GPU-Netzteil und Kühlung für KI-Büro.
Vorteil: Höchste VRAM-Kapazität, skalierbar, flexibel.
Nachteil: Hohe Komplexität, teure Netzteile, Kühlungsbedarf, PCIe-Engpässe möglich.
Weg 4: Quantisierung (Modell-Kompression)
Quantisierung reduziert die Genauigkeit der Modell-Gewichte von 16 Bit auf 4 oder 8 Bit – und halbiert damit den VRAM-Bedarf drastisch.
| Quantisierung | VRAM 7B | VRAM 13B | VRAM 30B | VRAM 70B |
|---|---|---|---|---|
| FP16 (volle Genauigkeit) | 14 GB | 26 GB | 60 GB | 140 GB |
| Q8 (8 Bit) | 7 GB | 13 GB | 30 GB | 70 GB |
| Q4 (4 Bit) | 3,5 GB | 6,5 GB | 15 GB | 35 GB |
| Q3 (3 Bit) | 2,6 GB | 4,9 GB | 11 GB | 26 GB |
Praxistipp: Q4 ist der Sweet Spot für den Mittelstand. Der Qualitätsverlust ist bei modernen Modellen (Llama 3, Mistral, Qwen) kaum messbar, aber der VRAM-Verbrauch sinkt um 75%.
# Ollama lädt automatisch die optimale Quantisierung
ollama pull llama3.1:8b # Standard: Q4_K_M
ollama pull llama3.1:70b # 70B in Q4 benötigt ~35 GB VRAM
# Spezifische Quantisierung wählen
ollama pull llama3.1:70b-q4_K_M
ollama pull llama3.1:70b-q8_0 # Höhere Qualität, mehr VRAM
# GGUF-Quantisierung mit llama.cpp selbst erstellen
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j
python3 convert-hf-to-gguf.py meta-llama/Llama-3.1-70B \
--outfile models/llama-3.1-70b-q4.gguf \
--quantize q4_K_M
Vorteil: Kostet nichts, sofort wirksam, senkt VRAM-Bedarf drastisch.
Nachteil: Minimaler (kaum merklicher) Qualitätsverlust, nicht jedes Modell ist gut quantisiert.
Achtung Sackgassen: Was NICHT funktioniert
❌ BIOS-VRAM-Erhöhung für dedizierte GPUs
Viele Ratgeber (auch von seriösen Quellen wie heise) empfehlen, den VRAM im BIOS oder über die Registry zu erhöhen. Das funktioniert nur bei integrierten Grafikkarten (iGPUs) von Intel oder AMD APUs. Dedizierte NVIDIA- oder AMD-GPUs haben einen festen VRAM, der nicht über das BIOS gesteuert wird. Die Registry-Methode täuscht Programmen nur einen höheren Wert vor – die tatsächliche KI-Performance bleibt unverändert.
❌ Shared GPU Memory in Windows
Windows kann Systemspeicher als "Shared GPU Memory" ausweisen. Dieser hilft beim Rendering, aber nicht bei KI-Inferenz. CUDA-Anwendungen (Ollama, llama.cpp, vLLM) können nur auf den dedizierten VRAM zugreifen. Wenn der voll ist, crasht die Anwendung – auch wenn 32 GB Shared Memory verfügbar sind.
❌ Virtuelles VRAM / Auslagerungsdatei
Ein weit verbreiteter Mythos: Dass die Windows-Auslagerungsdatei als VRAM-Ersatz dienen kann. Stimmt nicht. KI-Modelle müssen vollständig im GPU-Speicher geladen sein. Auslagern auf die SSD würde die Inferenz auf Bruchteile eines Tokens pro Sekunde verlangsamen – praktisch unbrauchbar.
Schritt-für-Schritt: VRAM für Ihr KI-Projekt optimieren
Schritt 1: Aktuellen VRAM-Bedarf ermitteln
Berechnen Sie, wie viel VRAM Ihr Modell benötigt:
# Formel: VRAM ≈ Parameter × Bytes/Parameter × 1,2 (Overhead)
# FP16: 2 Bytes/Parameter → 7B = 14 GB
# Q4: 0,5 Bytes/Parameter → 7B = 3,5 GB
# Q8: 1 Byte/Parameter → 7B = 7 GB
# Oder direkt mit Ollama testen:
ollama run llama3.1:8b
# Im Task-Manager / nvidia-smi den VRAM-Verbrauch ablesen
watch -n 1 nvidia-smi
Schritt 2: Quantisierung prüfen (kostenlos)
Wechseln Sie zu Q4 – das spart 75% VRAM ohne merkliche Qualitätseinbuße.
# Vorher: 14 GB VRAM belegt (FP16) → 3,5 GB (Q4)
ollama pull llama3.1:8b-q4_K_M
Schritt 3: Kontextlänge reduzieren
Der KV-Cache wächst mit der Kontextlänge. Bei 128k Kontext kann der KV-Cache 30–50% des gesamten VRAM belegen.
# Weniger Kontext = weniger KV-Cache = mehr freier VRAM
ollama run llama3.1:8b --num-ctx 8192
# Von 128k auf 8 reduzieren spart ~4–6 GB VRAM
Mehr Details im Artikel KV-Cache und VRAM-Kontext.
Schritt 4: CPU-Offloading aktivieren (keine Kosten)
Wenn Q4 + reduzierte Kontextlänge nicht reichen: Offloading aktivieren.
# Ollama nutzt automatisch CPU-Fallback
# Manuelle Konfiguration in der Modelfile:
FROM llama3.1:70b
PARAMETER num_gpu 24
PARAMETER num_ctx 4096
Mehr zur Modell-Konfiguration: Ollama Modelfile erstellen.
Schritt 5: Multi-GPU prüfen
Bei anhaltendem VRAM-Mangel: Zweite GPU einbauen. Wichtig:
- PCIe 4.0 x16-Slot pro GPU
- Netzteil: 2× 3090 = 1200W+, 2× 4090 = 1600W+
- NVLink/SLI: Für Inferenz nicht nötig, Modelle teilen sich über PCIe
# Multi-GPU mit vLLM
vllm serve meta-llama/Llama-3.1-70B \
--tensor-parallel-size 2 \
--dtype auto
Schritt 6: GPU-Tausch planen (letzte Option)
Erst wenn Schritte 1–5 nicht ausreichen: Neue GPU mit mehr VRAM kaufen.
Kosten-Tabelle: VRAM-Erweiterung 2026
| Weg | Einmalkosten | Laufende Kosten | VRAM-Zuwachs | Setup-Zeit | Komplexität |
|---|---|---|---|---|---|
| Quantisierung (Q4) | 0 EUR | 0 EUR | −75% VRAM | 10 Minuten | Sehr gering |
| CPU-Offloading | 0 EUR (mehr RAM evtl. +200 EUR) | +10–20 EUR Strom/Monat | variabel | 30 Minuten | Gering |
| Neue GPU (RTX 5090) | 2.300 EUR | +25 EUR Strom/Monat | +8–32 GB | 1 Stunde | Mittel |
| Neue GPU (A6000) | 5.500 EUR | +40 EUR Strom/Monat | +24–48 GB | 1 Stunde | Mittel |
| Multi-GPU (2× RTX 3090 gebr.) | 1.400–1.800 EUR | +50–70 EUR Strom/Monat | +48 GB | 2–4 Stunden | Hoch |
| Multi-GPU (2× A6000) | 11.000 EUR | +80 EUR Strom/Monat | +96 GB | 2–4 Stunden | Hoch |
| Cloud-GPU mieten (Hetzner) | 0 EUR | ab 0,90 EUR/h (L40s) | 48 GB | 15 Minuten | Gering |
DSGVO und Recht: Was Mittelständler beachten müssen
Lokale Lösungen (Weg 1–4)
Alle vier Wege (neue GPU, CPU-Offloading, Multi-GPU, Quantisierung) betreffen ausschließlich Ihre lokale Hardware. Solange die KI-Modelle auf eigenen Servern im Rechenzentrum oder Büro laufen, gelten die Standard-DSGVO-Anforderungen:
- Auftragsverarbeitung: Nicht nötig, da kein externer Dienstleister involviert ist
- Datenresidenz: Alle Daten verlassen das Unternehmen nicht
- Dokumentation: Die Verarbeitung personenbezogener Daten muss im Verzeichnis der Verarbeitungstätigkeiten (VVT) dokumentiert werden
Cloud-GPU (Ausnahme)
Mieten Sie GPU-Ressourcen in der Cloud (Weg 5, nicht in den 4 Hauptwegen), benötigen Sie eine Auftragsverarbeitungsvereinbarung (AVV) mit dem Anbieter. Achten Sie auf:
- Rechenzentrum in Deutschland oder EU (Azure Westeuropa, Hetzner Nürnberg/Falkenstein)
- Vertragsstrafen bei Datenschutzverletzungen
- Löschfristen und Export-Kontrollen
Branchenspezifisch
- Gesundheitswesen / Kanzleien: Bei Verarbeitung von Patientendaten gilt §203 StGB (ärztliche Schweigepflicht). Lokale GPU-Lösungen sind hier die einzig zulässige Option, da keine Daten den Standort verlassen dürfen.
- Fertigung / Industrie: Betriebsgeheimnisse und Produktionsdaten dürfen nicht in US-Clouds landen. Lokale VRAM-Erweiterung via Multi-GPU ist hier die sicherste Wahl.
Mehr im Leitfaden DSGVO-konforme KI ohne Cloud.
Use Cases: Zwei Branchen
Fertigungsbetrieb (250 Mitarbeiter, 12 GB GPU vorhanden)
Ausgangslage: Ein Maschinenbauer nutzt eine RTX 4070 (12 GB VRAM) für erste KI-Tests. Das 13B-Modell in FP16 passt mit 26 GB nicht. Selbst Q4 (6,5 GB) geht, aber der KV-Cache für 32k Kontext frisst zusätzlich ~8 GB.
Lösung (Schritt-für-Schritt):
- Quantisierung auf Q4_K_M → Reduziert VRAM von 26 GB auf 6,5 GB
- Kontext auf 8k limitieren → Spart ~6 GB KV-Cache
- Ergebnis: 12 GB VRAM reichen für ein 13B-Modell mit 8k Kontext
- Kosten: 0 EUR
Ergebnis: Das Unternehmen kann Qualitätsprüfungen mit einem lokalem 13B-Modell durchführen, ohne Cloud-Kosten oder neue Hardware.
Steuerberatungskanzlei (50 Mitarbeiter, vorhandene Workstation mit 16 GB)
Ausgangslage: Eine Kanzlei will Dokumentenanalyse mit lokaler KI umsetzen. §203 StGB verbietet Cloud-Lösungen. Vorhanden: RTX 5080 mit 16 GB VRAM. Ziel: 30B-Modell für komplexe Vertragsanalyse.
Lösung:
- Q4-Quantisierung (30B → 15 GB) und CPU-Offloading (5–10 Layer auf CPU)
- Multi-GPU: Zweite gebrauchte RTX 3090 (24 GB, ~800 EUR) einbauen
- Gesamt-VRAM: 16 + 24 = 40 GB, ausreichend für 30B Q4 + KV-Cache
- DSGVO-konform: Alle Daten bleiben lokal, keine AVV nötig
Ergebnis: DSGVO-sichere KI-Analyse für 1.600 EUR Gesamtinvestition (GPU-Kauf + Netzteil).
Entscheidungsmatrix
| Kriterium | Quantisierung | CPU-Offloading | Neue GPU | Multi-GPU |
|---|---|---|---|---|
| Code nötig? | Nein (Ollama-Befehl) | Ja (Modell-Konfig) | Nein | Ja (vLLM-Konfig) |
| Setup-Zeit | 10 Min | 30 Min | 1 Std | 3–4 Std |
| Datenhoheit | 100% lokal | 100% lokal | 100% lokal | 100% lokal |
| Kosten | 0 EUR | Ab 0 EUR | 1.200–15.000 EUR | 1.400–11.000 EUR |
| Performance | Sehr gut | Langsam (2–5 T/s) | Sehr gut (30–50 T/s) | Gut (15–45 T/s) |
| Skalierbarkeit | Fix | Fix | Tausch nötig | Erweiterbar |
| Am besten für | Schnelle Lösung | Budget-Null-Lösung | Enterprise-Produktion | Maximaler VRAM |
| DSGVO-Risiko | Keines | Keines | Keines | Keines |
Fazit
VRAM lässt sich nicht nachträglich aufrüsten – aber Sie haben vier praktikable Wege, trotzdem mehr GPU-Speicher für Ihre KI-Projekte zu bekommen:
- Quantisierung – kostet nichts, senkt VRAM um 75% – immer der erste Schritt
- CPU-Offloading – nutzt vorhandenen RAM, aber langsamer – gute Notlösung
- Multi-GPU – maximale Kapazität, aber aufwändig – für ambitionierte Projekte
- Neue GPU – teuer, aber die sauberste Enterprise-Lösung
Für 80% der Mittelstands-Projekte reicht Quantisierung (Weg 1) + reduzierte Kontextlänge. Erst wenn Sie 30B+ Modelle lokal betreiben wollen, lohnt sich Multi-GPU.
Sie haben Fragen zur GPU-Dimensionierung für Ihr KI-Projekt? Wir beraten Sie neutral und herstellerunabhängig – sprechen Sie uns an.
FAQ
Kann ich den VRAM meiner Grafikkarte nachträglich erweitern?
Nein. VRAM ist auf der GPU fest verlötet (oder bei älteren Karten als Speicher-Chips bestückt). Es gibt keine Steckplätze oder Module, die Sie austauschen könnten. Anders als Arbeitsspeicher (RAM) lässt sich VRAM nicht nachrüsten.
Hilft es, den VRAM im BIOS zu erhöhen?
Nur bei integrierten Grafikkarten (iGPUs). Dedizierte GPUs von NVIDIA und AMD ignorieren BIOS-VRAM-Einstellungen komplett. Registry-Tricks täuschen Programmen nur einen höheren Wert vor – die KI-Performance bleibt unverändert.
Wie viel VRAM brauche ich für lokale KI-Modelle?
Für 7B-Modelle (z.B. Llama 3.1 8B) in Q4: 4 GB. Für 13B: 8 GB. Für 30B: 16 GB. Für 70B: 36 GB. Hinzu kommt der KV-Cache: ca. 1 GB pro 8k Kontextlänge. Details im VRAM-Rechner.
Kann ich KI-Modelle auf mehrere GPUs verteilen?
Ja. Ollama, vLLM und llama.cpp unterstützen Multi-GPU. Die Modelle werden auf die GPUs aufgeteilt (Tensor Parallelism). Sie brauchen ein passendes Mainboard mit mehreren PCIe-Slots und ein starkes Netzteil.
Was ist CPU-Offloading und wie viel langsamer ist es?
CPU-Offloading lagert Modell-Gewichte auf den Arbeitsspeicher aus. Die GPU berechnet nur einen Teil der Layer. Ergebnis: 2–5 Token/s statt 30–50 Token/s. Geeignet für Batch-Verarbeitung über Nacht, aber nicht für Echtzeit-Anwendungen.
Lohnt sich eine gebrauchte RTX 3090 für KI?
Ja. Die RTX 3090 hat 24 GB VRAM und kostet gebraucht 700–900 EUR. Das ist das beste Preis/VRAM-Verhältnis. Zwei RTX 3090 ergeben 48 GB VRAM für unter 1.800 EUR – ideal für 30B- und kleinere 70B-Modelle. Mehr im Gebraucht-Guide.
Intern verlinkte Artikel
- VRAM-Rechner für KI-Modelle – Welche GPU für welches Modell?
- KV-Cache und VRAM-Kontext – Warum Kontextlänge VRAM frisst
- Was ist VRAM? – Grundlagen für KI-Einsteiger
- GPU-Netzteil und Kühlung für KI-Büro – Hardware-Voraussetzungen für Multi-GPU
- RTX 3090 gebraucht kaufen für KI – Preis-Leistungs-Tipp
- DSGVO-konforme KI ohne Cloud – Rechtssicherheit für lokale KI
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
VRAM für KI: Warum GPU-Speicher 80% der Projekte bestimmt
VRAM ist der Engpass bei On-Premise KI. Verstehen Sie, warum der richtige GPU-Speicher über 80% Ihrer KI-Projekte entscheidet und wie Sie teure Fehlkäufe vermeiden.
Ollama Bildgenerierung 2026: Lokale KI-Bilder für Fertigung und Großhandel
Ollama kann seit Januar 2026 Bilder generieren – experimentell, lokal und DSGVO-konform. Wir vergleichen Z-Image Turbo und FLUX.2 Klein, zeigen Kosten, VRAM-Bedarf und konkrete Use Cases für Fertigung und Großhandel.
Laptop-GPU: 8 GB und 12 GB für lokale KI
Lokale KI auf dem Laptop: was 8 GB und 12 GB wirklich tragen, warum Unified Memory täuscht, und wann der Desktop mit 24 GB die ehrlichere Stufe ist.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)