Published on

VRAM erhöhen für KI: 4 Wege zu mehr GPU-Speicher für lokale LLMs im Mittelstand

Authors

VRAM erhöhen für KI: 4 Wege zu mehr GPU-Speicher für lokale LLMs im Mittelstand

TL;DR

VRAM (Video RAM) ist der häufigste Engpass bei lokalen KI-Installationen. Anders als Arbeitsspeicher lässt sich VRAM nicht nachträglich aufrüsten – Sie müssen entweder die GPU tauschen, auf CPU-Offloading setzen, mehrere GPUs kombinieren oder die Modell-Größe durch Quantisierung reduzieren. Dieser Leitfaden zeigt die vier funktionierenden Wege mit konkreten Kosten und DSGVO-Bewertung.


Sie haben einen lokalen KI-Server aufgesetzt – Ollama läuft, ein erstes Modell ist installiert. Doch sobald mehrere Mitarbeiter gleichzeitig Anfragen stellen oder Sie ein größeres Modell (30B+, 70B) ausprobieren wollen, kommt die Fehlermeldung: "CUDA out of memory". Ihre 12 GB oder 16 GB VRAM reichen nicht aus.

Die Frage ist: Können Sie VRAM nachträglich erhöhen?

Die kurze Antwort: Nein, VRAM ist auf der GPU fest verlötet. Es gibt keinen Slot, keinen Steckplatz und keine nachträgliche Aufrüstmöglichkeit – anders als bei RAM-Riegeln im Mainboard. Es gibt aber vier praktikable Wege, trotzdem mehr GPU-Speicher für Ihre KI-Workloads zu bekommen.

Dieser Leitfaden zeigt Ihnen alle Optionen mit konkreten Kosten, Aufwand und Eignung für den deutschen Mittelstand.

Die 4 Wege zu mehr GPU-Speicher für KI

Weg 1: Neue GPU mit mehr VRAM kaufen

Der einzig sichere Weg: Sie tauschen die Grafikkarte gegen ein Modell mit mehr VRAM.

GPUVRAMPreis (neu)Geeignet für
NVIDIA RTX 509032 GBca. 2.300 EUR13B–30B Modelle (Q4), bis 8k Kontext
NVIDIA RTX 409024 GBca. 1.600 EUR7B–13B Modelle, gute Token/s
NVIDIA RTX 508016 GBca. 1.200 EUR7B–8B Modelle, begrenzt auf kleinere Quantisierungen
NVIDIA RTX 3090 (gebraucht)24 GBca. 700–900 EURBeste Preis/VRAM-Relation, 2× möglich
NVIDIA A6000 (Ada)48 GBca. 5.500 EUR30B–70B Modelle, Enterprise
NVIDIA A100 (80 GB)80 GBca. 15.000 EUR70B+, Training, viele parallele Nutzer

Faustformel: Für 7B-Modelle in Q4 reichen 8–12 GB. Für 13B brauchen Sie 16–24 GB. Für 30B+ sind 48–80 GB nötig. Die vollständige Tabelle finden Sie im VRAM-Rechner für KI-Modelle.

Vorteil: Einmalige Investition, keine Komplexität, volle Performance.

Nachteil: Höchste Kosten, GPU muss verbaut/kompatibel sein.

Weg 2: CPU-Offloading (Ollama, llama.cpp)

Moderne Inferenz-Engines wie Ollama und llama.cpp können einen Teil der Modell-Gewichte auf den Arbeitsspeicher (RAM) auslagern, wenn der VRAM nicht ausreicht.

So funktioniert es mit Ollama:

# Offloading auf CPU aktivieren (Ollama startet automatisch mit CPU-Fallback)
ollama pull llama3.1:70b

# Manuelle Steuerung der GPU-Layer (mehr Layer auf GPU = schneller)
# In der Ollama-Modellkonfiguration:
# parameter num_gpu 24     # ~24 Layer auf GPU, Rest auf CPU
# parameter num_ctx 4096   # kürzerer Kontext spart VRAM

# Alternative: llama.cpp mit GPU-Offloading
./llama-cli \
  --model /models/llama-3.1-70b-q4.gguf \
  --n-gpu-layers 24 \
  --ctx-size 4096

Wichtig: CPU-Offloading ist langsam. Während die GPU Layer schnell berechnet, wird die CPU zum Flaschenhals. Rechnen Sie mit 2–5 Token/s statt 30–50 Token/s bei reiner GPU-Inferenz.

Voraussetzung: Ausreichend RAM (mindestens 32 GB, besser 64 GB+ für 70B-Modelle). Der RAM wird dabei doppelt belastet – sowohl für das Modell als auch für das Betriebssystem.

DSGVO-Hinweis: Da alle Daten lokal bleiben, ist CPU-Offloading aus Datenschutzsicht unbedenklich. Es gelten die gleichen Regelungen wie bei reiner GPU-Inferenz. Eine Auftragsverarbeitungsvereinbarung (AVV) ist nur nötig, wenn Sie externe Cloud-Ressourcen nutzen.

Vorteil: Keine Investition, nutzt vorhandene Hardware, sofort umsetzbar.

Nachteil: Deutlich langsamere Inferenz, hohe RAM-Auslastung.

Weg 3: Multi-GPU-Setup

Mehrere GPUs teilen sich die Modell-Layer. Verteilt auf 2, 4 oder 8 Karten können Sie auch 70B+ Modelle lokal betreiben.

Hardware-Beispiele:

SetupVRAM gesamtKostenToken/s (70B Q4)
2× RTX 3090 (gebraucht)48 GB1.400–1.800 EUR15–25
2× RTX 409048 GB3.200 EUR25–35
2× A6000 (Ada)96 GB11.000 EUR35–50
4× RTX 309096 GB2.800–3.600 EUR30–45

Multi-GPU mit Ollama:

# Ollama erkennt mehrere GPUs automatisch
# Manuelle Steuerung pro GPU:
ollama serve
# CUDA_VISIBLE_DEVICES=0,1 ollama run llama3.1:70b

# vLLM für bessere Auslastung bei Multi-GPU
vllm serve meta-llama/Llama-3.1-70B \
  --tensor-parallel-size 2 \
  --gpu-memory-utilization 0.90

Multi-GPU ist nicht trivial: Sie brauchen ein Mainboard mit genügend PCIe-Lanes, ein starkes Netzteil (für 2× RTX 3090: mindestens 1200W), und ausreichende Kühlung. Mehr dazu im Artikel GPU-Netzteil und Kühlung für KI-Büro.

Vorteil: Höchste VRAM-Kapazität, skalierbar, flexibel.

Nachteil: Hohe Komplexität, teure Netzteile, Kühlungsbedarf, PCIe-Engpässe möglich.

Weg 4: Quantisierung (Modell-Kompression)

Quantisierung reduziert die Genauigkeit der Modell-Gewichte von 16 Bit auf 4 oder 8 Bit – und halbiert damit den VRAM-Bedarf drastisch.

QuantisierungVRAM 7BVRAM 13BVRAM 30BVRAM 70B
FP16 (volle Genauigkeit)14 GB26 GB60 GB140 GB
Q8 (8 Bit)7 GB13 GB30 GB70 GB
Q4 (4 Bit)3,5 GB6,5 GB15 GB35 GB
Q3 (3 Bit)2,6 GB4,9 GB11 GB26 GB

Praxistipp: Q4 ist der Sweet Spot für den Mittelstand. Der Qualitätsverlust ist bei modernen Modellen (Llama 3, Mistral, Qwen) kaum messbar, aber der VRAM-Verbrauch sinkt um 75%.

# Ollama lädt automatisch die optimale Quantisierung
ollama pull llama3.1:8b       # Standard: Q4_K_M
ollama pull llama3.1:70b      # 70B in Q4 benötigt ~35 GB VRAM

# Spezifische Quantisierung wählen
ollama pull llama3.1:70b-q4_K_M
ollama pull llama3.1:70b-q8_0  # Höhere Qualität, mehr VRAM

# GGUF-Quantisierung mit llama.cpp selbst erstellen
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
make -j
python3 convert-hf-to-gguf.py meta-llama/Llama-3.1-70B \
  --outfile models/llama-3.1-70b-q4.gguf \
  --quantize q4_K_M

Vorteil: Kostet nichts, sofort wirksam, senkt VRAM-Bedarf drastisch.

Nachteil: Minimaler (kaum merklicher) Qualitätsverlust, nicht jedes Modell ist gut quantisiert.


Achtung Sackgassen: Was NICHT funktioniert

❌ BIOS-VRAM-Erhöhung für dedizierte GPUs

Viele Ratgeber (auch von seriösen Quellen wie heise) empfehlen, den VRAM im BIOS oder über die Registry zu erhöhen. Das funktioniert nur bei integrierten Grafikkarten (iGPUs) von Intel oder AMD APUs. Dedizierte NVIDIA- oder AMD-GPUs haben einen festen VRAM, der nicht über das BIOS gesteuert wird. Die Registry-Methode täuscht Programmen nur einen höheren Wert vor – die tatsächliche KI-Performance bleibt unverändert.

❌ Shared GPU Memory in Windows

Windows kann Systemspeicher als "Shared GPU Memory" ausweisen. Dieser hilft beim Rendering, aber nicht bei KI-Inferenz. CUDA-Anwendungen (Ollama, llama.cpp, vLLM) können nur auf den dedizierten VRAM zugreifen. Wenn der voll ist, crasht die Anwendung – auch wenn 32 GB Shared Memory verfügbar sind.

❌ Virtuelles VRAM / Auslagerungsdatei

Ein weit verbreiteter Mythos: Dass die Windows-Auslagerungsdatei als VRAM-Ersatz dienen kann. Stimmt nicht. KI-Modelle müssen vollständig im GPU-Speicher geladen sein. Auslagern auf die SSD würde die Inferenz auf Bruchteile eines Tokens pro Sekunde verlangsamen – praktisch unbrauchbar.


Schritt-für-Schritt: VRAM für Ihr KI-Projekt optimieren

Schritt 1: Aktuellen VRAM-Bedarf ermitteln

Berechnen Sie, wie viel VRAM Ihr Modell benötigt:

# Formel: VRAM ≈ Parameter × Bytes/Parameter × 1,2 (Overhead)
# FP16: 2 Bytes/Parameter → 7B = 14 GB
# Q4:   0,5 Bytes/Parameter → 7B = 3,5 GB
# Q8:   1 Byte/Parameter → 7B = 7 GB

# Oder direkt mit Ollama testen:
ollama run llama3.1:8b
# Im Task-Manager / nvidia-smi den VRAM-Verbrauch ablesen
watch -n 1 nvidia-smi

Schritt 2: Quantisierung prüfen (kostenlos)

Wechseln Sie zu Q4 – das spart 75% VRAM ohne merkliche Qualitätseinbuße.

# Vorher: 14 GB VRAM belegt (FP16) → 3,5 GB (Q4)
ollama pull llama3.1:8b-q4_K_M

Schritt 3: Kontextlänge reduzieren

Der KV-Cache wächst mit der Kontextlänge. Bei 128k Kontext kann der KV-Cache 30–50% des gesamten VRAM belegen.

# Weniger Kontext = weniger KV-Cache = mehr freier VRAM
ollama run llama3.1:8b --num-ctx 8192
# Von 128k auf 8 reduzieren spart ~4–6 GB VRAM

Mehr Details im Artikel KV-Cache und VRAM-Kontext.

Schritt 4: CPU-Offloading aktivieren (keine Kosten)

Wenn Q4 + reduzierte Kontextlänge nicht reichen: Offloading aktivieren.

# Ollama nutzt automatisch CPU-Fallback
# Manuelle Konfiguration in der Modelfile:
FROM llama3.1:70b
PARAMETER num_gpu 24
PARAMETER num_ctx 4096

Mehr zur Modell-Konfiguration: Ollama Modelfile erstellen.

Schritt 5: Multi-GPU prüfen

Bei anhaltendem VRAM-Mangel: Zweite GPU einbauen. Wichtig:

  • PCIe 4.0 x16-Slot pro GPU
  • Netzteil: 2× 3090 = 1200W+, 2× 4090 = 1600W+
  • NVLink/SLI: Für Inferenz nicht nötig, Modelle teilen sich über PCIe
# Multi-GPU mit vLLM
vllm serve meta-llama/Llama-3.1-70B \
  --tensor-parallel-size 2 \
  --dtype auto

Schritt 6: GPU-Tausch planen (letzte Option)

Erst wenn Schritte 1–5 nicht ausreichen: Neue GPU mit mehr VRAM kaufen.


Kosten-Tabelle: VRAM-Erweiterung 2026

WegEinmalkostenLaufende KostenVRAM-ZuwachsSetup-ZeitKomplexität
Quantisierung (Q4)0 EUR0 EUR−75% VRAM10 MinutenSehr gering
CPU-Offloading0 EUR (mehr RAM evtl. +200 EUR)+10–20 EUR Strom/Monatvariabel30 MinutenGering
Neue GPU (RTX 5090)2.300 EUR+25 EUR Strom/Monat+8–32 GB1 StundeMittel
Neue GPU (A6000)5.500 EUR+40 EUR Strom/Monat+24–48 GB1 StundeMittel
Multi-GPU (2× RTX 3090 gebr.)1.400–1.800 EUR+50–70 EUR Strom/Monat+48 GB2–4 StundenHoch
Multi-GPU (2× A6000)11.000 EUR+80 EUR Strom/Monat+96 GB2–4 StundenHoch
Cloud-GPU mieten (Hetzner)0 EURab 0,90 EUR/h (L40s)48 GB15 MinutenGering

DSGVO und Recht: Was Mittelständler beachten müssen

Lokale Lösungen (Weg 1–4)

Alle vier Wege (neue GPU, CPU-Offloading, Multi-GPU, Quantisierung) betreffen ausschließlich Ihre lokale Hardware. Solange die KI-Modelle auf eigenen Servern im Rechenzentrum oder Büro laufen, gelten die Standard-DSGVO-Anforderungen:

  • Auftragsverarbeitung: Nicht nötig, da kein externer Dienstleister involviert ist
  • Datenresidenz: Alle Daten verlassen das Unternehmen nicht
  • Dokumentation: Die Verarbeitung personenbezogener Daten muss im Verzeichnis der Verarbeitungstätigkeiten (VVT) dokumentiert werden

Cloud-GPU (Ausnahme)

Mieten Sie GPU-Ressourcen in der Cloud (Weg 5, nicht in den 4 Hauptwegen), benötigen Sie eine Auftragsverarbeitungsvereinbarung (AVV) mit dem Anbieter. Achten Sie auf:

  • Rechenzentrum in Deutschland oder EU (Azure Westeuropa, Hetzner Nürnberg/Falkenstein)
  • Vertragsstrafen bei Datenschutzverletzungen
  • Löschfristen und Export-Kontrollen

Branchenspezifisch

  • Gesundheitswesen / Kanzleien: Bei Verarbeitung von Patientendaten gilt §203 StGB (ärztliche Schweigepflicht). Lokale GPU-Lösungen sind hier die einzig zulässige Option, da keine Daten den Standort verlassen dürfen.
  • Fertigung / Industrie: Betriebsgeheimnisse und Produktionsdaten dürfen nicht in US-Clouds landen. Lokale VRAM-Erweiterung via Multi-GPU ist hier die sicherste Wahl.

Mehr im Leitfaden DSGVO-konforme KI ohne Cloud.


Use Cases: Zwei Branchen

Fertigungsbetrieb (250 Mitarbeiter, 12 GB GPU vorhanden)

Ausgangslage: Ein Maschinenbauer nutzt eine RTX 4070 (12 GB VRAM) für erste KI-Tests. Das 13B-Modell in FP16 passt mit 26 GB nicht. Selbst Q4 (6,5 GB) geht, aber der KV-Cache für 32k Kontext frisst zusätzlich ~8 GB.

Lösung (Schritt-für-Schritt):

  1. Quantisierung auf Q4_K_M → Reduziert VRAM von 26 GB auf 6,5 GB
  2. Kontext auf 8k limitieren → Spart ~6 GB KV-Cache
  3. Ergebnis: 12 GB VRAM reichen für ein 13B-Modell mit 8k Kontext
  4. Kosten: 0 EUR

Ergebnis: Das Unternehmen kann Qualitätsprüfungen mit einem lokalem 13B-Modell durchführen, ohne Cloud-Kosten oder neue Hardware.

Steuerberatungskanzlei (50 Mitarbeiter, vorhandene Workstation mit 16 GB)

Ausgangslage: Eine Kanzlei will Dokumentenanalyse mit lokaler KI umsetzen. §203 StGB verbietet Cloud-Lösungen. Vorhanden: RTX 5080 mit 16 GB VRAM. Ziel: 30B-Modell für komplexe Vertragsanalyse.

Lösung:

  1. Q4-Quantisierung (30B → 15 GB) und CPU-Offloading (5–10 Layer auf CPU)
  2. Multi-GPU: Zweite gebrauchte RTX 3090 (24 GB, ~800 EUR) einbauen
  3. Gesamt-VRAM: 16 + 24 = 40 GB, ausreichend für 30B Q4 + KV-Cache
  4. DSGVO-konform: Alle Daten bleiben lokal, keine AVV nötig

Ergebnis: DSGVO-sichere KI-Analyse für 1.600 EUR Gesamtinvestition (GPU-Kauf + Netzteil).


Entscheidungsmatrix

KriteriumQuantisierungCPU-OffloadingNeue GPUMulti-GPU
Code nötig?Nein (Ollama-Befehl)Ja (Modell-Konfig)NeinJa (vLLM-Konfig)
Setup-Zeit10 Min30 Min1 Std3–4 Std
Datenhoheit100% lokal100% lokal100% lokal100% lokal
Kosten0 EURAb 0 EUR1.200–15.000 EUR1.400–11.000 EUR
PerformanceSehr gutLangsam (2–5 T/s)Sehr gut (30–50 T/s)Gut (15–45 T/s)
SkalierbarkeitFixFixTausch nötigErweiterbar
Am besten fürSchnelle LösungBudget-Null-LösungEnterprise-ProduktionMaximaler VRAM
DSGVO-RisikoKeinesKeinesKeinesKeines

Fazit

VRAM lässt sich nicht nachträglich aufrüsten – aber Sie haben vier praktikable Wege, trotzdem mehr GPU-Speicher für Ihre KI-Projekte zu bekommen:

  1. Quantisierung – kostet nichts, senkt VRAM um 75% – immer der erste Schritt
  2. CPU-Offloading – nutzt vorhandenen RAM, aber langsamer – gute Notlösung
  3. Multi-GPU – maximale Kapazität, aber aufwändig – für ambitionierte Projekte
  4. Neue GPU – teuer, aber die sauberste Enterprise-Lösung

Für 80% der Mittelstands-Projekte reicht Quantisierung (Weg 1) + reduzierte Kontextlänge. Erst wenn Sie 30B+ Modelle lokal betreiben wollen, lohnt sich Multi-GPU.

Sie haben Fragen zur GPU-Dimensionierung für Ihr KI-Projekt? Wir beraten Sie neutral und herstellerunabhängig – sprechen Sie uns an.


FAQ

Kann ich den VRAM meiner Grafikkarte nachträglich erweitern?

Nein. VRAM ist auf der GPU fest verlötet (oder bei älteren Karten als Speicher-Chips bestückt). Es gibt keine Steckplätze oder Module, die Sie austauschen könnten. Anders als Arbeitsspeicher (RAM) lässt sich VRAM nicht nachrüsten.

Hilft es, den VRAM im BIOS zu erhöhen?

Nur bei integrierten Grafikkarten (iGPUs). Dedizierte GPUs von NVIDIA und AMD ignorieren BIOS-VRAM-Einstellungen komplett. Registry-Tricks täuschen Programmen nur einen höheren Wert vor – die KI-Performance bleibt unverändert.

Wie viel VRAM brauche ich für lokale KI-Modelle?

Für 7B-Modelle (z.B. Llama 3.1 8B) in Q4: 4 GB. Für 13B: 8 GB. Für 30B: 16 GB. Für 70B: 36 GB. Hinzu kommt der KV-Cache: ca. 1 GB pro 8k Kontextlänge. Details im VRAM-Rechner.

Kann ich KI-Modelle auf mehrere GPUs verteilen?

Ja. Ollama, vLLM und llama.cpp unterstützen Multi-GPU. Die Modelle werden auf die GPUs aufgeteilt (Tensor Parallelism). Sie brauchen ein passendes Mainboard mit mehreren PCIe-Slots und ein starkes Netzteil.

Was ist CPU-Offloading und wie viel langsamer ist es?

CPU-Offloading lagert Modell-Gewichte auf den Arbeitsspeicher aus. Die GPU berechnet nur einen Teil der Layer. Ergebnis: 2–5 Token/s statt 30–50 Token/s. Geeignet für Batch-Verarbeitung über Nacht, aber nicht für Echtzeit-Anwendungen.

Lohnt sich eine gebrauchte RTX 3090 für KI?

Ja. Die RTX 3090 hat 24 GB VRAM und kostet gebraucht 700–900 EUR. Das ist das beste Preis/VRAM-Verhältnis. Zwei RTX 3090 ergeben 48 GB VRAM für unter 1.800 EUR – ideal für 30B- und kleinere 70B-Modelle. Mehr im Gebraucht-Guide.


Intern verlinkte Artikel

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen