- Published on
KV-Cache: warum Kontext die GPU sprengt
- Authors

- Name
- Phillip Pham
- @ddppham
KV-Cache: warum Kontext die GPU sprengt
TL;DR
Die GGUF-Datei ist nur die halbe Speicherrechnung. Der KV-Cache hält Keys und Values jedes schon gesehenen Tokens — und wächst mit Kontextlänge und parallelen Sessions. Eine 24-GB-Karte, die Qwen-27B Q4 trägt, kippt, sobald drei Nutzer 32k-Dokumente gleichzeitig im Fenster haben. Bevor Sie die nächste GPU kaufen: Kontext kappen, Pages (vLLM), oder die Stufe wechseln. Die Architektur-Alternative (Mamba-Hybride) steht in einem eigenen Artikel; hier geht es um die Karte.
Gewichte grob rechnen: VRAM-Rechner. Stufen 16 vs. 24 GB: Lokale KI 2026: GPU-Wahl.
Die Rechnung, die der Kauf ignoriert
IT kauft nach „passt das Modell in 24 GB?“. Ja, die Gewichte. Dann kommt der erste Fachbereich mit einem PDF im Prompt, ein zweiter Chat hängt am gleichen Endpoint — und Ollama swapped Schichten auf die CPU.
Grobe Ordnung auf einer 24-GB-Karte (Q4, ein 8B–27B, Zahlen als Lage nicht als Laborprotokoll):
| Kontext × Sessions | Was passiert |
|---|---|
| 4k, 1 Nutzer | Cache klein, Karte atmet |
| 32k, 1 Nutzer | mehrere GB Cache, 27B Q4 wird eng |
| 32k, mehrere Nutzer | Gewichte + n × Cache — oft Auslagerung |
| 128k „weil das Modell es kann“ | Kaufgrund für 48 GB oder vLLM-Paging |
vLLM packt den Cache in Pages statt Worst-Case-Blöcken — deshalb gewinnt derselbe VRAM unter Last gegen Desktop-Ollama. Das ist Betrieb, kein neues Modell.
Was Sie an der Hardware drehen
- Kontext im Produkt begrenzen. 8k für den Chat, RAG holt den Rest. Das ist die billigste GPU-Erweiterung.
- Quant der Gewichte nicht mit Cache verwechseln. Q4 spart Gewichte, der Cache bleibt oft höher präzise, bis Sie FP8-KV in der Engine anschalten.
- Eine größere Karte, wenn der Kontext Produkt ist (Akten, Logs, lange Spezifikationen) — 48 GB Workstation oder zweite Karte, nicht Q2.
- Architektur: Modelle, deren Cache nicht linear mit der Länge wächst. Überblick: Mamba-Hybrid und KV-Cache.
MoE ändert die Gewichte, nicht magisch den Attention-Cache: MoE und VRAM.
16 GB sind hier unerbittlich
Auf 16 GB (5080, 9070 XT) ist der Cache der erste Killer nach einem zu großen Quant. Ein MoE, das „passt“, stirbt an 32k plus zweitem Nutzer. Deshalb ist 16 GB der Pilot, 24 GB der Alltag mit Dokumenten.
Häufige Fragen
Warum zeigt nvidia-smi 23 GB, obwohl das Modell 15 GB hat?
Der Rest ist Cache, CUDA-Kontext, Fragmentierung. Das ist kein Memory-Leak der Anwendung, das ist Inferenz. Nach dem Chat sinkt der Wert nur, wenn die Engine den Cache wirklich freigibt.
Hilft mehr System-RAM?
Als Offload: ja, als Tempo: nein. Tokens/Sekunde fallen hart, sobald Gewichte oder KV über PCIe wandern. RAM ist der Stützrade, nicht die GPU.
Kann ich 128k auf einer 3090 freischalten?
Technisch erlaubt das Modell oft mehr als die Karte. Freischalten ohne Paging oder brutalem Quant heißt: eine Session, kurze Spitzen, kein Team. Für Akten-RAG ist 48 GB oder hartes Chunking ehrlicher.
Ist das ein Grund, gleich A100 zu kaufen?
Nur wenn viele lange Kontexte parallel Pflicht sind. Sonst zuerst Produkt (Kontextlimit, RAG) und Engine (vLLM) — dann die Karte. Kauf-Stufen: KI-Server kaufen 2026.
Fazit und nächster Schritt
VRAM-Kauf ohne KV-Cache ist halbe Sizing-Arbeit. 24 GB tragen 27B Q4 — bis der Kontext zum zweiten Modell wird. Begrenzen, pagen oder die Stufe wechseln, in dieser Reihenfolge.
Wenn Sie Kontext, Nutzerzahl und Karte in eine Zahl gießen wollen (passt / passt nicht / nur mit vLLM): Sprechen Sie uns an.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
16 GB GPU 2026: 5080, 9070 XT, 4060 Ti
16 GB VRAM 2026: RTX 5080, 5070 Ti, RX 9070 XT und 4060 Ti 16 GB — welche Karte MoE trägt, welche am 27B-Quant scheitert, und warum 16 GB kein 24-GB-Ersatz ist.
AMD-GPU für lokale KI: RX 9070 XT und ROCm
AMD für lokale KI 2026: RX 9070 XT mit 16 GB gegen RX 7900 XTX mit 24 GB, ROCm unter Linux, Vulkan unter Windows — und wann NVIDIA die einfachere Karte bleibt.
Lokale KI 2026: GPU-Wahl 16 GB vs. 24 GB
Lokale KI 2026: Welche GPU reicht wirklich — 16 GB MoE oder 24 GB Qwen? Quantisierung, Runtime und wann ein Cluster Überkauf ist.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)