Published on

KV-Cache: warum Kontext die GPU sprengt

Authors

KV-Cache: warum Kontext die GPU sprengt

TL;DR

Die GGUF-Datei ist nur die halbe Speicherrechnung. Der KV-Cache hält Keys und Values jedes schon gesehenen Tokens — und wächst mit Kontextlänge und parallelen Sessions. Eine 24-GB-Karte, die Qwen-27B Q4 trägt, kippt, sobald drei Nutzer 32k-Dokumente gleichzeitig im Fenster haben. Bevor Sie die nächste GPU kaufen: Kontext kappen, Pages (vLLM), oder die Stufe wechseln. Die Architektur-Alternative (Mamba-Hybride) steht in einem eigenen Artikel; hier geht es um die Karte.

Gewichte grob rechnen: VRAM-Rechner. Stufen 16 vs. 24 GB: Lokale KI 2026: GPU-Wahl.

Die Rechnung, die der Kauf ignoriert

IT kauft nach „passt das Modell in 24 GB?“. Ja, die Gewichte. Dann kommt der erste Fachbereich mit einem PDF im Prompt, ein zweiter Chat hängt am gleichen Endpoint — und Ollama swapped Schichten auf die CPU.

Grobe Ordnung auf einer 24-GB-Karte (Q4, ein 8B–27B, Zahlen als Lage nicht als Laborprotokoll):

Kontext × SessionsWas passiert
4k, 1 NutzerCache klein, Karte atmet
32k, 1 Nutzermehrere GB Cache, 27B Q4 wird eng
32k, mehrere NutzerGewichte + n × Cache — oft Auslagerung
128k „weil das Modell es kann“Kaufgrund für 48 GB oder vLLM-Paging

vLLM packt den Cache in Pages statt Worst-Case-Blöcken — deshalb gewinnt derselbe VRAM unter Last gegen Desktop-Ollama. Das ist Betrieb, kein neues Modell.

llama.cpp vs. vLLM.

Was Sie an der Hardware drehen

  1. Kontext im Produkt begrenzen. 8k für den Chat, RAG holt den Rest. Das ist die billigste GPU-Erweiterung.
  2. Quant der Gewichte nicht mit Cache verwechseln. Q4 spart Gewichte, der Cache bleibt oft höher präzise, bis Sie FP8-KV in der Engine anschalten.
  3. Eine größere Karte, wenn der Kontext Produkt ist (Akten, Logs, lange Spezifikationen) — 48 GB Workstation oder zweite Karte, nicht Q2.
  4. Architektur: Modelle, deren Cache nicht linear mit der Länge wächst. Überblick: Mamba-Hybrid und KV-Cache.

MoE ändert die Gewichte, nicht magisch den Attention-Cache: MoE und VRAM.

16 GB sind hier unerbittlich

Auf 16 GB (5080, 9070 XT) ist der Cache der erste Killer nach einem zu großen Quant. Ein MoE, das „passt“, stirbt an 32k plus zweitem Nutzer. Deshalb ist 16 GB der Pilot, 24 GB der Alltag mit Dokumenten.

16 GB GPU 2026.

Häufige Fragen

Warum zeigt nvidia-smi 23 GB, obwohl das Modell 15 GB hat?

Der Rest ist Cache, CUDA-Kontext, Fragmentierung. Das ist kein Memory-Leak der Anwendung, das ist Inferenz. Nach dem Chat sinkt der Wert nur, wenn die Engine den Cache wirklich freigibt.

Hilft mehr System-RAM?

Als Offload: ja, als Tempo: nein. Tokens/Sekunde fallen hart, sobald Gewichte oder KV über PCIe wandern. RAM ist der Stützrade, nicht die GPU.

Kann ich 128k auf einer 3090 freischalten?

Technisch erlaubt das Modell oft mehr als die Karte. Freischalten ohne Paging oder brutalem Quant heißt: eine Session, kurze Spitzen, kein Team. Für Akten-RAG ist 48 GB oder hartes Chunking ehrlicher.

Ist das ein Grund, gleich A100 zu kaufen?

Nur wenn viele lange Kontexte parallel Pflicht sind. Sonst zuerst Produkt (Kontextlimit, RAG) und Engine (vLLM) — dann die Karte. Kauf-Stufen: KI-Server kaufen 2026.

Fazit und nächster Schritt

VRAM-Kauf ohne KV-Cache ist halbe Sizing-Arbeit. 24 GB tragen 27B Q4 — bis der Kontext zum zweiten Modell wird. Begrenzen, pagen oder die Stufe wechseln, in dieser Reihenfolge.

Wenn Sie Kontext, Nutzerzahl und Karte in eine Zahl gießen wollen (passt / passt nicht / nur mit vLLM): Sprechen Sie uns an.

Quellen & Weiterführende Links

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen