- Published on
Laptop-GPU: 8 GB und 12 GB für lokale KI
- Authors

- Name
- Phillip Pham
- @ddppham
Laptop-GPU: 8 GB und 12 GB für lokale KI
TL;DR
Ein Notebook ist der schnellste Weg, Ollama ohne Bestellung zu testen — und die häufigste Quelle für falsche GPU-Käufe. 8 GB tragen 7B-Klasse in Q4 plus kurzen Chat. 12 GB (RTX 5070 Laptop, ältere 3060/4070) tragen 8B–14B Q4, sobald der KV-Cache klein bleibt. Ein dichtes 27B in Q4 gehört nicht auf die 12-GB-Karte, auch nicht „weil das Datenblatt 5070 heißt“. Unified Memory bei Apple zählt nur der freie Anteil. Für Team und Dokumente: Desktop 24 GB, nicht das nächstgrößere Ultrabook.
Stufen: Lokale KI 2026: 16 vs. 24 GB. 12 GB ist nicht 16 GB: 16 GB GPU 2026.
Was die drei Laptop-Klassen können
| VRAM (frei) | Typische Hardware | Modell-Klasse | Rolle |
|---|---|---|---|
| 8 GB | RTX 4060 Laptop, viele 4050 | 7B Q4, kleine MoE | Demo, Coding-Snippet |
| 12 GB | RTX 5070 Laptop, 4070/3060 12 GB | 8B–14B Q4 | Einzelplatz, kurzer Kontext |
| 16 GB+ | 4080/5080 Laptop, Workstation | wie Desktop-16-GB | Pilot, kein Server |
Die Zahl im Shop ist Peak-TGP, nicht Dauerlast. Ein 115-W-Laptop drosselt früher als eine 350-W-3090. Tokens/Sekunde auf dem Datenblatt der Desktop- SKU gelten nicht im 16-Zoll-Gehäuse.
Unified Memory ist kein VRAM
MacBook und manche Mini-PCs werben mit 32 oder 64 GB. Das ist gemeinsamer Speicher für OS, Browser und Modell. 10 GB macOS plus 8 GB Chrome sind keine 24 GB fürs LLM. Dieselbe Falle wie im VRAM-Leitartikel: frei messen (Activity Monitor / nvidia-smi), nicht die Konfiguration im Angebot.
Was Sie auf 8 und 12 GB nicht tun sollten
- Dichtes 27B Q4 „einfach Q3“. Tempo und Qualität sterben zusammen.
- 32k-Kontext mit PDF im Prompt. Der KV-Cache frisst denselben Speicher.
- Ollama plus IDE plus Browser auf derselben iGPU, dann wundern, warum 12 GB „voll“ sind.
- Den Laptop als 24/7-Endpoint. Lüfter, Akku-Zyklus, Throttling.
Runtime: llama.cpp oder Ollama. vLLM auf einem 80-W-Laptop ist der falsche Kampf. Editor lokal: Cursor mit Ollama.
Wann der Desktop die ehrlichere Stufe ist
Sobald mehr als eine Person denselben Endpoint nutzt, oder Akten im Kontext Pflicht sind: 24 GB Desktop (gebrauchte RTX 3090) oder eine Workstation. Der Laptop bleibt das Notebook für unterwegs, nicht der KI-Server.
Strom und Wärme eines 450-W-Desktops sind ein anderes Problem: L4 vs. RTX 4090 im 24/7.
Häufige Fragen
Reicht ein MacBook Pro für Qwen 27B?
Nur wenn genug freier Unified Memory bleibt und Sie Q4 plus kurzen Kontext akzeptieren. Für Agents mit Tools und langen Prompts ist 24 GB frei die Untergrenze, die ein 14-Zoll-Gerät selten hält.
RTX 5070 Laptop — ist das eine 5070 Desktop?
Nein. Weniger TGP, oft 12 GB statt 12 GB Desktop mit anderem Bus. Die Laptop-5070 ist eine 12-GB-Klasse, kein Einstieg in die 16-GB-Matrix.
Kann ich den Laptop nachts als Team-Server lassen?
Technisch ja, betrieblich nein. Throttling, Staub, keine ECC, kein Remote-ILO. Ein Mini-PC mit Desktop-GPU oder ein gebrauchter 24-GB-Turm ist der nächste Euro besser ausgegeben.
Fazit und nächster Schritt
8 GB sind die Demo, 12 GB der Einzelplatz, 24 GB der Alltag mit Dokumenten. Kaufen Sie das Notebook für unterwegs, die Karte fürs Modell.
Wenn Sie Laptop, Mini-PC und 24-GB-Turm gegen dasselbe Quant legen wollen: Sprechen Sie uns an.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
AMD-GPU für lokale KI: RX 9070 XT und ROCm
AMD für lokale KI 2026: RX 9070 XT mit 16 GB gegen RX 7900 XTX mit 24 GB, ROCm unter Linux, Vulkan unter Windows — und wann NVIDIA die einfachere Karte bleibt.
16 GB GPU 2026: 5080, 9070 XT, 4060 Ti
16 GB VRAM 2026: RTX 5080, 5070 Ti, RX 9070 XT und 4060 Ti 16 GB — welche Karte MoE trägt, welche am 27B-Quant scheitert, und warum 16 GB kein 24-GB-Ersatz ist.
KV-Cache: warum Kontext die GPU sprengt
KV-Cache frisst VRAM mit jedem Token und jedem parallelen Nutzer. Warum eine 24-GB-Karte bei 8k reicht und bei 128k scheitert — und was Sie an der GPU-Wahl ändern.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)