- Published on
RTX 5090 vs A100 für KI-Server im Mittelstand — welcher GPU ist richtig?
- Authors

- Name
- Phillip Pham
- @ddppham
RTX 5090 vs A100: Welcher GPU für KI im Mittelstand?
Die Frage ist nicht "welche GPU ist schneller" — sie ist "welche GPU passt zu meinen Daten, meinem Budget und meinem Einsatzgebiet". Eine A100 im Datacenter hat andere Stärken als eine RTX 5090 im eigenen Serverraum. Beide haben ihren Platz.
Für den Mittelstand gilt: Wenn Sie Modelle bis 70 Milliarden Parameter auf Ihren eigenen Daten betreiben wollen, ist die RTX 5090 (24 GB VRAM) oft die günstigere und schnellere Wahl. Für grössere Modelle (100+ Milliarden Parameter, mehrere GPUs) braucht es die A100-Serie.
Der entscheidende Unterschied: Consumer vs. Datacenter
| Kriterium | RTX 5090 | NVIDIA A100 |
|---|---|---|
| VRAM | 24 GB GDDR6X | 40 GB oder 80 GB HBM2e |
| Einzeln für Modelle bis | ~30B Parameter (4-bit) | ~130B Parameter (8-bit, 80 GB) |
| PCIe-Bandbreite | Hoch | Sehr hoch |
| NVLink | Nein | Ja (bis zu 8 GPUs verbund) |
| Preis (Einzelpreis) | ca. 1.800 EUR | ca. 12.000–20.000 EUR |
| Stromverbrauch | ca. 575 Watt TBP | ca. 400 Watt |
| Betriebsumgebung | Server, Workstation | Datacenter, Rack |
| Eignung für On-Premise | Ja | Sehr eingeschränkt |
| Langfristige Verfügbarkeit | Consumer-Markt | Datacenter-Markt |
Wichtig: 24 GB VRAM bei der RTX 5090 sind entscheidend für 30B-Modelle in 4-bit-Quantisierung. Die A100 hat 80 GB — aber nur, wenn Sie auch 80 GB bezahlen. Die 40 GB Variante ist deutlich günstiger, aber bei grösseren Modellen schon knapp.
VRAM-Bedarf der wichtigsten KI-Modelle
| Modell | GRÖSSE | VRAM (4-bit) | VRAM (8-bit) | RTX 5090 | A100 40GB | A100 80GB |
|---|---|---|---|---|---|---|
| Llama 3.1 8B | 8 Mrd | ~6 GB | ~12 GB | ✅ | ✅ | ✅ |
| Llama 3.1 70B | 70 Mrd | ~40 GB | ~80 GB | ❌ | ❌ | ✅ |
| Qwen 2.5 72B | 72 Mrd | ~41 GB | ~82 GB | ❌ | ❌ | ✅ |
| Mistral Large | 123 Mrd | ~70 GB | ~140 GB | ❌ | ❌ | ❌ |
| DeepSeek V3 | 671 Mrd (MoE) | ~34 GB* | ~68 GB* | ❌ | ❌ | ✅ |
*MoE-Modelle (Mixture of Experts) laden nur aktive Parameter — der VRAM-Bedarf ist geringer als bei Dense-Modellen gleicher Grösse.
Performance-Vergleich
Für 30B-Modelle (Llama 3 70B quantisiert, Mistral Large) ist die RTX 5090 oft schneller pro Euro als eine A100. Sie hat eine höhere Speicherbandbreite pro Bit und eine günstigere Hardware. Für grössere Modelle über 100B Parameter scheitert die RTX 5090 am VRAM — da braucht es die A100.
Die Wahrheit: Für den typischen Mittelstand, der 70B-Modelle auf eigenen Daten feinjustiert oder RAG auf eigene Dokumente aufsetzt, ist die RTX 5090 die richtige Wahl. Die A100 wird erst ab ca. 100B Parameter oder multi-GPU-Setups notwendig.
Kosten pro Token
| GPU | Kosten pro 1 Mio Tokens (Input) | Kosten pro 1 Mio Tokens (Output) |
|---|---|---|
| RTX 5090 (Selbst) | Hardware-Amortisation ca. 0,01–0,05 EUR | Hardware-Amortisation ca. 0,01–0,05 EUR |
| A100 (Gemietet) | ca. 0,01–0,02 EUR | ca. 0,02–0,04 EUR |
Die A100 ist bei der Token-Kosteneffizienz pro Durchsatz besser. Aber: Sie brauchen mehrere A100s für grosse Modelle, und das rackt sich schnell auf.
Wann welche GPU?
RTX 5090, wenn:
- Sie Modelle bis ~30B Parameter (quantisiert) betreiben
- On-Premise im eigenen Serverraum
- Budget < 10.000 EUR für Hardware
- Stromverbrauch und Kühlung im eigenen Gebäude
- Ein bis zwei GPUs ausreichen
A100, wenn:
- Sie Modelle über 70B Parameter (8-bit) brauchen
- Multi-GPU-Training oder -Inferenz
- Sie 24/7 im Datacenter betreiben
- Budget > 50.000 EUR für Infrastruktur
- NVLink-Verbund mehrerer GPUs wichtig
Fazit: Die RTX 5090 ist die Einstiegsgewinnlerin
Für den deutschen Mittelstand ist die RTX 5090 die sinnvollste Einstiegs-GPU. 24 GB VRAM reichen für 30B-Modelle, die Preis-Leistung ist unschlagbar, und Sie können das Gerät im eigenen Serverraum betreiben. Die A100 ist die richtige Wahl, wenn Sie grössere Modelle oder multi-GPU-Setups brauchen.
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
RTX 4090 vs A100 für KI-Server — welcher GPU-Typ passt?
RTX 4090 vs A100: Welcher GPU-Typ für KI-Server im Mittelstand? VRAM, Kosten, Performance, Stromverbrauch, On-Premise vs Datacenter. Entscheidungshilfe.
Welche GPU für KI-Server im Mittelstand? Auswahl 2026
Welche GPU für KI-Server im Mittelstand? RTX 4090, RTX 5090, A100, L40S — Vergleich, VRAM, Kosten, Performance. Entscheidungshilfe für den Einstieg.
VRAM-Rechner für KI-Modelle: Welche GPU braucht welches Modell?
VRAM-Rechner für LLMs: Wie viel GPU-Speicher brauchen Llama, DeepSeek, Qwen & Co.? Formel, Tabellen für 7B bis 284B und die richtige GPU-Wahl 2026.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)