Published on

RTX 5090 vs A100 für KI-Server im Mittelstand — welcher GPU ist richtig?

Authors

RTX 5090 vs A100: Welcher GPU für KI im Mittelstand?

Die Frage ist nicht "welche GPU ist schneller" — sie ist "welche GPU passt zu meinen Daten, meinem Budget und meinem Einsatzgebiet". Eine A100 im Datacenter hat andere Stärken als eine RTX 5090 im eigenen Serverraum. Beide haben ihren Platz.

Für den Mittelstand gilt: Wenn Sie Modelle bis 70 Milliarden Parameter auf Ihren eigenen Daten betreiben wollen, ist die RTX 5090 (24 GB VRAM) oft die günstigere und schnellere Wahl. Für grössere Modelle (100+ Milliarden Parameter, mehrere GPUs) braucht es die A100-Serie.

Der entscheidende Unterschied: Consumer vs. Datacenter

KriteriumRTX 5090NVIDIA A100
VRAM24 GB GDDR6X40 GB oder 80 GB HBM2e
Einzeln für Modelle bis~30B Parameter (4-bit)~130B Parameter (8-bit, 80 GB)
PCIe-BandbreiteHochSehr hoch
NVLinkNeinJa (bis zu 8 GPUs verbund)
Preis (Einzelpreis)ca. 1.800 EURca. 12.000–20.000 EUR
Stromverbrauchca. 575 Watt TBPca. 400 Watt
BetriebsumgebungServer, WorkstationDatacenter, Rack
Eignung für On-PremiseJaSehr eingeschränkt
Langfristige VerfügbarkeitConsumer-MarktDatacenter-Markt

Wichtig: 24 GB VRAM bei der RTX 5090 sind entscheidend für 30B-Modelle in 4-bit-Quantisierung. Die A100 hat 80 GB — aber nur, wenn Sie auch 80 GB bezahlen. Die 40 GB Variante ist deutlich günstiger, aber bei grösseren Modellen schon knapp.

VRAM-Bedarf der wichtigsten KI-Modelle

ModellGRÖSSEVRAM (4-bit)VRAM (8-bit)RTX 5090A100 40GBA100 80GB
Llama 3.1 8B8 Mrd~6 GB~12 GB
Llama 3.1 70B70 Mrd~40 GB~80 GB
Qwen 2.5 72B72 Mrd~41 GB~82 GB
Mistral Large123 Mrd~70 GB~140 GB
DeepSeek V3671 Mrd (MoE)~34 GB*~68 GB*

*MoE-Modelle (Mixture of Experts) laden nur aktive Parameter — der VRAM-Bedarf ist geringer als bei Dense-Modellen gleicher Grösse.

Performance-Vergleich

Für 30B-Modelle (Llama 3 70B quantisiert, Mistral Large) ist die RTX 5090 oft schneller pro Euro als eine A100. Sie hat eine höhere Speicherbandbreite pro Bit und eine günstigere Hardware. Für grössere Modelle über 100B Parameter scheitert die RTX 5090 am VRAM — da braucht es die A100.

Die Wahrheit: Für den typischen Mittelstand, der 70B-Modelle auf eigenen Daten feinjustiert oder RAG auf eigene Dokumente aufsetzt, ist die RTX 5090 die richtige Wahl. Die A100 wird erst ab ca. 100B Parameter oder multi-GPU-Setups notwendig.

Kosten pro Token

GPUKosten pro 1 Mio Tokens (Input)Kosten pro 1 Mio Tokens (Output)
RTX 5090 (Selbst)Hardware-Amortisation ca. 0,01–0,05 EURHardware-Amortisation ca. 0,01–0,05 EUR
A100 (Gemietet)ca. 0,01–0,02 EURca. 0,02–0,04 EUR

Die A100 ist bei der Token-Kosteneffizienz pro Durchsatz besser. Aber: Sie brauchen mehrere A100s für grosse Modelle, und das rackt sich schnell auf.

Wann welche GPU?

RTX 5090, wenn:

  • Sie Modelle bis ~30B Parameter (quantisiert) betreiben
  • On-Premise im eigenen Serverraum
  • Budget < 10.000 EUR für Hardware
  • Stromverbrauch und Kühlung im eigenen Gebäude
  • Ein bis zwei GPUs ausreichen

A100, wenn:

  • Sie Modelle über 70B Parameter (8-bit) brauchen
  • Multi-GPU-Training oder -Inferenz
  • Sie 24/7 im Datacenter betreiben
  • Budget > 50.000 EUR für Infrastruktur
  • NVLink-Verbund mehrerer GPUs wichtig

Fazit: Die RTX 5090 ist die Einstiegsgewinnlerin

Für den deutschen Mittelstand ist die RTX 5090 die sinnvollste Einstiegs-GPU. 24 GB VRAM reichen für 30B-Modelle, die Preis-Leistung ist unschlagbar, und Sie können das Gerät im eigenen Serverraum betreiben. Die A100 ist die richtige Wahl, wenn Sie grössere Modelle oder multi-GPU-Setups brauchen.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen