- Published on
AI-Inference: Warum Betrieb teurer ist als Training
- Authors

- Name
- Phillip Pham
- @ddppham
AI-Inference: Die teure Betriebsphase der KI
TL;DR
Training lernt Beziehungen in Daten und speichert sie als Modellgewichte. Inference wendet diese Gewichte auf neue Daten an — in Echtzeit, millionenfach. Rund 90 % der Modell-Lebenszeit ist Inference. Deshalb dominieren Betriebskosten, Strom und Latenz die Hardware-Entscheidung — nicht der einmalige Trainingslauf.
Training vs. Inference
| Phase | Was passiert | Wann |
|---|---|---|
| Training | Muster aus gelabelten Daten lernen, Gewichte speichern | Einmalig (oder selten) |
| Inference | Neue Eingaben mit gespeicherten Gewichten bewerten | Dauerhaft, oft Millionen Requests/Tag |
Beispiel Spam-Filter: Im Training lernt das Modell Keywords, Absender-Muster, Ausrufezeichen. In der Inference bewertet es jede neue Mail und liefert eine Wahrscheinlichkeit — die Business-Regel entscheidet (90 % → Spam-Ordner, 50 % → Flag für den Nutzer).
Warum Inference so teuer ist
Vier Treiber:
- Skalierung: Training einmal, Inference milliardenfach über die Lebenszeit.
- Geschwindigkeit: Echtzeit-Antworten brauchen energiehungrige Acceleratoren (GPUs).
- Komplexität: Größere LLMs brauchen mehr Rechenarbeit pro Request.
- Infrastruktur: Rechenzentren, Kühlung, Netz, Verschleiß — laufende Kosten statt CapEx allein.
Schätzungen sehen den Großteil des KI-CO₂-Fußabdrucks im Serving, nicht im Training. Für den Mittelstand heißt das: Wer Private AI plant, optimiert zuerst Inference — siehe Stromkosten von KI-Servern.
Der Stack entscheidet über Tempo und Kosten
Hardware: Spezielle AI-Acceleratoren sind auf Matrixmultiplikation ausgelegt — oft effizienter als allgemeine CPUs, teils effizienter als klassische GPUs für reine Inference.
Software: Modellkompression senkt Last.
- Pruning: überflüssige Gewichte entfernen
- Quantisierung: z. B. von FP32 auf INT8/FP8 — weniger Speicher, schnellere Rechnung
Middleware: Graph Fusion reduziert Roundtrips zwischen CPU und GPU. Parallelisierung zerlegt den Compute-Graph und verteilt Chunks über mehrere GPUs — relevant, wenn ein Modell mehr VRAM braucht als eine Karte hat (Beispiel aus dem Talk: ~150 GB für ein großes Modell vs. ~80 GB einer A100).
Was das für Hardware-Kauf heißt
- Kaufen Sie für Inference-Last, nicht für Trainings-Peak.
- Planen Sie Quantisierung und Serving-Engine (vLLM o. ä.) mit ein — sonst überdimensionieren Sie GPUs.
- Verteilte Inference und Cache (LLM-D) sparen oft mehr als die nächste Karte.
- Einstieg ohne sechsstelligen CapEx: Budget-GPU unter 1.000 Euro bzw. passende NVIDIA-Server-Familie.
Häufige Fragen
Ist Training immer teurer?
Pro Lauf oft ja. Über die Lebenszeit dominiert Inference — weil es permanent läuft.
Reicht eine Consumer-GPU?
Für kleine Modelle und Piloten ja. Für parallele Nutzer, große Kontexte und SLOs brauchen Sie Datacenter-GPUs oder klare Partitionierung auf Kubernetes.
Was bringt Quantisierung konkret?
Weniger VRAM und höhere Tokens/s — oft der erste Hebel, bevor Hardware nachgekauft wird. Orientierung: VRAM-Rechner.
Fazit
Inference ist die Phase, in der KI Wert liefert — und Geld verbraucht. Wer Hardware, Quantisierung und Middleware als einen Stack denkt, steuert Kosten und Latenz. Wer nur „eine große GPU" kauft, zahlt später für Leerlauf und Überdimensionierung.
Wir helfen, Inference-Last zu schätzen, den Stack zu dimensionieren und den Betrieb messbar zu machen.
Quellen & Weiterführende Links
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
Der AI-Stack: von Hardware und Modellen bis RAG und UI
Modell allein reicht nicht. Fünf Schichten — Infrastruktur, Modell, Daten/RAG, Orchestrierung, Application — entscheiden über Qualität, Tempo, Kosten und Sicherheit.
Inference-Kosten pro Token: On-Premise vs. API im Vergleich 2026
Inference-Kosten pro Token berechnen: Was kostet ein KI-Modell on-premise vs. API? Formel, Rechenbeispiele für 7B bis 70B und die Break-Even-Analyse 2026.
KI-Server gebraucht kaufen: Sparpotenzial, Risiken & Checkliste 2026
KI-Server gebraucht kaufen: Bis zu 60% sparen mit gebrauchten GPUs. Worauf beim Kauf achten, welche GPUs sich lohnen, welche Risiken bestehen — mit Checkliste 2026.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)