Published on4. August 2026Welche GPU für welches Modell — Kosten je Million TokengpukostenvraminferenztcomittelstanddeutschlandDie Rechnung vor jedem GPU-Kauf: Vollkosten je Karte, realistischer Durchsatz, Kosten je Million Token — und der ehrliche Cloud-Vergleich.
Published on4. August 2026Von Ollama zu vLLM: wann der Pilot produktiv werden mussollamavllmmigrationinferenzproduktivbetriebmittelstanddeutschlandOllama trägt den Piloten, nicht den Betrieb. Die vier Signale für den Wechsel auf vLLM — und die Migration Schritt für Schritt.
Published on4. August 2026vLLM vs. SGLang vs. TensorRT-LLM: welcher Server wofürvllmsglangtensorrt-llminferenzdurchsatzmittelstanddeutschlandDrei Inferenzserver im Vergleich. Wo die Unterschiede real sind, wo sie in Benchmarks größer wirken als im Betrieb — und was Sie selbst messen müssen.
Published on9. März 2026ONNX Export: 3-5x schnellere KI-InferenzonnxinferenzmodelloptimierungdeploymentperformancedeutschlandPyTorch-Modelle als ONNX exportieren: 3-5x schnellere Inferenz, 60 % weniger GPU-Kosten. BERT antwortet in 12 ms statt 45 ms.
Published on9. März 2026LocalAI auf Raspberry Pi: KI für €80 Hardwarelocalairaspberry-piedge-aiinferenzself-hosteddeutschlandLocalAI auf Raspberry Pi 5: Kleine KI-Modelle lokal ausführen für €80 Hardware. Setup für Textklassifikation und Embeddings.