Published on4. August 2026DeepSeek V4 Flash VRAM: Selbst hosten mit 16-64 GB GPUdeepseekopen-weightsvllmgpuon-premisemittelstanddeutschlandDeepSeek V4 Flash VRAM-Rechner: Welche GPU für 16, 32 oder 64 GB? Setup mit vLLM, Durchsatz-Messung und Kostenvergleich fürs eigene Rechenzentrum.
Published on4. August 2026KI-Plattform für 1.000 Mitarbeiter: 3 Kosten-Szenarienki-plattformkostenllm-gatewayon-premisemittelstanddeutschlandLizenz, EU-Cloud oder eigene GPUs für 1.000 Mitarbeiter? Drei Szenarien offen durchgerechnet — mit dem Posten, den fast jede Rechnung unterschlägt.
Published on4. August 2026Langfuse on-premise: LLM-Aufrufe nachvollziehbar machenlangfuseobservabilitymonitoringllm-gatewayon-premisedeutschlandOhne Nachverfolgung ist jede Fehlersuche im RAG-System Raten. Der Aufbau im eigenen Rechenzentrum — und was protokolliert werden darf.
Published on4. August 2026LoRA-Feinabstimmung im eigenen Haus: wann sie sich lohntlorafinetuningon-premisegpuragmittelstanddeutschlandFeinabstimmung ist kein Ersatz für RAG — sie löst ein anderes Problem. Die drei Fälle, in denen sie hilft, und der Aufwand für die Datenaufbereitung.
Published on4. August 2026Reranker im Vergleich: der größte Hebel für RAG-Qualitätragrerankercross-encoderqualitaeton-premisemittelstanddeutschlandEin Reranker hebt die Trefferqualität stärker als jeder Modellwechsel. Wie er funktioniert, welche Optionen es gibt und was er an Latenz kostet.