Published on4. August 2026Reranker im Vergleich: der größte Hebel für RAG-Qualitätragrerankercross-encoderqualitaeton-premisemittelstanddeutschlandEin Reranker hebt die Trefferqualität stärker als jeder Modellwechsel. Wie er funktioniert, welche Optionen es gibt und was er an Latenz kostet.
Published on4. August 2026Schatten-KI messen statt verbieten: so viele nutzen ChatGPTschatten-kigovernancedsgvoki-richtliniemittelstanddeutschlandEin Verbot von ChatGPT verlagert die Nutzung aufs Privathandy und macht sie unsichtbar. Wie Sie stattdessen messen, was tatsächlich passiert.
Published on4. August 2026Step 3.7 Flash: das kleinste der offenen Spitzenmodellestepfunopen-weightsmultimodalapache-lizenzgpudeutschland198 Milliarden Parameter, Apache 2.0, eingebautes Bildverständnis — und zwei Karten statt acht. Das Modell mit der besten Aufwand-Nutzen-Relation im Feld.
Published on4. August 2026JSON aus dem LLM erzwingen statt hoffen: Schema-Zwangjson-schemastructured-outputvllmautomatisierungmittelstanddeutschlandWer erzeugtes JSON parst und auf Gültigkeit hofft, baut eine Fehlerquelle ein. Wie Sie das Format technisch erzwingen — lokal und in der Cloud.
Published on4. August 2026Token-Kosten halbieren: Caching, Routing, Kontextdisziplinkostenkontrollellm-gatewaycachingroutingmittelstanddeutschlandDrei Hebel, die die Modellrechnung ohne Qualitätsverlust halbieren — und der Grund, warum der größte davon in keinem Anbieterangebot steht.