Published on4. August 2026Reranker im Vergleich: der größte Hebel für RAG-Qualitätragrerankercross-encoderqualitaeton-premisemittelstanddeutschlandEin Reranker hebt die Trefferqualität stärker als jeder Modellwechsel. Wie er funktioniert, welche Optionen es gibt und was er an Latenz kostet.
Published on4. August 2026Berechtigungen im Vektorspeicher bis auf Chunk-EbeneragrbacvektordatenbankberechtigungensharepointmittelstanddeutschlandEin RAG-System, das Berechtigungen erst nach dem Abruf prüft, ist ein Datenleck mit Verzögerung. Wie Rechte in den Index kommen und synchron bleiben.
Published on2. August 2026Mamba-Hybrid: KV-Cache bei langem Kontextllm-inferenzvramself-hostedragmittelstanddeutschlandDer KV-Cache frisst bei 32k Kontext mehr VRAM als das Modell selbst. Was Mamba-Hybride wie Soofi S daran ändern — und wann FP8 die billigere Antwort ist.
Published on29. Juli 2026Server für KI-Anwendungen: Sizing nach Use-Caseki-serverhardwareragself-hostedmittelstanddeutschlandRAG, Chat, OCR, Code oder Sichtprüfung — jede Anwendung braucht anderes Sizing. Fünf Faustformeln plus die KV-Cache-Rechnung, die 70B-Pläne killt.
Published on18. Juli 2026KI-Server-RAG: Vom PDF zur abfragebereiten Wissensdatenbankragpdfvektorsuchemittelstandself-hostedRAG-Pipeline von PDF zur Wissensdatenbank: Dokumenten-Extraktion, Chunking, Embedding und Vektorsuche — komplette Implementierung.