Published on

KI-RAG-Pipeline aufbauen — Anleitung für den Mittelstand

Authors

KI-RAG-Pipeline aufbauen — Anleitung für den Mittelstand

Retrieval-Augmented Generation (RAG) ist die effektivste Methode, um KI-Modelle mit Ihren eigenen Daten zu verbinden. Eine RAG-Pipeline durchsucht Ihre Wissensdatenbank, findet die relevanten Informationen und generiert präzise Antworten darauf.

Was ist RAG?

RAG kombiniert zwei Schritte:

  1. Retrieval: Die relevanten Dokumente aus Ihrer Wissensdatenbank finden
  2. Generation: Das KI-Modell generiert eine Antwort basierend auf den gefundenen Dokumenten

Der grosse Vorteil: Die KI antwortet nicht aus dem «Gedächtnis», sondern auf Basis Ihrer echten Dokumente. Das Ergebnis ist präziser, nachvollziehbarer und weniger fehleranfällig.

Die 5 Komponenten einer RAG-Pipeline

1. Datenquellen

Die Quelldokumente, die in die Wissensdatenbank eingehen:

  • PDF-Dokumente — Arbeitsanweisungen, Richtlinien, Verträge
  • Word-Dateien — Berichte, Protokolle, Spezifikationen
  • Excel-Tabellen — Datenbestände, Kennzahlen, Listen
  • Web-Seiten — Interne Wikis, Confluence, SharePoint
  • E-Mails — Wichtige Kommunikationsverläufe

2. Chunking (Text-Zerschneidung)

Die Dokumente werden in kleinere Abschnitte («Chunks») zerlegt:

  • Feste Chunk-Grösse: 500-1.000 Token pro Chunk
  • Überlappung: 10-20% zwischen Chunks (für kontextuelle Kohärenz)
  • Intelligentes Chunking: Basierend auf Absätzen, Überschriften oder Logik-Blöcken

Faustregel: 500 Token für technische Dokumente, 1.000 für allgemeine Texte.

3. Embedding

Jeder Chunk wird in eine numerische Repräsentation (Embedding) umgewandelt:

  • Open-Source-Modelle: text-embedding-3-small (OpenAI), bge-large-de (BAAI)
  • Lokale Modelle: sentence-transformers mit DEBERTA-basierten Modellen
  • Embedding-Dimension: 1536 (OpenAI) oder 1024 (bge-large-de)

4. Vektordatenbank

Die Embeddings werden in einer Vektordatenbank gespeichert und indiziert:

  • Qdrant — Open Source, Rust, gut für On-Premise
  • Weaviate — Open Source, Go, Kubernetes-native
  • Chroma — Einfachster Einstieg, Python
  • Pinecone — Cloud-basiert, verwaltet

Für On-Premise-Qualität: Qdrant oder Weaviate.

5. Retrieval und Generation

Die Abfrage wird mit demselben Embedding-Modell verarbeitet und die ähnlichsten Chunks aus der Vektordatenbank gefunden:

  • Top-K: Die K most relevanten Chunks werden zurückgegeben
  • Reranking: Die Ergebnisse werden nach Relevanz sortiert
  • Prompt-Konstruktion: Chunks + Abfrage + System-Prompt
  • Generation: Das LLM antwortet basierend auf dem Prompt

Tech-Stack für eine RAG-Pipeline im Mittelstand

KomponenteEmpfohlene WahlKosten
LLMQwen 2.5 7B (lokal)0 EUR (Hardware)
Embeddingbge-large-de (lokal)0 EUR (Hardware)
VektordatenbankQdrant (lokal)0 EUR (Hardware)
FrameworkLangChain / LlamaIndex0 EUR
ServerRTX 40901.600 EUR (einmalig)

Total Kosten: ca. 1.600 EUR Hardware + 0 EUR laufend (ausser Strom).

Schritt-für-Schritt: Die einfachste RAG-Pipeline

Schritt 1: Dokumente laden und chunken

from langchain.text_splitter import RecursiveCharacterTextSplitter
from langchain.document_loaders import PDFLoader

# Dokumente laden
loader = PDFLoader("arbeitsanweisung.pdf")
docs = loader.load()

# Chunks erstellen
splitter = RecursiveCharacterTextSplitter(
    chunk_size=500,
    chunk_overlap=50
)
chunks = splitter.split_documents(docs)

Schritt 2: Embeddings erstellen und speichern

from langchain_community.vectorstores import Qdrant
from langchain_community.embeddings import HuggingFaceEmbeddings

embeddings = HuggingFaceEmbeddings(model_name="BAAI/bge-large-de")

# Vektordatenbank erstellen
vectorstore = Qdrant.from_documents(
    chunks,
    embeddings,
    path="./rag_database"
)

Schritt 3: Abfrage und Antwort

# Abfrage durchführen
query = "Wie wird die Sicherheitsprüfung durchgeführt?"
results = vectorstore.similarity_search(query, k=5)

# Antwort generieren
prompt = f"""
Beantworte die Frage basierend auf den folgenden Dokumenten:
{results}

Frage: {query}
"""

Optimierung: Reranking

Standard-RAG gibt die K «ähnlichsten» Chunks zurück. Mit Reranking können Sie die Qualität deutlich verbessern:

  • Cross-Encoder: Präzisere, aber langsamere Suche
  • Hybrid Search: Kombination aus Vektorsuche und Keyword-Suche (BM25)
  • Metadata-Filter: Vorfilterung nach Dokumenttyp, Abteilung, Datum

Monitoring und Verbesserung

Eine RAG-Pipeline sollte überwacht werden:

  • Präzision: Wie viele der zurückgegebenen Chunks sind relevant?
  • Antwortqualität: Sind die Antworten korrekt und vollständig?
  • Antwortzeit: Wie lange dauert die Suche und Generation?
  • Nutzungs-Feedback: Welche Abfragen werden am häufigsten gestellt?

Tools: LangFuse, LangSmith, OpenLIT

Fazit: RAG ist der effektivste Einstieg in KI

Eine RAG-Pipeline ist die effektivste Methode, um KI-Modelle mit Ihren eigenen Daten zu verbinden. Mit Open-Source-Tools und einer RTX 4090 als Hardware können Sie eine voll funktionsfähige RAG-Pipeline für ca. 1.600 EUR aufbauen.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen