- Published on
KI-RAG-Pipeline aufbauen — Anleitung für den Mittelstand
- Authors

- Name
- Phillip Pham
- @ddppham
KI-RAG-Pipeline aufbauen — Anleitung für den Mittelstand
Retrieval-Augmented Generation (RAG) ist die effektivste Methode, um KI-Modelle mit Ihren eigenen Daten zu verbinden. Eine RAG-Pipeline durchsucht Ihre Wissensdatenbank, findet die relevanten Informationen und generiert präzise Antworten darauf.
Was ist RAG?
RAG kombiniert zwei Schritte:
- Retrieval: Die relevanten Dokumente aus Ihrer Wissensdatenbank finden
- Generation: Das KI-Modell generiert eine Antwort basierend auf den gefundenen Dokumenten
Der grosse Vorteil: Die KI antwortet nicht aus dem «Gedächtnis», sondern auf Basis Ihrer echten Dokumente. Das Ergebnis ist präziser, nachvollziehbarer und weniger fehleranfällig.
Die 5 Komponenten einer RAG-Pipeline
1. Datenquellen
Die Quelldokumente, die in die Wissensdatenbank eingehen:
- PDF-Dokumente — Arbeitsanweisungen, Richtlinien, Verträge
- Word-Dateien — Berichte, Protokolle, Spezifikationen
- Excel-Tabellen — Datenbestände, Kennzahlen, Listen
- Web-Seiten — Interne Wikis, Confluence, SharePoint
- E-Mails — Wichtige Kommunikationsverläufe
2. Chunking (Text-Zerschneidung)
Die Dokumente werden in kleinere Abschnitte («Chunks») zerlegt:
- Feste Chunk-Grösse: 500-1.000 Token pro Chunk
- Überlappung: 10-20% zwischen Chunks (für kontextuelle Kohärenz)
- Intelligentes Chunking: Basierend auf Absätzen, Überschriften oder Logik-Blöcken
Faustregel: 500 Token für technische Dokumente, 1.000 für allgemeine Texte.
3. Embedding
Jeder Chunk wird in eine numerische Repräsentation (Embedding) umgewandelt:
- Open-Source-Modelle: text-embedding-3-small (OpenAI), bge-large-de (BAAI)
- Lokale Modelle: sentence-transformers mit DEBERTA-basierten Modellen
- Embedding-Dimension: 1536 (OpenAI) oder 1024 (bge-large-de)
4. Vektordatenbank
Die Embeddings werden in einer Vektordatenbank gespeichert und indiziert:
- Qdrant — Open Source, Rust, gut für On-Premise
- Weaviate — Open Source, Go, Kubernetes-native
- Chroma — Einfachster Einstieg, Python
- Pinecone — Cloud-basiert, verwaltet
Für On-Premise-Qualität: Qdrant oder Weaviate.
5. Retrieval und Generation
Die Abfrage wird mit demselben Embedding-Modell verarbeitet und die ähnlichsten Chunks aus der Vektordatenbank gefunden:
- Top-K: Die K most relevanten Chunks werden zurückgegeben
- Reranking: Die Ergebnisse werden nach Relevanz sortiert
- Prompt-Konstruktion: Chunks + Abfrage + System-Prompt
- Generation: Das LLM antwortet basierend auf dem Prompt
Tech-Stack für eine RAG-Pipeline im Mittelstand
| Komponente | Empfohlene Wahl | Kosten |
|---|---|---|
| LLM | Qwen 2.5 7B (lokal) | 0 EUR (Hardware) |
| Embedding | bge-large-de (lokal) | 0 EUR (Hardware) |
| Vektordatenbank | Qdrant (lokal) | 0 EUR (Hardware) |
| Framework | LangChain / LlamaIndex | 0 EUR |
| Server | RTX 4090 | 1.600 EUR (einmalig) |
Total Kosten: ca. 1.600 EUR Hardware + 0 EUR laufend (ausser Strom).
Schritt-für-Schritt: Die einfachste RAG-Pipeline
Schritt 1: Dokumente laden und chunken
from langchain.text_splitter import RecursiveCharacterTextSplitter
from langchain.document_loaders import PDFLoader
# Dokumente laden
loader = PDFLoader("arbeitsanweisung.pdf")
docs = loader.load()
# Chunks erstellen
splitter = RecursiveCharacterTextSplitter(
chunk_size=500,
chunk_overlap=50
)
chunks = splitter.split_documents(docs)
Schritt 2: Embeddings erstellen und speichern
from langchain_community.vectorstores import Qdrant
from langchain_community.embeddings import HuggingFaceEmbeddings
embeddings = HuggingFaceEmbeddings(model_name="BAAI/bge-large-de")
# Vektordatenbank erstellen
vectorstore = Qdrant.from_documents(
chunks,
embeddings,
path="./rag_database"
)
Schritt 3: Abfrage und Antwort
# Abfrage durchführen
query = "Wie wird die Sicherheitsprüfung durchgeführt?"
results = vectorstore.similarity_search(query, k=5)
# Antwort generieren
prompt = f"""
Beantworte die Frage basierend auf den folgenden Dokumenten:
{results}
Frage: {query}
"""
Optimierung: Reranking
Standard-RAG gibt die K «ähnlichsten» Chunks zurück. Mit Reranking können Sie die Qualität deutlich verbessern:
- Cross-Encoder: Präzisere, aber langsamere Suche
- Hybrid Search: Kombination aus Vektorsuche und Keyword-Suche (BM25)
- Metadata-Filter: Vorfilterung nach Dokumenttyp, Abteilung, Datum
Monitoring und Verbesserung
Eine RAG-Pipeline sollte überwacht werden:
- Präzision: Wie viele der zurückgegebenen Chunks sind relevant?
- Antwortqualität: Sind die Antworten korrekt und vollständig?
- Antwortzeit: Wie lange dauert die Suche und Generation?
- Nutzungs-Feedback: Welche Abfragen werden am häufigsten gestellt?
Tools: LangFuse, LangSmith, OpenLIT
Fazit: RAG ist der effektivste Einstieg in KI
Eine RAG-Pipeline ist die effektivste Methode, um KI-Modelle mit Ihren eigenen Daten zu verbinden. Mit Open-Source-Tools und einer RTX 4090 als Hardware können Sie eine voll funktionsfähige RAG-Pipeline für ca. 1.600 EUR aufbauen.
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
Azure AI Search vs. pgvector vs. Qdrant für Enterprise-RAG
Drei Wege zum Vektorindex im Unternehmen. Die Entscheidung fällt nicht über Geschwindigkeit, sondern über Berechtigungen und wer den Betrieb übernimmt.
Was ein RAG-System für 50.000 Dokumente kostet
Aufbau, Betrieb und der Posten, der alles dominiert. Die vollständige Rechnung für einen mittelständischen Dokumentenbestand — mit allen Annahmen offen.
Berechtigungen im Vektorspeicher bis auf Chunk-Ebene
Ein RAG-System, das Berechtigungen erst nach dem Abruf prüft, ist ein Datenleck mit Verzögerung. Wie Rechte in den Index kommen und synchron bleiben.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)