Published on

LiteLLM + Ollama Routing: €15.000/Monat sparen, Datenhoheit sichern

Authors

LiteLLM und Ollama: On-Premise KI-Routing für Kostenersparnis und Datenhoheit im Mittelstand

TL;DR

LiteLLM in Kombination mit Ollama ermöglicht deutschen Mittelständlern, KI-Modellkosten um 30-50% zu senken – das entspricht einer monatlichen Ersparnis von bis zu 15.000€. Durch intelligentes Routing und automatischen Fallback auf lokale Ollama-Modelle sichern Sie Datenhoheit und erhöhen die Zuverlässigkeit Ihrer KI-Anwendungen, insbesondere in datensensiblen Branchen wie der Fertigung.


Viele mittelständische Unternehmen, insbesondere in der Fertigung oder im Maschinenbau, stehen vor einer doppelten Herausforderung bei der Einführung von Large Language Models (LLMs): einerseits explodierende Cloud-API-Kosten bei intensiver Nutzung und andererseits Bedenken hinsichtlich der Datenhoheit und Compliance. Interne Dokumentenanalysen, Support-Chatbots oder automatisierte Qualitätsberichte können schnell teuer werden, wenn jede Anfrage über externe Cloud-Anbieter läuft.

Genau hier bieten LiteLLM und Ollama eine überzeugende Lösung. Sie ermöglichen den Aufbau einer flexiblen, kosteneffizienten und datenschutzkonformen On-Premise-KI-Infrastruktur.

Das Problem: Unkontrollierte Kosten und Abhängigkeit von Cloud-LLMs

Ohne eine zentrale Steuerung kann der Verbrauch von Cloud-LLM-APIs, wie GPT-4 oder Claude 3, schnell ausufern. Einzelne Fachabteilungen experimentieren mit verschiedenen Modellen, und schnell summieren sich Tausende von Anfragen pro Tag. Beispielrechnung: Bei einem durchschnittlichen Tokenpreis von 0,01 € für Prompts und 0,03 € für Completions können 50.000 Anfragen pro Tag mit jeweils 2.000 Token schnell über 30.000 € monatlich kosten. Hinzu kommen Risiken durch die Übermittlung sensibler Unternehmensdaten an externe Server, was für Branchen wie die Fertigung, die strenge IP-Schutz- und Datenschutzauflagen haben, ein No-Go ist.

Herausforderungen auf einen Blick:

  • Kostenexplosion: Jede Anfrage an Cloud-LLMs verursacht Kosten, die schwer zu prognostizieren und zu kontrollieren sind.
  • Datenhoheit: Sensible Produktionsdaten oder Kundendaten verlassen das eigene Rechenzentrum.
  • Verfügbarkeit: Abhängigkeit von externen Anbietern und deren Service-Level-Agreements.
  • Modell-Sprawl: Unterschiedliche Teams nutzen unterschiedliche APIs, was die Verwaltung erschwert.

Wir erleben in der Praxis, dass Unternehmen, die diese Aspekte ignorieren, Projekte entweder frühzeitig einstellen oder mit unerwartet hohen Rechnungen konfrontiert werden.

Die Lösung: Intelligentes LLM-Routing mit LiteLLM und Ollama

LiteLLM fungiert als universelles API-Gateway für über 100 verschiedene LLM-Anbieter. Es bietet eine OpenAI-kompatible Schnittstelle, hinter der Sie eine komplexe Logik für Routing, Fallback, Caching und Kostenkontrolle definieren können.

Ollama wiederum ist ein fantastisches Open-Source-Tool, um Large Language Models (LLMs) lokal auf eigener Hardware zu betreiben. Es vereinfacht das Herunterladen, Ausführen und Verwalten von Modellen wie Llama 3, Mistral oder Gemma.

Die Kombination ist die Stärke:

  1. LiteLLM als zentrales Gateway: Ihre internen Anwendungen sprechen nur noch mit einem einzigen Endpoint, der von LiteLLM bereitgestellt wird.
  2. Intelligentes Routing: LiteLLM kann Anfragen basierend auf Kriterien wie Kosten, Verfügbarkeit, Modellgröße oder sogar der Art der Anfrage an das am besten geeignete LLM weiterleiten.
  3. Ollama als lokaler Leistungsträger: Für Standardanfragen oder hochsensible Daten routet LiteLLM die Anfragen an lokale Modelle, die über Ollama auf Ihren eigenen Servern laufen. Dies spart nicht nur Kosten, sondern stellt auch sicher, dass keine Daten Ihre Infrastruktur verlassen.
  4. Automatischer Fallback: Fällt ein Cloud-Modell aus oder überschreitet es ein Budgetlimit, kann LiteLLM Anfragen automatisch an ein anderes, möglicherweise günstigeres oder lokales Modell (via Ollama) weiterleiten.
  5. Observability & Kostenkontrolle: LiteLLM bietet detaillierte Logs und Metriken zum Verbrauch der einzelnen Modelle, wodurch Sie Ihre Kosten transparent verfolgen und steuern können.

Dieser Ansatz ermöglicht es IT-Leitern, eine robuste und zugleich flexible KI-Strategie zu implementieren, die sowohl den Anforderungen der Fachabteilungen als auch den Vorgaben des Controllings und des Datenschutzes gerecht wird.

Funktionsweise am Beispiel:

Ein typischer Ablauf könnte so aussehen:

  1. Eine Anwendung fragt LiteLLM an, z.B. um eine E-Mail vorzuformulieren.
  2. LiteLLM prüft die Konfiguration:
    • Ist der Inhalt sensibel? Wenn ja, leite an ollama/llama3 (lokal).
    • Ist das Budget für GPT-4 diese Stunde erreicht? Wenn ja, leite an ollama/mistral.
    • Ist es eine Standardanfrage ohne Sensibilität? Wenn ja, nutze ein günstigeres Cloud-Modell wie GPT-3.5-Turbo.
  3. Die Anfrage wird an das ausgewählte Modell gesendet und die Antwort zurückgegeben.
  4. LiteLLM protokolliert die Kosten und die Modellnutzung.

Konkrete Anwendung im Mittelstand: Die Fertigungsbranche

Betrachten wir ein Beispiel aus der Fertigung: Ein Maschinenbauunternehmen nutzt KI, um Servicemeldungen zu klassifizieren und Fehlerberichte auszuwerten.

  • Szenario 1: Interne Wissensdatenbank-Abfrage: Ein Techniker fragt ein KI-System nach Lösungen für einen seltenen CNC-Maschinenausfall. Diese Daten sind hochsensibel und sollen das Netzwerk niemals verlassen. LiteLLM leitet die Anfrage an ein lokal auf einem Server laufendes ollama/llama3-Modell weiter, das auf der internen Dokumentation trainiert wurde. Die SharePoint On-Premise RAG: KI-Suche im Intranet ist hierfür ein idealer Anknüpfungspunkt.
  • Szenario 2: Allgemeine Kundenanfrage: Ein Kunde stellt eine einfache Frage zum Produktportfolio über den Unternehmens-Chatbot. LiteLLM kann diese Anfrage an ein kostengünstiges Cloud-Modell (z.B. GPT-3.5-Turbo) senden, da hier keine sensiblen Unternehmensdaten im Spiel sind.
  • Szenario 3: Engpass beim Cloud-Anbieter: Der bevorzugte Cloud-Anbieter hat eine Störung. LiteLLM erkennt dies und routet alle Anfragen automatisch an ein vordefiniertes Fallback-Modell auf Ollama oder einen anderen Cloud-Anbieter um. Die Produktionsplanung oder der Support wird nicht unterbrochen.

Beispiel für Kosteneinsparung (Fertigungsunternehmen, 500 MA):

PositionOhne LiteLLM/Ollama (Cloud only)Mit LiteLLM/Ollama (Hybrid)Ersparnis pro Monat
Monatliche API-Kosten (LLM-Anfragen)25.000 €10.000 € (30% lokal, 70% Cloud)15.000 €
Infrastrukturkosten (On-Premise Server)0 € (da Cloud)1.500 € (GPU-Server)-1.500 €
Personalkosten (Admin, Wartung)500 €1.000 €-500 €
Gesamtkosten pro Monat25.500 €12.500 €13.000 €

Beispielrechnung: Die Einsparung von 13.000 € pro Monat amortisiert Investitionen in die lokale Hardware in der Regel innerhalb von 12-18 Monaten, bei verbesserter Datenhoheit.

Technische Implementierung: Ein Blick unter die Haube

Die Einrichtung von LiteLLM und Ollama ist für versierte IT-Abteilungen gut machbar. Hier ein vereinfachtes Beispiel, wie Sie LiteLLM konfigurieren, um einen Fallback auf ein lokales Ollama-Modell zu gewährleisten.

Zuerst benötigen Sie Ollama auf einem Server mit ausreichend GPU-Ressourcen. Eine detaillierte Ollama Installationsanleitung für Ubuntu 2026 finden Sie in unserem Blog.

Nach der Installation von Ollama können Sie Modelle herunterladen:

ollama pull llama3
ollama pull mistral

Anschließend konfigurieren Sie LiteLLM als Proxy. LiteLLM kann als Python-Paket oder über Docker betrieben werden. Hier ein Beispiel für die Konfiguration einer .env Datei für LiteLLM, die ein intelligentes Routing und Fallback definiert:

# .env Datei für LiteLLM
# Hauptmodell: OpenAI GPT-4-Turbo
OPENAI_API_KEY="sk-..."

# Fallback/Sekundärmodelle: Ollama
OLLAMA_API_BASE="http://localhost:11434" # Oder IP Ihres Ollama-Servers

# LiteLLM Routing Konfiguration (z.B. in einem Python-Skript oder über eine LiteLLM Konfigurationsdatei)
# Hier ein konzeptionelles Beispiel, wie Sie Routing-Logik definieren würden
# Die genaue Implementierung hängt von Ihrer LiteLLM-Version und Anwendungsfall ab.
# LiteLLM kann direkt mit verschiedenen LLMs über ihre API-Keys umgehen.
# Für Fallbacks können Sie eine Liste von Modellen definieren:
# litellm --model gpt-4-turbo --model ollama/llama3 --debug

# Ein Beispiel für ein robustes Routing mit Fallback in Python könnte so aussehen:
# from litellm import completion
#
# try:
#     response = completion(
#         model="gpt-4-turbo",
#         messages=[{"role": "user", "content": "Beschreibe die Vorteile von Predictive Maintenance"}],
#         # Wenn gpt-4-turbo fehlschlägt, versuche ollama/llama3
#         fallbacks=["ollama/llama3"]
#     )
#     print(response.choices[0].message.content)
# except Exception as e:
#     print(f"Fehler bei der KI-Anfrage: {e}")
#     # Hier könnte man eine Benachrichtigung senden oder eine andere Logik ausführen

Dieser Ansatz ermöglicht eine hohe Flexibilität. Sie können jederzeit weitere lokale Modelle hinzufügen oder Cloud-Anbieter integrieren, ohne die Schnittstelle Ihrer Anwendungen anpassen zu müssen.

Worauf Sie achten sollten bei der Implementierung

Die Einführung einer On-Premise-KI-Infrastruktur erfordert sorgfältige Planung, insbesondere im Mittelstand:

  1. Hardware-Dimensionierung: Lokale LLMs sind ressourcenintensiv. Stellen Sie sicher, dass Sie über ausreichend leistungsstarke GPUs und RAM verfügen. Für kleinere Modelle reichen oft Consumer-GPUs, für größere Modelle sind Server-GPUs wie die NVIDIA A100 oder H100 notwendig.
  2. Netzwerkintegration: Ollama und LiteLLM müssen reibungslos in Ihre bestehende IT-Infrastruktur integriert werden.
  3. Sicherheitskonzepte: Auch wenn die Daten das Haus nicht verlassen, sind Zugangskontrollen und regelmäßige Sicherheitsaudits unerlässlich.
  4. Compliance: Klären Sie interne Richtlinien und externe Vorschriften (z.B. DSGVO, IATF 16949 im Automobilzulieferbereich), die für den Betrieb lokaler KI-Modelle relevant sind.
  5. Wartung & Updates: Lokale Modelle und deren Infrastruktur müssen gepflegt und aktualisiert werden. Planen Sie Ressourcen für Administration und Monitoring ein.
  6. Modell-Auswahl: Nicht jedes Problem erfordert das größte Modell. Wählen Sie Modelle, die sowohl von der Performance als auch vom Ressourcenverbrauch optimal sind. Oft sind kleinere, spezialisierte Modelle performanter und günstiger als generische Riesenmodelle.

Wir raten davon ab, ohne klare Strategie und ausreichende Hardware in lokale LLMs einzusteigen. Eine fundierte Bedarfsanalyse und ein Proof-of-Concept sind hier entscheidend.


Häufig gestellte Fragen

Was kostet die Implementierung von LiteLLM und Ollama?

Die Software selbst ist Open-Source und kostenlos. Die Hauptkosten fallen für die notwendige Hardware (GPU-Server) an. Ein performanter Server kann zwischen 5.000 € und 50.000 € kosten, je nach gewünschter Leistung. Hinzu kommen interne Personalkosten für Einrichtung und Wartung, die wir auf 5-10 Personentage für die initiale Einrichtung schätzen. Die Betriebskosten für Strom sind im Vergleich zu den möglichen Einsparungen bei API-Gebühren meist gering.

Wie komplex ist die technische Umsetzung im Mittelstand?

Für IT-Abteilungen mit Erfahrung im Bereich Linux-Server, Docker und API-Integration ist die Umsetzung als "mittelschwer" einzustufen. Es erfordert Know-how im Server-Management und ein grundlegendes Verständnis von LLMs. Mit unserem Support oder einem erfahrenen Dienstleister ist der Prozess jedoch deutlich beschleunigbar.

Welche Modelle kann ich mit Ollama lokal betreiben?

Ollama unterstützt eine Vielzahl von Open-Source-LLMs, darunter beliebte Modelle wie Llama 3, Mistral, Gemma, Phi-2 und viele weitere. Die Verfügbarkeit hängt von der jeweiligen Community-Unterstützung und den Ressourcen Ihres Servers ab. Ollama ist bekannt dafür, neue Modelle sehr schnell zu integrieren.

Bietet diese Lösung volle DSGVO-Konformität?

Ja, da die Datenverarbeitung komplett auf Ihrer eigenen Infrastruktur stattfindet, haben Sie die volle Kontrolle über die Daten. Es werden keine Daten an Dritte übermittelt, solange Sie dies nicht explizit für bestimmte Routen in LiteLLM konfigurieren. Dies ist ein entscheidender Vorteil gegenüber reinen Cloud-Lösungen.

Wie groß sind die potenziellen Einsparungen wirklich?

Praxis-Erfahrung zeigt, dass Unternehmen mit einem durchschnittlichen monatlichen Cloud-LLM-Verbrauch von über 5.000 € Einsparungen von 30-60% realisieren können. Bei hohen Verbräuchen im Bereich von 20.000 € und mehr pro Monat sind Einsparungen von 10.000 € bis 15.000 € pro Monat durchaus realistisch, sobald die lokale Infrastruktur etabliert ist. Der Return on Investment (ROI) liegt dabei typischerweise zwischen 12 und 24 Monaten.


Fazit und nächster Schritt

LiteLLM in Kombination mit Ollama bietet deutschen Mittelständlern eine pragmatische und leistungsstarke Strategie, um die Vorteile generativer KI zu nutzen, ohne dabei die Kontrolle über Kosten und Daten zu verlieren. Die Möglichkeit, flexibel zwischen Cloud- und On-Premise-Modellen zu routen und automatische Fallbacks zu nutzen, schafft eine resiliente und zukunftssichere KI-Architektur.

Wenn Sie daran interessiert sind, Ihre KI-Kosten zu optimieren und gleichzeitig Ihre Datenhoheit zu stärken, sprechen Sie uns an. Wir unterstützen Sie gerne bei der Analyse Ihres Bedarfs, der Konzeption Ihrer On-Premise-KI-Strategie und der technischen Implementierung.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen