- Published on
MiMo-V2.5 und Hy3: was Xiaomi und Tencent im Betrieb taugen
- Authors

- Name
- Phillip Pham
- @ddppham
MiMo-V2.5 und Hy3: die zweite Reihe, die keine ist
TL;DR
Xiaomis MiMo-V2.5 steht unter MIT-Lizenz und existiert in zwei Größen — 310 Milliarden und 1,02 Billionen Parameter. Tencents Hy3 hat 295 Milliarden Gesamtparameter bei rund 21 Milliarden aktiven und steht unter Apache 2.0. Beide sind lizenzrechtlich unkritischer als manches bekanntere Modell — und beide sprengen für den Mittelstand die Hardwarerechnung.
Angaben geprüft am 4. August 2026. Prüfen Sie Spezifikationen und Lizenzen an den Modellkarten der Hersteller, bevor Sie darauf kalkulieren.
Warum diese beiden zusammen
Weil sie dasselbe Muster zeigen: Anbieter, die man in Deutschland nicht als KI-Häuser kennt, veröffentlichen Modelle in der Leistungsklasse der bekannten Namen — und tun das unter Lizenzen, die permissiver sind als bei manchem Wettbewerber.
Xiaomi ist hierzulande ein Hersteller von Telefonen. Tencent ist als Betreiber von WeChat bekannt. Beide betreiben ernsthafte Forschungsabteilungen, deren Ergebnisse offen verfügbar sind.
Die Eckdaten
| MiMo-V2.5 | MiMo-V2.5-Pro | Hy3 | |
|---|---|---|---|
| Anbieter | Xiaomi | Xiaomi | Tencent |
| Gesamtparameter | 310 Mrd. | 1,02 Bio. | 295 Mrd. |
| Aktiv je Token | k. A. | k. A. | ca. 21 Mrd. |
| Kontextfenster | 1 Mio. | 1 Mio. | k. A. |
| Lizenz | MIT | MIT | Apache 2.0 |
| Veröffentlichung | April 2026 | April 2026 | Juli 2026 |
Zwei Beobachtungen, die für eine Beschaffung zählen.
Die Lizenzen sind der eigentliche Vorteil. MIT und Apache 2.0 erlauben die kommerzielle Nutzung ohne gesonderte Vereinbarung mit dem Anbieter. Das ist keine Selbstverständlichkeit — es gibt Modelle mit offenen Gewichten, deren Lizenzen genau das nicht tun. Wenn Sie zwischen Modellen ähnlicher Leistung wählen, ist eine permissive Lizenz ein handfestes Kriterium und kein Nebenaspekt.
Xiaomi bietet eine multimodale Variante. Die Serie umfasst nach Herstellerangaben ein Modell, das Text, Bild, Video und Audio versteht. Für industrielle Anwendungsfälle, in denen Aufnahmen und Dokumente gemeinsam bewertet werden, ist das relevant — und die MIT-Lizenz macht es einfacher einzusetzen als multimodale Modelle unter restriktiveren Bedingungen.
Die Speicherrechnung
Bei etwa 0,6 Byte je Parameter in 4-Bit-Quantisierung:
| Modell | Gewichte | Karten à 96 GB | GPU-Kosten netto |
|---|---|---|---|
| Hy3 | ca. 177 GB | 4 | ca. 48.000 € |
| MiMo-V2.5 | ca. 186 GB | 4 | ca. 48.000 € |
| MiMo-V2.5-Pro | ca. 612 GB | 8 | ca. 96.000 € |
Hy3 aktiviert mit rund 21 Milliarden Parametern je Token vergleichsweise wenig — das bedeutet höheren Durchsatz bei gleicher Hardware als bei Modellen, die 40 oder 55 Milliarden aktivieren. Wenn Sie viele parallele Nutzer bedienen müssen, ist das ein realer Vorteil, der in Leistungsvergleichen selten auftaucht.
Die Pro-Variante von MiMo mit über einer Billion Parametern ist für den Mittelstand außerhalb der Diskussion. Wir führen sie auf, damit die Größenordnung klar ist, nicht als Empfehlung.
Der Punkt, den wir offen ansprechen
Die Sprachqualität im Deutschen ist bei Modellen, die überwiegend auf chinesischen und englischen Daten trainiert wurden, nicht selbstverständlich gut. Sie ist bei aktuellen Modellen dieser Größenordnung meist brauchbar — aber "meist brauchbar" ist keine Grundlage für eine Beschaffung.
Testen Sie das mit Ihren eigenen Texten, bevor Sie irgendetwas entscheiden. Konkret: Nehmen Sie zwanzig Fragen zu Ihren eigenen Fachdokumenten, lassen Sie sie beantworten und lassen Sie die Antworten von jemandem aus der Fachabteilung bewerten. Nicht auf Richtigkeit — auf Formulierung. Ein Modell, das fachlich richtig antwortet und dabei ungelenk klingt, wird von Anwendern abgelehnt.
Die Systematik für einen solchen Vergleich steht im Beitrag zum Modellvergleich für deutsche Texte.
Für wen das in Frage kommt
Ehrlich: für wenige Häuser im Mittelstand direkt.
Bei vier Karten und rund 48.000 Euro netto allein für GPUs, plus Server und Infrastruktur, landen Sie bei 65.000 bis 75.000 Euro Investition. Das trägt nur, wenn die Auslastung hoch ist und die Aufgabe tatsächlich ein Modell dieser Klasse verlangt.
Wo diese Modelle trotzdem relevant werden: über europäische Anbieter, die sie als Dienst bereitstellen. Sie bekommen dann die Leistung ohne die Investition, und die Verarbeitung bleibt im europäischen Rechtsraum. Die Lizenzfrage ist dabei Sache des Anbieters — lassen Sie sich bestätigen, dass er sie geklärt hat.
Der zweite Grund, sie zu kennen: Modelle in dieser Klasse setzen den Maßstab, an dem die kleineren gemessen werden. Die 30B-Modelle von heute können, was die Spitzenmodelle vor anderthalb Jahren konnten. Wer die obere Kante beobachtet, kann abschätzen, was in einem Jahr auf einer einzelnen Karte laufen wird.
Häufig gestellte Fragen
Unter welcher Lizenz stehen MiMo-V2.5 und Hy3?
MiMo-V2.5 steht nach Herstellerangaben unter MIT-Lizenz und erlaubt kommerzielle Nutzung sowie weiteres Training ohne zusätzliche Genehmigung. Hy3 von Tencent steht unter Apache 2.0. Beide sind damit lizenzrechtlich unkritischer als manche Modelle, deren kommerzieller Einsatz eine gesonderte Vereinbarung erfordert.
Wie viel Hardware braucht Hy3?
Bei 295 Milliarden Parametern in 4-Bit-Quantisierung rund 177 GB für die Gewichte, also vier Karten der 96-GB-Klasse. Mit etwa 21 Milliarden aktiven Parametern je Token liegt der Durchsatz bei gleicher Hardware höher als bei Modellen mit 40 oder mehr aktiven Parametern — ein Vorteil bei vielen parallelen Nutzern.
Können diese Modelle gut Deutsch?
Bei Modellen dieser Größenordnung ist die deutsche Sprachqualität meist brauchbar, aber sie ist kein Konstruktionsziel gewesen. Testen Sie mit eigenen Fachtexten und lassen Sie die Antworten von Anwendern bewerten — nicht auf fachliche Richtigkeit, sondern auf Formulierung. Ungelenkes Deutsch führt zuverlässig zur Ablehnung durch die Fachabteilung.
Lohnt sich ein Modell dieser Größe für den Mittelstand?
In der Regel nicht als Eigeninvestition. Bei 65.000 bis 75.000 Euro Gesamtinvestition für vier Karten samt Infrastruktur muss die Auslastung hoch und die Aufgabe anspruchsvoll sein. Praktikabler ist der Bezug über einen europäischen Anbieter, der solche Modelle als Dienst bereitstellt — die Verarbeitung bleibt im europäischen Rechtsraum, die Investition entfällt.
Warum sollte ich Modelle kennen, die ich nicht einsetzen kann?
Weil sie den Maßstab für die nächste Generation kleinerer Modelle setzen. Was heute 300 Milliarden Parameter verlangt, läuft in absehbarer Zeit in deutlich kompakteren Modellen auf einer einzelnen Karte. Wer die obere Kante beobachtet, kann einschätzen, welche Anwendungsfälle bald wirtschaftlich werden — und welche Investition sich zu verschieben lohnt.
Der nächste Schritt
Wenn Sie ein Modell dieser Klasse erwägen, mieten Sie zuerst Kapazität bei einem europäischen Anbieter und testen Sie zwei Tage mit eigenen Fachtexten. Der Sprachtest entscheidet häufiger über die Akzeptanz als jeder Leistungsvergleich. Beim Aufbau des Tests helfen wir gern.
📖 Verwandte Artikel
Weitere interessante Beiträge zu ähnlichen Themen
Die zehn meistgenutzten LLMs — welche in Europa laufen
Sieben der zehn meistgenutzten Modelle kommen aus China, mit offenen Gewichten. Was das für deutsche Unternehmen heißt — Lizenz- und VRAM-Tabelle.
DeepSeek V4 Flash selbst hosten: VRAM, Setup, Durchsatz
284 Milliarden Parameter unter MIT-Lizenz. Was der Betrieb im eigenen Rechenzentrum wirklich kostet — Speicherrechnung, Konfiguration, Grenzen.
GLM-5.2 im Unternehmen betreiben: Hardware und Grenzen
Ein offenes Modell mit rund 743 Milliarden Parametern unter MIT-Lizenz, ausgelegt auf lange Coding-Aufgaben. Was der Eigenbetrieb realistisch verlangt.
Bereit für KI im Mittelstand?
Nutzen Sie unsere 10 kostenlosen KI-Tools und Praxis-Guides – oder sprechen Sie direkt mit unseren Experten.
Pexon Consulting – KI-Beratung für den Mittelstand | Scaly Academy – Geförderte KI-Weiterbildung (KI-Spezialist, KI-Experte, Workflow-Automatisierung)