Published on

Nemotron 3 Ultra: NVIDIAs offenes Modell im Unternehmen

Authors

Nemotron 3 Ultra: das offene Modell, das Compliance-Abteilungen mögen

TL;DR

Nemotron 3 Ultra hat 550 Milliarden Gesamt- und 55 Milliarden aktive Parameter, ein Kontextfenster von einer Million Token und eine Hybrid-Architektur aus Mamba und Attention. Es ist unter der OpenMDW-Lizenz der Linux Foundation veröffentlicht — mit Gewichten, Trainingsdaten und Rezepten. Genau diese Offenheit ist sein stärkstes Argument, nicht die Leistung.


Angaben geprüft am 4. August 2026 anhand der Herstellerveröffentlichung. Prüfen Sie Lizenz und Spezifikationen an der Modellkarte, bevor Sie eine Beschaffung darauf stützen.

Warum dieses Modell eine eigene Rolle spielt

In der Spitzengruppe der offen verfügbaren Modelle stammen die meisten von chinesischen Anbietern. Das ist datenschutzrechtlich beherrschbar, solange der Betrieb im eigenen Haus stattfindet — die Argumentation dazu steht im Beitrag zu chinesischen Modellen und dem Hosting-Ort.

Beherrschbar ist aber nicht dasselbe wie problemlos. In manchen Häusern gibt es Kundenverträge mit Herkunftsanforderungen, in anderen eine Geschäftsführung, die es schlicht nicht will. Für diese Fälle ist Nemotron 3 Ultra derzeit die naheliegendste Antwort: ein Modell dieser Größenordnung aus westlicher Hand, mit offenen Gewichten.

Der zweite Punkt geht weiter und wird unterschätzt: NVIDIA hat nicht nur die Gewichte veröffentlicht, sondern auch Trainingsdaten und Rezepte, unter der OpenMDW-Lizenz der Linux Foundation. Diese Lizenz räumt weitreichende Rechte einschließlich kommerzieller Nutzung ein und enthält eine Patentklausel.

Für eine Compliance-Abteilung ist das ein qualitativer Unterschied. Die Frage "womit wurde dieses Modell trainiert" ist bei den meisten offenen Modellen nicht beantwortbar. Hier ist sie es. Wer Nachweispflichten gegenüber Kunden oder Aufsichtsbehörden hat, wird diesen Punkt zu schätzen wissen.

Die Eckdaten

Gesamtparameter550 Milliarden
Aktiv je Token55 Milliarden
ArchitekturMoE, Hybrid aus Mamba und Attention
Kontextfenster1 Million Token
LizenzOpenMDW 1.1 (Linux Foundation)
VeröffentlichungJuni 2026

Die Hybrid-Architektur ist bei langen Kontexten technisch relevant. Klassische Attention wächst im Speicherbedarf linear mit der Kontextlänge — der KV-Cache ist bei einer Million Token der dominierende Posten. Mamba-Schichten arbeiten mit einem Zustand konstanter Größe und entlasten genau dort. Was das für die Speicherplanung bedeutet, behandelt der Beitrag zu Mamba-Hybriden und KV-Cache.

Die Ausrichtung des Modells liegt auf langlaufenden autonomen Abläufen — Agenten, die über viele Schritte hinweg arbeiten, statt einzelne Fragen zu beantworten.

Die Hardware-Rechnung

Bei etwa 0,6 Byte je Parameter in 4-Bit-Quantisierung:

Gewichte:  550 Mrd. × 0,6 Byte330 GB

Vier Karten à 96 GB ergeben 384 GB — rechnerisch passt es, praktisch bleiben nur rund 50 GB für KV-Cache und Overhead. Das ist für einen Einzelnutzer machbar und für mehrere parallele Sitzungen zu knapp. Realistisch sind acht Karten, also rund 96.000 Euro netto allein für GPUs.

vllm serve /models/nemotron-3-ultra \
  --served-model-name nemotron \
  --tensor-parallel-size 8 \
  --max-model-len 131072 \
  --gpu-memory-utilization 0.92 \
  --max-num-seqs 16

Die 55 Milliarden aktiven Parameter sind der höchste Wert in diesem Modellfeld. Das bedeutet: mehr Rechenlast je Token als bei schlankeren MoE-Modellen und entsprechend geringeren Durchsatz bei gleicher Hardware. Wer das Modell für Agenten einsetzt, bei denen ohnehin über Minuten gearbeitet wird, wird das kaum stören. Für einen interaktiven Chat mit vielen Nutzern ist es ein Nachteil.

Zur Architektur ein Hinweis aus der Praxis: Hybride Modelle werden von Inferenzservern nicht immer sofort und nicht immer vollständig unterstützt. Prüfen Sie vor der Beschaffung, ob Ihre vLLM-Version die Architektur mit allen benötigten Funktionen abdeckt — insbesondere Quantisierung und Tensor-Parallelität in Kombination.

Wann sich das rechnet

Drei Fälle, in denen wir das Modell empfehlen würden:

Herkunftsanforderungen aus Verträgen. Wenn Kundenverträge oder Ausschreibungsbedingungen Komponenten bestimmter Herkunft ausschließen, ist dies aktuell eine der wenigen offenen Optionen in dieser Leistungsklasse.

Nachweispflichten zur Trainingsgrundlage. Wenn Sie gegenüber Kunden oder einer Aufsicht darlegen müssen, worauf ein eingesetztes Modell beruht, ist ein Modell mit veröffentlichten Trainingsdaten in einer anderen Lage als eines ohne.

Langlaufende Agenten mit sehr langem Kontext. Die Hybrid-Architektur ist genau dafür ausgelegt, und der geringere Durchsatz fällt bei diesem Nutzungsmuster kaum ins Gewicht.

Für alles andere — interne Wissenssuche, Textformulierung, Zusammenfassung — ist ein Modell der 30B-Klasse auf einer Karte die wirtschaftlichere Antwort. Diese Aussage wiederholen wir in dieser Serie mehrfach, weil sie in Sizing-Gesprächen mehrfach relevant wird.

Häufig gestellte Fragen

Was ist die OpenMDW-Lizenz?

Eine von der Linux Foundation herausgegebene Lizenz für Modelle, die weitreichende Rechte einschließlich kommerzieller Nutzung ohne Lizenzgebühren einräumt und eine Patentklausel enthält. Sie ist für Unternehmen unkritisch anwendbar — im Gegensatz zu herstellereigenen Lizenzen, die den kommerziellen Einsatz teilweise an eine gesonderte Vereinbarung binden.

Wie viel Grafikspeicher braucht Nemotron 3 Ultra?

Bei 550 Milliarden Parametern und 4-Bit-Quantisierung rund 330 GB allein für die Gewichte. Vier Karten der 96-GB-Klasse reichen rechnerisch, lassen aber kaum Spielraum für KV-Cache und parallele Sitzungen. Für einen produktiven Mehrbenutzerbetrieb sind acht Karten die realistische Auslegung.

Was bringt die Hybrid-Architektur aus Mamba und Attention?

Sie entlastet den Speicher bei langen Kontexten. Klassische Attention lässt den KV-Cache linear mit der Kontextlänge wachsen — bei einer Million Token ist er der dominierende Speicherposten. Mamba-Schichten arbeiten mit einem Zustand konstanter Größe und reduzieren diesen Anteil erheblich, was lange Kontexte überhaupt erst praktikabel macht.

Ist Nemotron 3 Ultra schneller als andere offene Modelle?

Bei gleicher Hardware eher nicht. Mit 55 Milliarden aktiven Parametern je Token liegt es über anderen MoE-Modellen, die bei 11 bis 23 Milliarden aktivieren — mehr aktive Parameter bedeuten mehr Rechenlast und damit geringeren Durchsatz. Der Vorteil liegt in der Qualität bei langen, mehrstufigen Aufgaben, nicht in der Geschwindigkeit.

Warum ist die Herkunft eines Modells überhaupt relevant?

Datenschutzrechtlich ist sie es beim Eigenbetrieb nicht — dort zählt der Verarbeitungsort. Relevant wird sie durch Verträge: Rahmenverträge im Verteidigungsbereich, bei kritischer Infrastruktur und mit öffentlichen Auftraggebern enthalten teilweise Herkunftsanforderungen an eingesetzte Komponenten. Das ist eine vertragliche Bindung, die unabhängig vom Verarbeitungsort greift.


Der nächste Schritt

Prüfen Sie zuerst Ihre Kundenverträge auf Herkunftsanforderungen. Wenn keine bestehen, entscheiden Sie über das Modell nach Leistung und Kosten — dann steht Nemotron 3 Ultra im normalen Wettbewerb. Wenn welche bestehen, haben Sie eine deutlich kürzere Kandidatenliste. Bei der Auswahl schauen wir gern mit.

📖 Verwandte Artikel

Weitere interessante Beiträge zu ähnlichen Themen