Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Nemotron 3 Super

Veröffentlichung
März 2026
Kontextfenster
1,05 Mio. Token
API-Preis In / Out
0,30 $ / 0,75 $
Knowledge Cutoff
Juni 2025
Daten aktualisiert: 16. Juni 2026

Nemotron 3 Super Modell-Übersicht

Nemotron 3 Super ist ein Open-Weights-Modell von NVIDIA aus der Nemotron-3-Familie. Vorgestellt wurde Nemotron Super 3 auf der GTC 2026. Das LLM kombiniert eine Hybride Architektur aus Mamba-2-Layern, Transformer-Attention-Layern und Latent-Mixture-of-Experts (LatentMoE) zu einem 120B-Parameter-Modell, das 12B Parameter pro Token aktiviert. Nemotron 3 Super kann ein Kontextfenster von bis zu 1 Mio. Tokens verarbeiten und ist für den Einsatz als KI-Agent und für Multi-Step-Workflows optimiert.

Features & Modalitäten

Nicht verfügbar
MultimodalitätWebsucheQuellenangaben
Verfügbar
ReasoningToolsStrukturierte AusgabenFinetuning
Input:Text
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1,05 Mio. Token
Max. Output
32,77k Token
Input-Preis / 1M Token
0,30 $
Output-Preis / 1M Token
0,75 $
Parameter
120,6 Mrd.
Dateigröße
230,25 GB
Vokabular
131,07k
Trainingsdaten
25.000 Mrd.

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0011 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Nemotron 3 Super Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturHybrid
Input Kontextlänge1,05 Mio.
Output Kontextlänge32,77k
TokenizerProprietär

Besonderheiten

Latent Mixture-of-Experts (LatentMoE)Komprimiert Tokens in einen latenten Raum vor dem Expert-Routing, wodurch 4x mehr Experten bei identischen Rechenkosten aktiviert werden können.
Multi-Token Prediction (MTP)Sagt mehrere zukünftige Tokens in einem Forward-Pass vorher.
Konfigurierbares ReasoningStufen: deaktiviert, niedrig (low_effort) oder vollständig (enable_thinking).

Vorteile & Nachteile

Vorteile

  • Vollständig offenes LLM
    NVIDIA veröffentlicht ausführliche Informationen und Details zum Trainingsprozess von Nemotron 3 Super. Es lassen sich sowohl die Model Weights, als auch Trainingssätze für eigene Modelle herunterladen.
  • Ideal für Forscher und Entwickler
    Durch die Transparenz und veröffentlichten Datensätze dürfte Nemotron 3 Super insbesondere KI-Forscher begeistern.
  • Sehr hoher Throughput
    NVIDIA Nemotron 3 Super erreicht im Vergleich zu GPT-OSS (120B) einen ca. 2,2x höheren Token-Throughput.
  • Gutes Preis-Leistungs-Verhältnis
    Bei API Anbietern wie DeepInfra lässt sich Nemotron 3 Super bereits ab $0,10 / 1 Mio. Input- und $0,50 / 1 Mio. Output-Tokens nutzen. Außerdem lässt sich das Modell lokal deployen – ausreichende Hardware vorausgesetzt.

Nachteile

  • Sehr hohe Hardware-Anforderungen
    Laut Angaben von NVIDIA werden mindestens 8x H100-80GB GPUs für ein BF16-Deployment empfohlen.
  • API-Anbieter begrenzen Kontextfenster
    Die meisten API-Anbieter beschränken das Kontextfenster aktuell auf 262K Token statt der nativen 1 Mio. Tokens.
  • Keine Multimodalität
    NVIDIA Nemotron 3 Super verarbeitet ausschließlich Text, keine Bild-, Audio- oder Video-Inhalte.
  • Neuartige Architektur mit begrenztem Ökosystem
    Die Hybrid-Mamba-Transformer-LatentMoE-Architektur ist noch jung. Bewährte reine Transformer-MoE-Architekturen bieten breitere Tool-Unterstützung und mehr Stabilität.

Vergleiche Nemotron 3 Super mit anderen LLMs

Vergleiche Nemotron 3 Super mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Nemotron 3 Super ausprobieren

Nemotron 3 Super hat offene Gewichte: Du kannst das Modell herunterladen und selbst hosten — oder es bei einem der API-Provider unten nutzen.

Lizenz
Open Model License
Selbst hosten
Möglich
Dateigröße
230,25 GB

Provider & APIs

Du kannst NVIDIA Nemotron 3 Super über die API folgender Anbieter nutzen.

Das Modell ist derzeit bei keinen Anbietern verfügbar.

Häufige Fragen zu Nemotron 3 Super

Ist Nemotron 3 Super Open Source?

Nemotron 3 Super wird unter der Lizenz „Open Model License“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht Nemotron 3 Super?

Nemotron 3 Super verarbeitet folgende Eingabeformate: Text.

Was kostet Nemotron 3 Super über die API?

Über die API kostet Nemotron 3 Super 0,30 $ pro 1 Mio. Input-Token und 0,75 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Nemotron 3 Super?

Nemotron 3 Super verarbeitet bis zu 1,05 Mio. Token in einer Anfrage.

Wie aktuell ist das Wissen von Nemotron 3 Super?

Der Wissensstand (Knowledge Cutoff) von Nemotron 3 Super reicht bis Juni 2025.