Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Nemotron 3.5 Lightning 30B

Veröffentlichung
August 2026Neu
Kontextfenster
262,14k Token
API-Preis In / Out
0,08 $ / 0,20 $
Parameter
30 Mrd.
Daten aktualisiert: 3. September 2026

Nemotron 3.5 Lightning 30B Modell-Übersicht

Nemotron 3.5 Lightning 30B ist ein kompaktes Open Weights Modell von NVIDIA aus der neuen Nemotron-3.5-Generation, veröffentlicht am 11. August 2026 unter der OpenMDW-1.1-Lizenz. Statt eines klassischen Transformers setzt NVIDIA auf eine hybride Architektur aus Mamba-2-, Mixture-of-Experts- und einzelnen Attention-Layern. Von den 30 Mrd. Parametern sind pro Token nur 3 Mrd. aktiv. Der Fokus liegt klar auf Geschwindigkeit: Das Modell wird mit gleich drei Speculative-Decoding-Verfahren (DSpark, DFlash, MTP) ausgeliefert und erreicht auf einem NVIDIA DGX Spark laut NVIDIA rund 117 Token/s. NVIDIA positioniert Lightning als schnellen Worker für KI-Agenten, RAG und Tool-Use. In Reasoning-Benchmarks liegt es mit 81,6 % in MMLU Pro und 75,6 % in GPQA Diamond für seine Größe gut im Rennen, beim agentischen Coding fällt es mit 52,8 % in SWE-bench Verified aber deutlich hinter die Flaggschiffe zurück. Damit konkurriert es direkt mit anderen lokal lauffähigen 30B-Modellen wie Muse Glimmer 30B oder Gemma 4 31B, verzichtet im Gegensatz zu diesen aber auf jegliche Multimodalität.

Features & Modalitäten

Nicht verfügbar
MultimodalitätWebsucheQuellenangaben
Verfügbar
ReasoningToolsStrukturierte AusgabenFinetuning
Input:Text
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
262,14k Token
Max. Output
131,07k Token
Input-Preis / 1M Token
0,08 $
Output-Preis / 1M Token
0,20 $
Parameter
30 Mrd.
Trainingsdaten
20.000 Mrd.

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0003 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Nemotron 3.5 Lightning 30B Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturHybrid Mamba-2 / MoE-Transformer
Input Kontextlänge262,14k
Output Kontextlänge131,07k
TokenizerUnbekannt

Besonderheiten

Speculative Decoding (DSpark, DFlash, MTP)Drei mitgelieferte Verfahren beschleunigen die Token-Generierung.
Hybrid Mamba-2 + MoEState-Space-Layer statt reiner Attention.
Toggelbares ReasoningThinking-Modus lässt sich pro Request an- und abschalten.

Vorteile & Nachteile

Vorteile

  • Sehr hohe Token-Geschwindigkeit
    Nur 3 von 30 Mrd. Parametern sind pro Token aktiv, dazu kommen drei Speculative-Decoding-Verfahren. Auf einem NVIDIA DGX Spark erreicht die NVFP4-Variante laut NVIDIA rund 117 Token/s.
  • Open Weights inkl. kommerzieller Nutzung
    Die Gewichte stehen unter der OpenMDW-1.1-Lizenz auf Hugging Face bereit (BF16 und NVFP4), inklusive kommerzieller Nutzung, Fine-Tuning und Self-Hosting.
  • Sehr großes Kontextfenster für die Größenklasse
    Nativ bis zu 1 Mio. Token, praktisch nutzbar sind je nach Hardware rund 256K Token. Das ist deutlich mehr als bei den meisten Modellen mit 30 Mrd. Parametern.
  • Solide Reasoning-Werte
    81,6 % in MMLU Pro und 75,6 % in GPQA Diamond sind für ein Modell mit nur 3 Mrd. aktiven Parametern konkurrenzfähig.

Nachteile

  • Nur Text, keine Multimodalität
    Das Modell verarbeitet ausschließlich Text. Bild-, Audio- oder Videoeingaben, wie sie Muse Glimmer 30B oder Gemma 4 31B bieten, fehlen.
  • Schwächer im Agentic Coding
    Mit 52,8 % in SWE-bench Verified liegt Lightning deutlich hinter größeren Modellen. Für anspruchsvolle Coding-Agenten ist es eher zweite Wahl.
  • Kein offizieller API-Preis
    NVIDIA bietet das Modell über build.nvidia.com kostenlos an, nennt aber keinen Per-Token-Tarif. Wer nicht selbst hostet, ist auf Drittanbieter wie OpenRouter (ca. $0,08 / $0,20 pro 1 Mio. Input-/Output-Token) angewiesen.

Vergleiche Nemotron 3.5 Lightning 30B mit anderen LLMs

Vergleiche Nemotron 3.5 Lightning 30B mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Nemotron 3.5 Lightning 30B ausprobieren

Nemotron 3.5 Lightning 30B hat offene Gewichte: Du kannst das Modell herunterladen und selbst hosten — oder es bei einem der API-Provider unten nutzen.

Lizenz
Open Model License
Selbst hosten
Möglich

Provider & APIs

Du kannst NVIDIA Nemotron 3.5 Lightning 30B über die API folgender Anbieter nutzen.




Häufige Fragen zu Nemotron 3.5 Lightning 30B

Ist Nemotron 3.5 Lightning 30B Open Source?

Nemotron 3.5 Lightning 30B wird unter der Lizenz „Open Model License“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht Nemotron 3.5 Lightning 30B?

Nemotron 3.5 Lightning 30B verarbeitet folgende Eingabeformate: Text.

Was kostet Nemotron 3.5 Lightning 30B über die API?

Über die API kostet Nemotron 3.5 Lightning 30B 0,08 $ pro 1 Mio. Input-Token und 0,20 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Nemotron 3.5 Lightning 30B?

Nemotron 3.5 Lightning 30B verarbeitet bis zu 262,14k Token in einer Anfrage.

Was ist der Vorgänger von Nemotron 3.5 Lightning 30B?

Der direkte Vorgänger von Nemotron 3.5 Lightning 30B ist Nemotron 3 Super (erschienen März 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.