Nemotron 3.5 Lightning 30B
Nemotron 3.5 Lightning 30B Modell-Übersicht
Nemotron 3.5 Lightning 30B ist ein kompaktes Open Weights Modell von NVIDIA aus der neuen Nemotron-3.5-Generation, veröffentlicht am 11. August 2026 unter der OpenMDW-1.1-Lizenz. Statt eines klassischen Transformers setzt NVIDIA auf eine hybride Architektur aus Mamba-2-, Mixture-of-Experts- und einzelnen Attention-Layern. Von den 30 Mrd. Parametern sind pro Token nur 3 Mrd. aktiv. Der Fokus liegt klar auf Geschwindigkeit: Das Modell wird mit gleich drei Speculative-Decoding-Verfahren (DSpark, DFlash, MTP) ausgeliefert und erreicht auf einem NVIDIA DGX Spark laut NVIDIA rund 117 Token/s. NVIDIA positioniert Lightning als schnellen Worker für KI-Agenten, RAG und Tool-Use. In Reasoning-Benchmarks liegt es mit 81,6 % in MMLU Pro und 75,6 % in GPQA Diamond für seine Größe gut im Rennen, beim agentischen Coding fällt es mit 52,8 % in SWE-bench Verified aber deutlich hinter die Flaggschiffe zurück. Damit konkurriert es direkt mit anderen lokal lauffähigen 30B-Modellen wie Muse Glimmer 30B oder Gemma 4 31B, verzichtet im Gegensatz zu diesen aber auf jegliche Multimodalität.
Features & Modalitäten
Nemotron 3.5 Lightning 30B Benchmark Scores
Technologie & Daten
Technische Spezifikationen
| Architektur | Hybrid Mamba-2 / MoE-Transformer |
|---|---|
| Input Kontextlänge | 262,14k |
| Output Kontextlänge | 131,07k |
| Tokenizer | Unbekannt |
Besonderheiten
| Speculative Decoding (DSpark, DFlash, MTP) | Drei mitgelieferte Verfahren beschleunigen die Token-Generierung. |
|---|---|
| Hybrid Mamba-2 + MoE | State-Space-Layer statt reiner Attention. |
| Toggelbares Reasoning | Thinking-Modus lässt sich pro Request an- und abschalten. |
Vorteile & Nachteile
Vorteile
- Sehr hohe Token-GeschwindigkeitNur 3 von 30 Mrd. Parametern sind pro Token aktiv, dazu kommen drei Speculative-Decoding-Verfahren. Auf einem NVIDIA DGX Spark erreicht die NVFP4-Variante laut NVIDIA rund 117 Token/s.
- Open Weights inkl. kommerzieller NutzungDie Gewichte stehen unter der OpenMDW-1.1-Lizenz auf Hugging Face bereit (BF16 und NVFP4), inklusive kommerzieller Nutzung, Fine-Tuning und Self-Hosting.
- Sehr großes Kontextfenster für die GrößenklasseNativ bis zu 1 Mio. Token, praktisch nutzbar sind je nach Hardware rund 256K Token. Das ist deutlich mehr als bei den meisten Modellen mit 30 Mrd. Parametern.
- Solide Reasoning-Werte81,6 % in MMLU Pro und 75,6 % in GPQA Diamond sind für ein Modell mit nur 3 Mrd. aktiven Parametern konkurrenzfähig.
Nachteile
- Nur Text, keine MultimodalitätDas Modell verarbeitet ausschließlich Text. Bild-, Audio- oder Videoeingaben, wie sie Muse Glimmer 30B oder Gemma 4 31B bieten, fehlen.
- Schwächer im Agentic CodingMit 52,8 % in SWE-bench Verified liegt Lightning deutlich hinter größeren Modellen. Für anspruchsvolle Coding-Agenten ist es eher zweite Wahl.
- Kein offizieller API-PreisNVIDIA bietet das Modell über build.nvidia.com kostenlos an, nennt aber keinen Per-Token-Tarif. Wer nicht selbst hostet, ist auf Drittanbieter wie OpenRouter (ca. $0,08 / $0,20 pro 1 Mio. Input-/Output-Token) angewiesen.
Vergleiche Nemotron 3.5 Lightning 30B mit anderen LLMs
Vergleiche Nemotron 3.5 Lightning 30B mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.
Nemotron 3.5 Lightning 30B ausprobieren
Nemotron 3.5 Lightning 30B hat offene Gewichte: Du kannst das Modell herunterladen und selbst hosten — oder es bei einem der API-Provider unten nutzen.
Provider & APIs
Du kannst NVIDIA Nemotron 3.5 Lightning 30B über die API folgender Anbieter nutzen.
Häufige Fragen zu Nemotron 3.5 Lightning 30B
Ist Nemotron 3.5 Lightning 30B Open Source?
Nemotron 3.5 Lightning 30B wird unter der Lizenz „Open Model License“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.
Welche Eingabeformate versteht Nemotron 3.5 Lightning 30B?
Nemotron 3.5 Lightning 30B verarbeitet folgende Eingabeformate: Text.
Was kostet Nemotron 3.5 Lightning 30B über die API?
Über die API kostet Nemotron 3.5 Lightning 30B 0,08 $ pro 1 Mio. Input-Token und 0,20 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.
Wie groß ist das Kontextfenster von Nemotron 3.5 Lightning 30B?
Nemotron 3.5 Lightning 30B verarbeitet bis zu 262,14k Token in einer Anfrage.
Was ist der Vorgänger von Nemotron 3.5 Lightning 30B?
Der direkte Vorgänger von Nemotron 3.5 Lightning 30B ist Nemotron 3 Super (erschienen März 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.