Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

DeepSeek V4.1 Flash

Veröffentlichung
September 2026Neu
Kontextfenster
1 Mio. Token
API-Preis In / Out
0,15 $ / 0,60 $
Parameter
552 Mrd.
Daten aktualisiert: 25. September 2026

DeepSeek V4.1 Flash Modell-Übersicht

DeepSeek V4.1 Flash ist das neue kompakte Modell von DeepSeek und der Nachfolger von DeepSeek V4 Flash 0731, veröffentlicht am 10. September 2026 als Open Weights Modell unter MIT-Lizenz. Neu ist vor allem die Architektur: Statt eines klassischen Decoder-only-Transformers nutzt V4.1 Flash als erstes DeepSeek-Modell einen Causal Encoder-Decoder (CED). Von den 552 Mrd. Parametern sind beim Einlesen nur 8 Mrd., beim Generieren 16 Mrd. aktiv, und der KV-Cache schrumpft auf ein Viertel von V4 Flash. Dazu kommt native Bildverarbeitung über einen gemeinsam mit dem Sprachmodell trainierten Vision-Encoder. In Terminal-Bench 2.1 steigt der Wert laut DeepSeek von 82,7 % auf 90,6 %. Mit $0,15 / $0,60 pro 1 Mio. Input-/Output-Token (Off-Peak) bleibt das Modell sehr günstig, zu Peak-Zeiten verdoppeln sich die Preise allerdings. Nach unserer Einschätzung macht die CED-Architektur V4.1 Flash besonders für input-lastige KI-Agenten mit langen Kontexten interessant. Die Benchmark-Werte stammen bislang aber ausschließlich aus DeepSeeks eigenem Technical Report.

Features & Modalitäten

Nicht verfügbar
WebsucheQuellenangabenFinetuning
Verfügbar
ReasoningToolsMultimodalitätStrukturierte Ausgaben
Input:TextBild
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
384k Token
Input-Preis / 1M Token
0,15 $
Output-Preis / 1M Token
0,60 $
Parameter
552 Mrd.
Trainingsdaten
45.000 Mrd.

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0009 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

DeepSeek V4.1 Flash Benchmark Scores

‌
‌

Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturCausal Encoder-Decoder (Sparse MoE)
Input Kontextlänge1 Mio.
Output Kontextlänge384k
TokenizerUnbekannt

Besonderheiten

Causal Encoder-Decoder (CED)Trennt Einlesen und Generieren: 8 Mrd. aktive Parameter beim Prefill, 16 Mrd. beim Decode.
Komprimierter KV-CacheFP4-KV-Cache und Cross-Layer-Attention-Reuse für effizienten Langkontext.
Reasoning-Effort von 1 bis 100Die Reasoning-Tiefe lässt sich stufenlos als Ganzzahl einstellen.

Vorteile & Nachteile

Vorteile

  • Sehr günstiges Pricing
    Mit $0,15 / $0,60 pro 1 Mio. Input-/Output-Token (Off-Peak) gehört V4.1 Flash zu den günstigsten multimodalen Modellen. Cache-Hits kosten sogar nur $0,003 pro 1 Mio. Input-Token.
  • Effiziente CED-Architektur
    Nur 8 Mrd. aktive Parameter beim Einlesen und ein auf ein Viertel geschrumpfter KV-Cache machen input-lastige Agenten- und Langkontext-Workloads spürbar billiger.
  • Starke Benchmarks für die Größe
    Laut DeepSeek erreicht V4.1 Flash 90,6 % in Terminal-Bench 2.1 (V4 Flash 0731: 82,7 %), 90,9 % in GPQA Diamond und 100 % in AIME 2026.
  • Open Weights unter MIT-Lizenz
    Die Gewichte stehen auf Hugging Face bereit und lassen sich ohne Einschränkungen kommerziell nutzen, finetunen und selbst hosten.

Nachteile

  • Peak-Preise verdoppeln die Kosten
    Werktags zwischen 01:00–04:00 und 06:00–10:00 UTC steigen die Preise auf $0,30 / $1,20 pro 1 Mio. Token. Das erschwert die Kostenplanung.
  • Benchmark Scores noch unbelegt
    Alle genannten Werte stammen aus DeepSeeks eigenem Technical Report. Unabhängige Vergleiche für die neue Architektur stehen noch aus.
  • Hoher Hardware-Bedarf beim Self-Hosting
    Trotz sparsamer Aktivierung müssen alle 552 Mrd. Parameter im Speicher liegen. Lokales Deployment ist damit nur auf Multi-GPU-Hardware realistisch.
  • China-Hosting
    Die offizielle API läuft über DeepSeek in China. Für DSGVO-sensible Daten bleibt nur das Self-Hosting der offenen Gewichte.

Vergleiche DeepSeek V4.1 Flash mit anderen LLMs

Vergleiche DeepSeek V4.1 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.

‌
Alle Modelle vergleichen

DeepSeek V4.1 Flash ausprobieren

Du musst kein Entwickler sein: DeepSeek V4.1 Flash ist auch direkt in DeepSeek AI nutzbar.

App
DeepSeek AI
Kostenlose Nutzung
Ja

Provider & APIs

Du kannst DeepSeek AI DeepSeek V4.1 Flash über die API folgender Anbieter nutzen.

‌
‌
‌

Häufige Fragen zu DeepSeek V4.1 Flash

Kann ich DeepSeek V4.1 Flash kostenlos nutzen?

Ja, DeepSeek V4.1 Flash ist in DeepSeek AI auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist DeepSeek V4.1 Flash Open Source?

DeepSeek V4.1 Flash wird unter der Lizenz „MIT“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash verarbeitet folgende Eingabeformate: Text, Bild.

Was kostet DeepSeek V4.1 Flash über die API?

Über die API kostet DeepSeek V4.1 Flash 0,15 $ pro 1 Mio. Input-Token und 0,60 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von DeepSeek V4.1 Flash?

DeepSeek V4.1 Flash verarbeitet bis zu 1 Mio. Token in einer Anfrage.

Was ist der Vorgänger von DeepSeek V4.1 Flash?

Der direkte Vorgänger von DeepSeek V4.1 Flash ist DeepSeek V4 Flash (erschienen Juli 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.