Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

DeepSeek V4 Flash

Veröffentlichung
April 2026
Kontextfenster
1 Mio. Token
API-Preis In / Out
0,14 $ / 0,28 $
Parameter
284 Mrd.
Daten aktualisiert: 3. August 2026

DeepSeek V4 Flash Modell-Übersicht

DeepSeek V4 Flash ist die effizienzoptimierte Variante der V4-Serie des chinesischen Labors DeepSeek, seit dem 23. April 2026 als Open-Weights-Modell unter MIT-Lizenz verfügbar. Als Mixture-of-Experts-Modell (MoE) aktiviert es pro Token nur 13 von 284 Mrd. Parametern und nutzt eine hybride Attention aus Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA), um ein Kontextfenster von 1 Mio. Token effizient zu bedienen. Mit $0,14 / $0,28 pro 1 Mio. Input-/Output-Token positioniert DeepSeek es als günstigen Allrounder – rund dreimal billiger als das große Schwestermodell V4 Pro (1,6 Bio. Parameter, $0,435 / $0,87). Anders als der Gateway-Eintrag mit den Tags "vision" und "file-input" suggeriert, verarbeitet das Modell zum Start ausschließlich Text und Code; nativen Bild- oder Vision-Input bietet es offiziell nicht. Reasoning ist über drei Modi abrufbar (non-think, think high, think max).

Features & Modalitäten

Nicht verfügbar
MultimodalitätWebsucheQuellenangaben
Verfügbar
ReasoningToolsStrukturierte AusgabenFinetuning
Input:Text
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
384k Token
Input-Preis / 1M Token
0,14 $
Output-Preis / 1M Token
0,28 $
Parameter
284 Mrd.
Dateigröße
155,43 GB
Vokabular
129,28k
Trainingsdaten
32.000 Mrd.

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0004 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

DeepSeek V4 Flash Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturSparse MoE mit 256 Routed Experts, von denen pro Token 6 aktiv sind (13 Mrd. von 284 Mrd. Parametern aktiv), bei 43 Layern. Die hybride Attention kombiniert Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA) für effizientes…
Input Kontextlänge1 Mio.
Output Kontextlänge384k
TokenizerByte-Pair-Encoding-Tokenizer mit einem Vokabular von 129.280 Token.

Besonderheiten

Hybrid Attention (CSA + HCA)Kombiniert Compressed Sparse Attention und Heavily Compressed Attention, um lange Kontexte effizient zu verarbeiten.
Drei Reasoning-Modinon-think für schnelle Antworten, think high für bewusste Analyse und think max für die volle Reasoning-Tiefe.
1M-Token-Kontext mit Context CachingVerarbeitet bis zu 1 Mio. Token pro Prompt; wiederkehrender Kontext wird über Context Caching automatisch gecacht.
Open Weights & Agent-IntegrationVollständig offene Gewichte unter MIT-Lizenz; OpenAI-ChatCompletions- und Anthropic-kompatible API mit Tool-Calls.

Vorteile & Nachteile

Vorteile

  • Sehr günstiger Preis bei riesigem Kontext
    Mit $0,14 / $0,28 pro 1 Mio. Input-/Output-Token und 1 Mio. Token Kontext ist Flash rund dreimal billiger als V4 Pro ($0,435 / $0,87). Cache-Hits drücken den Input über Context Caching auf $0,0028 pro 1 Mio. Token.
  • Hohe Inferenz-Effizienz durch Hybrid-Attention
    Die Kombination aus CSA und HCA senkt laut DeepSeek bei 1 Mio. Token den Rechenaufwand auf rund 10 % der Single-Token-FLOPs und 7 % des KV-Cache gegenüber V3.2 – das macht lange Kontexte bezahlbar.
  • Open Weights unter MIT-Lizenz
    Die Gewichte sind vollständig offen auf Hugging Face, kommerziell nutzbar und lokal deploybar (FP4+FP8). Fine-Tuning ist damit ohne Lizenzhürden möglich.
  • Effizient trotz weniger aktiver Parameter
    DeepSeek gibt an, dass V4 Flash-Base den Vorgänger V3.2-Base übertrifft, obwohl pro Token nur 13 Mrd. statt rund dreimal so viele Parameter aktiv sind.

Nachteile

  • Keine Vision oder Multimodalität
    Trotz der Gateway-Tags "vision" und "file-input" verarbeitet V4 Flash zum Start offiziell nur Text und Code. Für Bild-, Video- oder Audio-Input brauchst du ein anderes Modell.
  • Schwächer als V4 Pro
    Als Effizienzvariante mit 13 Mrd. aktiven Parametern liegt Flash bei anspruchsvollen Coding- und Reasoning-Aufgaben unter dem 1,6-Bio.-Modell V4 Pro (49 Mrd. aktiv); ausführliche Benchmarks veröffentlichte DeepSeek vor allem für Pro.
  • Hoher Hardware-Bedarf beim Self-Hosting
    Die 284 Mrd. Gesamtparameter erfordern trotz MoE-Sparsity Datacenter-GPUs oder Multi-GPU-Setups; ein lokaler Betrieb auf einzelner Consumer-Hardware ist nicht realistisch.
  • China-Hosting und intransparente Eckdaten
    Die offizielle API läuft über DeepSeek in China – für sensible Daten ist Self-Hosting der offenen Gewichte nötig. Knowledge Cutoff und Flash-spezifische Benchmarks hat DeepSeek nicht veröffentlicht.

Vergleiche DeepSeek V4 Flash mit anderen LLMs

Vergleiche DeepSeek V4 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

DeepSeek V4 Flash ausprobieren

Du musst kein Entwickler sein: DeepSeek V4 Flash ist auch direkt in DeepSeek AI nutzbar.

App
DeepSeek AI
Kostenlose Nutzung
Ja

Provider & APIs

Du kannst DeepSeek AI DeepSeek V4 Flash über die API folgender Anbieter nutzen.




Häufige Fragen zu DeepSeek V4 Flash

Kann ich DeepSeek V4 Flash kostenlos nutzen?

Ja, DeepSeek V4 Flash ist in DeepSeek AI auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist DeepSeek V4 Flash Open Source?

DeepSeek V4 Flash wird unter der Lizenz „MIT“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht DeepSeek V4 Flash?

DeepSeek V4 Flash verarbeitet folgende Eingabeformate: Text.

Was kostet DeepSeek V4 Flash über die API?

Über die API kostet DeepSeek V4 Flash 0,14 $ pro 1 Mio. Input-Token und 0,28 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von DeepSeek V4 Flash?

DeepSeek V4 Flash verarbeitet bis zu 1 Mio. Token in einer Anfrage.

Was ist der Vorgänger von DeepSeek V4 Flash?

Der direkte Vorgänger von DeepSeek V4 Flash ist DeepSeek-v3.2 Speciale (erschienen Dezember 2025). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.