DeepSeek V4 Flash
DeepSeek V4 Flash Modell-Übersicht
DeepSeek V4 Flash ist die effizienzoptimierte Variante der V4-Serie des chinesischen Labors DeepSeek, seit dem 23. April 2026 als Open-Weights-Modell unter MIT-Lizenz verfügbar. Als Mixture-of-Experts-Modell (MoE) aktiviert es pro Token nur 13 von 284 Mrd. Parametern und nutzt eine hybride Attention aus Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA), um ein Kontextfenster von 1 Mio. Token effizient zu bedienen. Mit $0,14 / $0,28 pro 1 Mio. Input-/Output-Token positioniert DeepSeek es als günstigen Allrounder – rund dreimal billiger als das große Schwestermodell V4 Pro (1,6 Bio. Parameter, $0,435 / $0,87). Anders als der Gateway-Eintrag mit den Tags "vision" und "file-input" suggeriert, verarbeitet das Modell zum Start ausschließlich Text und Code; nativen Bild- oder Vision-Input bietet es offiziell nicht. Reasoning ist über drei Modi abrufbar (non-think, think high, think max).
Features & Modalitäten
DeepSeek V4 Flash Benchmark Scores
Technologie & Daten
Technische Spezifikationen
| Architektur | Sparse MoE mit 256 Routed Experts, von denen pro Token 6 aktiv sind (13 Mrd. von 284 Mrd. Parametern aktiv), bei 43 Layern. Die hybride Attention kombiniert Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA) für effizientes… |
|---|---|
| Input Kontextlänge | 1 Mio. |
| Output Kontextlänge | 384k |
| Tokenizer | Byte-Pair-Encoding-Tokenizer mit einem Vokabular von 129.280 Token. |
Besonderheiten
| Hybrid Attention (CSA + HCA) | Kombiniert Compressed Sparse Attention und Heavily Compressed Attention, um lange Kontexte effizient zu verarbeiten. |
|---|---|
| Drei Reasoning-Modi | non-think für schnelle Antworten, think high für bewusste Analyse und think max für die volle Reasoning-Tiefe. |
| 1M-Token-Kontext mit Context Caching | Verarbeitet bis zu 1 Mio. Token pro Prompt; wiederkehrender Kontext wird über Context Caching automatisch gecacht. |
| Open Weights & Agent-Integration | Vollständig offene Gewichte unter MIT-Lizenz; OpenAI-ChatCompletions- und Anthropic-kompatible API mit Tool-Calls. |
Vorteile & Nachteile
Vorteile
- Sehr günstiger Preis bei riesigem KontextMit $0,14 / $0,28 pro 1 Mio. Input-/Output-Token und 1 Mio. Token Kontext ist Flash rund dreimal billiger als V4 Pro ($0,435 / $0,87). Cache-Hits drücken den Input über Context Caching auf $0,0028 pro 1 Mio. Token.
- Hohe Inferenz-Effizienz durch Hybrid-AttentionDie Kombination aus CSA und HCA senkt laut DeepSeek bei 1 Mio. Token den Rechenaufwand auf rund 10 % der Single-Token-FLOPs und 7 % des KV-Cache gegenüber V3.2 – das macht lange Kontexte bezahlbar.
- Open Weights unter MIT-LizenzDie Gewichte sind vollständig offen auf Hugging Face, kommerziell nutzbar und lokal deploybar (FP4+FP8). Fine-Tuning ist damit ohne Lizenzhürden möglich.
- Effizient trotz weniger aktiver ParameterDeepSeek gibt an, dass V4 Flash-Base den Vorgänger V3.2-Base übertrifft, obwohl pro Token nur 13 Mrd. statt rund dreimal so viele Parameter aktiv sind.
Nachteile
- Keine Vision oder MultimodalitätTrotz der Gateway-Tags "vision" und "file-input" verarbeitet V4 Flash zum Start offiziell nur Text und Code. Für Bild-, Video- oder Audio-Input brauchst du ein anderes Modell.
- Schwächer als V4 ProAls Effizienzvariante mit 13 Mrd. aktiven Parametern liegt Flash bei anspruchsvollen Coding- und Reasoning-Aufgaben unter dem 1,6-Bio.-Modell V4 Pro (49 Mrd. aktiv); ausführliche Benchmarks veröffentlichte DeepSeek vor allem für Pro.
- Hoher Hardware-Bedarf beim Self-HostingDie 284 Mrd. Gesamtparameter erfordern trotz MoE-Sparsity Datacenter-GPUs oder Multi-GPU-Setups; ein lokaler Betrieb auf einzelner Consumer-Hardware ist nicht realistisch.
- China-Hosting und intransparente EckdatenDie offizielle API läuft über DeepSeek in China – für sensible Daten ist Self-Hosting der offenen Gewichte nötig. Knowledge Cutoff und Flash-spezifische Benchmarks hat DeepSeek nicht veröffentlicht.
Vergleiche DeepSeek V4 Flash mit anderen LLMs
Vergleiche DeepSeek V4 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.
DeepSeek V4 Flash ausprobieren
Du musst kein Entwickler sein: DeepSeek V4 Flash ist auch direkt in DeepSeek AI nutzbar.
Provider & APIs
Du kannst DeepSeek AI DeepSeek V4 Flash über die API folgender Anbieter nutzen.
Häufige Fragen zu DeepSeek V4 Flash
Kann ich DeepSeek V4 Flash kostenlos nutzen?
Ja, DeepSeek V4 Flash ist in DeepSeek AI auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.
Ist DeepSeek V4 Flash Open Source?
DeepSeek V4 Flash wird unter der Lizenz „MIT“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.
Welche Eingabeformate versteht DeepSeek V4 Flash?
DeepSeek V4 Flash verarbeitet folgende Eingabeformate: Text.
Was kostet DeepSeek V4 Flash über die API?
Über die API kostet DeepSeek V4 Flash 0,14 $ pro 1 Mio. Input-Token und 0,28 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.
Wie groß ist das Kontextfenster von DeepSeek V4 Flash?
DeepSeek V4 Flash verarbeitet bis zu 1 Mio. Token in einer Anfrage.
Was ist der Vorgänger von DeepSeek V4 Flash?
Der direkte Vorgänger von DeepSeek V4 Flash ist DeepSeek-v3.2 Speciale (erschienen Dezember 2025). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.