DeepSeek V4 Flash
DeepSeek V4 Flash Modell-Übersicht
DeepSeek V4 Flash 0731 ist eine neue Version von DeepSeek V4-Flash, die die Preview-Version aus April 2026 ablöst. Laut Entwickler blieben Architektur und Größe unverändert (Mixture-of-Experts mit 284 Mrd. Parametern, davon ~13 Mrd. aktiv pro Token), über erneutes Post-Training, wurde allerdings ein riesiger Sprung in Benchmark-Scores, v.a. für Agentic- und Coding-Tasks erreicht. Das Modell lässt sich also in guter Geschwindigkeit bereits auf zwei NVIDIA Spark DGX ausführen, einem Setup, das man sich theoretisch Zuhause gut einrichten könnte. In Terminal-Bench 2.1 erreicht das Modell 82,7 % und liegt damit über GLM-5.2 (81,0 %) und nahe an Claude Opus 4.8 (85,0 %). Der große Sprung ließ viele Leute aus der AI Community spekulieren, dass es sich um "Benchmark-Maxxing" handeln könnte, also das gezielte Training auf Aufgaben aus den Benchmarks. Bislang konnte sich das aber noch nicht bestätigen. Mit $0.14 / $0.28 pro 1 Mio. Input-/Output-Token und einem Kontextfenster von 1 Mio. Token positioniert sich das Modell als günstige API-Alternative zum großen Bruder, DeepSeek-V4 Pro. Damit unterbietet das Modell sogar das vergleichbare GPT-5.6 Luna (max), dessen Preis OpenAI einen Tag vor Veröffentlichung von V4-Flash noch um 80% reduziert hatte.
Features
Tools
Websuche, Bildgenerierung, Computer Use und MCP-Server.
Multimodalität
Das Modell kann Text, Bilder, Audio und PDFs als Input verarbeiten.
Finetuning
Finetuning des Modells ist aktuell nicht möglich.
Details zum Modell
DeepSeek V4 Flash Benchmark Scores
Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung – gemessen anhand standardisierter Benchmarks zur objektiven Vergleichbarkeit.
Technologie & Daten
Technische Spezifikationen
| Architektur | Sparse MoE-Transformer |
|---|---|
| Input Kontextlänge | 1 Mio. |
| Output Kontextlänge | 384k |
| Tokenizer | Unbekannt |
Besonderheiten
| Responses API & Codex-Kompatibilität | Nativ OpenAI-Responses-API-Format plus /anthropic-Endpoint |
|---|
Vorteile & Nachteile
Vorteile
- Sehr günstiges PricingMit $0.14 / $0.28 pro 1 Mio. Input-/Output-Token unterbietet das Modell vergleichbar intelligente LLMs deutlich! Über die API kosten Cache-Hits sogar nur $0,0028 und das Modell lässt sich sogar mit Token-Geschwindigkeiten von bis zu 75 Tokens/s auf 2 NVIDIA Spark DGX Geräten ausführen.
- Starke Agentic- und Coding-LeistungTrotz der kleinen Größe erreicht DeepSeek V4-Flash ca. 82,7 % in Terminal-Bench 2.1 und liegt damit über dem großen GLM-5.2 (81,0 %) und nahe an Claude Opus 4.8 (85,0 %). Der Sprung ist so groß, dass Benchmark Maxxing, zumindest in Teilen, vermutet werden kann.
- Großes KontextfensterBis zu 1 Mio. Token Input und bis zu 384K Token Output erlauben lange Loops und Tool-lastige Aufgaben ohne Kontext-Splitting oder Compaction.
- Effiziente MoE-ArchitekturVon den ~284 Mrd. Parametern sind pro Token-Generierung nur ~13 Mrd. aktiv, was die lokale Ausführung auf eigener Hardware ermöglicht.
- Open Weights ModellDeepSeek veröffentlicht die Gewichte frei unter einer MIT-Lizenz auf Hugging Face, sodass sich das Modell lokal und kommerziell nutzen lässt.
Nachteile
- Nur Text, keine MultimodalitätDas Modell verarbeitet ausschließlich Text – für Bild-, Audio- oder Video-Eingaben ist es nicht ausgelegt.
- Benchmark-Maxxing befürchtetZum Zeitpunkt der Veröffentlichung des Modells wurden noch keine Benchmark-Ergebnisse von DeepSeek unabhängig bestätigt. Der Sprung von der Preview-Version ist so groß, dass sich erst noch herausstellen muss, ob das zusätzliche Post-Training zu diesem großen Intelligenz-Sprung führen konnte.
- Geplantes Peak-PricingDeepSeek hat ein dynamisches Preismodell angekündigt, das die Preise während der Stoßzeiten (zu Peking-Zeit) verdoppelt. Dies bezieht sich allerdings nur auf die DeepSeek API und nicht auf die anderer Inferenz-Anbieter.
Vergleiche DeepSeek V4 Flash mit anderen LLMs
Vergleiche DeepSeek V4 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Parameteranzahl, Preisen und Benchmark-Leistung.
Provider & APIs
Du kannst DeepSeek AI DeepSeek V4 Flash über die API folgender Anbieter nutzen.