Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

DeepSeek V4 Flash

Veröffentlichung
Juli 2026
Knowledge Cutoff
Unbekannt
Parameter
284 Mrd.
Modellfamilie
DeepSeek V4 Flash
MIT

DeepSeek V4 Flash Modell-Übersicht

DeepSeek V4 Flash 0731 ist eine neue Version von DeepSeek V4-Flash, die die Preview-Version aus April 2026 ablöst. Laut Entwickler blieben Architektur und Größe unverändert (Mixture-of-Experts mit 284 Mrd. Parametern, davon ~13 Mrd. aktiv pro Token), über erneutes Post-Training, wurde allerdings ein riesiger Sprung in Benchmark-Scores, v.a. für Agentic- und Coding-Tasks erreicht. Das Modell lässt sich also in guter Geschwindigkeit bereits auf zwei NVIDIA Spark DGX ausführen, einem Setup, das man sich theoretisch Zuhause gut einrichten könnte. In Terminal-Bench 2.1 erreicht das Modell 82,7 % und liegt damit über GLM-5.2 (81,0 %) und nahe an Claude Opus 4.8 (85,0 %). Der große Sprung ließ viele Leute aus der AI Community spekulieren, dass es sich um "Benchmark-Maxxing" handeln könnte, also das gezielte Training auf Aufgaben aus den Benchmarks. Bislang konnte sich das aber noch nicht bestätigen. Mit $0.14 / $0.28 pro 1 Mio. Input-/Output-Token und einem Kontextfenster von 1 Mio. Token positioniert sich das Modell als günstige API-Alternative zum großen Bruder, DeepSeek-V4 Pro. Damit unterbietet das Modell sogar das vergleichbare GPT-5.6 Luna (max), dessen Preis OpenAI einen Tag vor Veröffentlichung von V4-Flash noch um 80% reduziert hatte.

Features

Tools

Websuche, Bildgenerierung, Computer Use und MCP-Server.

Multimodalität

Das Modell kann Text, Bilder, Audio und PDFs als Input verarbeiten.

Finetuning

Finetuning des Modells ist aktuell nicht möglich.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
384k Token
Trainingsdaten
Unbekannt
Parameter
284 Mrd.
Input Preis
0,14 $
Output Preis
0,28 $
Vokabular
129,28k
Dateigröße
155,43 GB

DeepSeek V4 Flash Benchmark Scores

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung – gemessen anhand standardisierter Benchmarks zur objektiven Vergleichbarkeit.



Technologie & Daten

Technische Spezifikationen

ArchitekturSparse MoE-Transformer
Input Kontextlänge1 Mio.
Output Kontextlänge384k
TokenizerUnbekannt

Besonderheiten

Responses API & Codex-KompatibilitätNativ OpenAI-Responses-API-Format plus /anthropic-Endpoint

Vorteile & Nachteile

Vorteile

  • Sehr günstiges Pricing
    Mit $0.14 / $0.28 pro 1 Mio. Input-/Output-Token unterbietet das Modell vergleichbar intelligente LLMs deutlich! Über die API kosten Cache-Hits sogar nur $0,0028 und das Modell lässt sich sogar mit Token-Geschwindigkeiten von bis zu 75 Tokens/s auf 2 NVIDIA Spark DGX Geräten ausführen.
  • Starke Agentic- und Coding-Leistung
    Trotz der kleinen Größe erreicht DeepSeek V4-Flash ca. 82,7 % in Terminal-Bench 2.1 und liegt damit über dem großen GLM-5.2 (81,0 %) und nahe an Claude Opus 4.8 (85,0 %). Der Sprung ist so groß, dass Benchmark Maxxing, zumindest in Teilen, vermutet werden kann.
  • Großes Kontextfenster
    Bis zu 1 Mio. Token Input und bis zu 384K Token Output erlauben lange Loops und Tool-lastige Aufgaben ohne Kontext-Splitting oder Compaction.
  • Effiziente MoE-Architektur
    Von den ~284 Mrd. Parametern sind pro Token-Generierung nur ~13 Mrd. aktiv, was die lokale Ausführung auf eigener Hardware ermöglicht.
  • Open Weights Modell
    DeepSeek veröffentlicht die Gewichte frei unter einer MIT-Lizenz auf Hugging Face, sodass sich das Modell lokal und kommerziell nutzen lässt.

Nachteile

  • Nur Text, keine Multimodalität
    Das Modell verarbeitet ausschließlich Text – für Bild-, Audio- oder Video-Eingaben ist es nicht ausgelegt.
  • Benchmark-Maxxing befürchtet
    Zum Zeitpunkt der Veröffentlichung des Modells wurden noch keine Benchmark-Ergebnisse von DeepSeek unabhängig bestätigt. Der Sprung von der Preview-Version ist so groß, dass sich erst noch herausstellen muss, ob das zusätzliche Post-Training zu diesem großen Intelligenz-Sprung führen konnte.
  • Geplantes Peak-Pricing
    DeepSeek hat ein dynamisches Preismodell angekündigt, das die Preise während der Stoßzeiten (zu Peking-Zeit) verdoppelt. Dies bezieht sich allerdings nur auf die DeepSeek API und nicht auf die anderer Inferenz-Anbieter.

Vergleiche DeepSeek V4 Flash mit anderen LLMs

Vergleiche DeepSeek V4 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Parameteranzahl, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Provider & APIs

Du kannst DeepSeek AI DeepSeek V4 Flash über die API folgender Anbieter nutzen.