Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

DeepSeek V4 Flash

Veröffentlichung
Juli 2026
Kontextfenster
1 Mio. Token
API-Preis In / Out
0,14 $ / 0,28 $
Parameter
284 Mrd.
Daten aktualisiert: 3. August 2026

DeepSeek V4 Flash 0731 Modell-Übersicht

DeepSeek V4 Flash 0731 ist eine neue Version von DeepSeek V4-Flash, die die Preview-Version aus April 2026 ablöst. Laut Entwickler blieben Architektur und Größe unverändert (Mixture-of-Experts mit 284 Mrd. Parametern, davon ~13 Mrd. aktiv pro Token), über erneutes Post-Training, wurde allerdings ein riesiger Sprung in Benchmark-Scores, v.a. für Agentic- und Coding-Tasks erreicht. Das Modell lässt sich also in guter Geschwindigkeit bereits auf zwei NVIDIA Spark DGX ausführen, einem Setup, das man sich theoretisch Zuhause gut einrichten könnte. In Terminal-Bench 2.1 erreicht das Modell 82,7 % und liegt damit über GLM-5.2 (81,0 %) und nahe an Claude Opus 4.8 (85,0 %). Der große Sprung ließ viele Leute aus der AI Community spekulieren, dass es sich um "Benchmark-Maxxing" handeln könnte, also das gezielte Training auf Aufgaben aus den Benchmarks. Bislang konnte sich das aber noch nicht bestätigen. Mit $0.14 / $0.28 pro 1 Mio. Input-/Output-Token und einem Kontextfenster von 1 Mio. Token positioniert sich das Modell als günstige API-Alternative zum großen Bruder, DeepSeek-V4 Pro. Damit unterbietet das Modell sogar das vergleichbare GPT-5.6 Luna (max), dessen Preis OpenAI einen Tag vor Veröffentlichung von V4-Flash noch um 80% reduziert hatte.

Features & Modalitäten

Nicht verfügbar
Multimodalität
Verfügbar
ReasoningToolsWebsucheStrukturierte AusgabenQuellenangabenFinetuning
Input:Text
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
384k Token
Input-Preis / 1M Token
0,14 $
Output-Preis / 1M Token
0,28 $
Parameter
284 Mrd.
Dateigröße
155,43 GB
Vokabular
129,28k

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0004 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

DeepSeek V4 Flash 0731 Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturSparse MoE-Transformer
Input Kontextlänge1 Mio.
Output Kontextlänge384k
TokenizerUnbekannt

Besonderheiten

Responses API & Codex-KompatibilitätNativ OpenAI-Responses-API-Format plus /anthropic-Endpoint

Vorteile & Nachteile

Vorteile

  • Sehr günstiges Pricing
    Mit $0.14 / $0.28 pro 1 Mio. Input-/Output-Token unterbietet das Modell vergleichbar intelligente LLMs deutlich! Über die API kosten Cache-Hits sogar nur $0,0028 und das Modell lässt sich sogar mit Token-Geschwindigkeiten von bis zu 75 Tokens/s auf 2 NVIDIA Spark DGX Geräten ausführen.
  • Starke Agentic- und Coding-Leistung
    Trotz der kleinen Größe erreicht DeepSeek V4-Flash ca. 82,7 % in Terminal-Bench 2.1 und liegt damit über dem großen GLM-5.2 (81,0 %) und nahe an Claude Opus 4.8 (85,0 %). Der Sprung ist so groß, dass Benchmark Maxxing, zumindest in Teilen, vermutet werden kann.
  • Großes Kontextfenster
    Bis zu 1 Mio. Token Input und bis zu 384K Token Output erlauben lange Loops und Tool-lastige Aufgaben ohne Kontext-Splitting oder Compaction.
  • Effiziente MoE-Architektur
    Von den ~284 Mrd. Parametern sind pro Token-Generierung nur ~13 Mrd. aktiv, was die lokale Ausführung auf eigener Hardware ermöglicht.
  • Open Weights Modell
    DeepSeek veröffentlicht die Gewichte frei unter einer MIT-Lizenz auf Hugging Face, sodass sich das Modell lokal und kommerziell nutzen lässt.

Nachteile

  • Nur Text, keine Multimodalität
    Das Modell verarbeitet ausschließlich Text – für Bild-, Audio- oder Video-Eingaben ist es nicht ausgelegt.
  • Benchmark-Maxxing befürchtet
    Zum Zeitpunkt der Veröffentlichung des Modells wurden noch keine Benchmark-Ergebnisse von DeepSeek unabhängig bestätigt. Der Sprung von der Preview-Version ist so groß, dass sich erst noch herausstellen muss, ob das zusätzliche Post-Training zu diesem großen Intelligenz-Sprung führen konnte.
  • Geplantes Peak-Pricing
    DeepSeek hat ein dynamisches Preismodell angekündigt, das die Preise während der Stoßzeiten (zu Peking-Zeit) verdoppelt. Dies bezieht sich allerdings nur auf die DeepSeek API und nicht auf die anderer Inferenz-Anbieter.

Vergleiche DeepSeek V4 Flash 0731 mit anderen LLMs

Vergleiche DeepSeek V4 Flash 0731 mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

DeepSeek V4 Flash 0731 ausprobieren

Du musst kein Entwickler sein: DeepSeek V4 Flash 0731 ist auch direkt in DeepSeek AI nutzbar.

App
DeepSeek AI
Kostenlose Nutzung
Ja

Provider & APIs

Du kannst DeepSeek AI DeepSeek V4 Flash 0731 über die API folgender Anbieter nutzen.




Häufige Fragen zu DeepSeek V4 Flash 0731

Kann ich DeepSeek V4 Flash 0731 kostenlos nutzen?

Ja, DeepSeek V4 Flash 0731 ist in DeepSeek AI auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist DeepSeek V4 Flash 0731 Open Source?

DeepSeek V4 Flash 0731 wird unter der Lizenz „MIT“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 verarbeitet folgende Eingabeformate: Text.

Was kostet DeepSeek V4 Flash 0731 über die API?

Über die API kostet DeepSeek V4 Flash 0731 0,14 $ pro 1 Mio. Input-Token und 0,28 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 verarbeitet bis zu 1 Mio. Token in einer Anfrage.

Was ist der Vorgänger von DeepSeek V4 Flash 0731?

Der direkte Vorgänger von DeepSeek V4 Flash 0731 ist DeepSeek-V4-Pro (erschienen April 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.