DeepSeek V4.1 Flash
DeepSeek V4.1 Flash Modell-Übersicht
DeepSeek V4.1 Flash ist das neue kompakte Modell von DeepSeek und der Nachfolger von DeepSeek V4 Flash 0731, veröffentlicht am 10. September 2026 als Open Weights Modell unter MIT-Lizenz. Neu ist vor allem die Architektur: Statt eines klassischen Decoder-only-Transformers nutzt V4.1 Flash als erstes DeepSeek-Modell einen Causal Encoder-Decoder (CED). Von den 552 Mrd. Parametern sind beim Einlesen nur 8 Mrd., beim Generieren 16 Mrd. aktiv, und der KV-Cache schrumpft auf ein Viertel von V4 Flash. Dazu kommt native Bildverarbeitung über einen gemeinsam mit dem Sprachmodell trainierten Vision-Encoder. In Terminal-Bench 2.1 steigt der Wert laut DeepSeek von 82,7 % auf 90,6 %. Mit $0,15 / $0,60 pro 1 Mio. Input-/Output-Token (Off-Peak) bleibt das Modell sehr günstig, zu Peak-Zeiten verdoppeln sich die Preise allerdings. Nach unserer Einschätzung macht die CED-Architektur V4.1 Flash besonders für input-lastige KI-Agenten mit langen Kontexten interessant. Die Benchmark-Werte stammen bislang aber ausschließlich aus DeepSeeks eigenem Technical Report.
Features & Modalitäten
DeepSeek V4.1 Flash Benchmark Scores
Technologie & Daten
Technische Spezifikationen
| Architektur | Causal Encoder-Decoder (Sparse MoE) |
|---|---|
| Input Kontextlänge | 1 Mio. |
| Output Kontextlänge | 384k |
| Tokenizer | Unbekannt |
Besonderheiten
| Causal Encoder-Decoder (CED) | Trennt Einlesen und Generieren: 8 Mrd. aktive Parameter beim Prefill, 16 Mrd. beim Decode. |
|---|---|
| Komprimierter KV-Cache | FP4-KV-Cache und Cross-Layer-Attention-Reuse für effizienten Langkontext. |
| Reasoning-Effort von 1 bis 100 | Die Reasoning-Tiefe lässt sich stufenlos als Ganzzahl einstellen. |
Vorteile & Nachteile
Vorteile
- Sehr günstiges PricingMit $0,15 / $0,60 pro 1 Mio. Input-/Output-Token (Off-Peak) gehört V4.1 Flash zu den günstigsten multimodalen Modellen. Cache-Hits kosten sogar nur $0,003 pro 1 Mio. Input-Token.
- Effiziente CED-ArchitekturNur 8 Mrd. aktive Parameter beim Einlesen und ein auf ein Viertel geschrumpfter KV-Cache machen input-lastige Agenten- und Langkontext-Workloads spürbar billiger.
- Starke Benchmarks für die GrößeLaut DeepSeek erreicht V4.1 Flash 90,6 % in Terminal-Bench 2.1 (V4 Flash 0731: 82,7 %), 90,9 % in GPQA Diamond und 100 % in AIME 2026.
- Open Weights unter MIT-LizenzDie Gewichte stehen auf Hugging Face bereit und lassen sich ohne Einschränkungen kommerziell nutzen, finetunen und selbst hosten.
Nachteile
- Peak-Preise verdoppeln die KostenWerktags zwischen 01:00–04:00 und 06:00–10:00 UTC steigen die Preise auf $0,30 / $1,20 pro 1 Mio. Token. Das erschwert die Kostenplanung.
- Benchmark Scores noch unbelegtAlle genannten Werte stammen aus DeepSeeks eigenem Technical Report. Unabhängige Vergleiche für die neue Architektur stehen noch aus.
- Hoher Hardware-Bedarf beim Self-HostingTrotz sparsamer Aktivierung müssen alle 552 Mrd. Parameter im Speicher liegen. Lokales Deployment ist damit nur auf Multi-GPU-Hardware realistisch.
- China-HostingDie offizielle API läuft über DeepSeek in China. Für DSGVO-sensible Daten bleibt nur das Self-Hosting der offenen Gewichte.
Vergleiche DeepSeek V4.1 Flash mit anderen LLMs
Vergleiche DeepSeek V4.1 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.
DeepSeek V4.1 Flash ausprobieren
Du musst kein Entwickler sein: DeepSeek V4.1 Flash ist auch direkt in DeepSeek AI nutzbar.
Provider & APIs
Du kannst DeepSeek AI DeepSeek V4.1 Flash über die API folgender Anbieter nutzen.
Häufige Fragen zu DeepSeek V4.1 Flash
Kann ich DeepSeek V4.1 Flash kostenlos nutzen?
Ja, DeepSeek V4.1 Flash ist in DeepSeek AI auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.
Ist DeepSeek V4.1 Flash Open Source?
DeepSeek V4.1 Flash wird unter der Lizenz „MIT“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.
Welche Eingabeformate versteht DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash verarbeitet folgende Eingabeformate: Text, Bild.
Was kostet DeepSeek V4.1 Flash über die API?
Über die API kostet DeepSeek V4.1 Flash 0,15 $ pro 1 Mio. Input-Token und 0,60 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.
Wie groß ist das Kontextfenster von DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash verarbeitet bis zu 1 Mio. Token in einer Anfrage.
Was ist der Vorgänger von DeepSeek V4.1 Flash?
Der direkte Vorgänger von DeepSeek V4.1 Flash ist DeepSeek V4 Flash (erschienen Juli 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.