Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Gemini 3.8 Flash

Veröffentlichung
September 2026Neu
Kontextfenster
1 Mio. Token
API-Preis In / Out
0,75 $ / 3,75 $
Daten aktualisiert: 3. September 2026

Gemini 3.8 Flash Modell-Übersicht

Gemini 3.8 Flash ist das neue "Arbeitspferd" der Gemini-Familie von Google DeepMind und laut Google bereits der vierte Flash-Release in unter vier Monaten. Ein neues Basismodell gibt es nicht: 3.8 Flash baut ausdrücklich auf Gemini 3.7 Flash auf und wurde vor allem für agentisches Coding und mehrstufiges Reasoning nachtrainiert. Im Software-Engineering-Benchmark DeepSWE v1.1 steigt der Score von 65,3 % auf 73,7 % und liegt damit nur knapp unter Claude Opus 5 (74,0 %), aber deutlich über Claude Sonnet 5 (53,8 %). Der Einführungspreis von $0,75 / $3,75 pro 1 Mio. Input-/Output-Token liegt bei der Hälfte von Gemini 3.6 Flash ($1,50 / $7,50), gilt allerdings nur bis Ende 2026. Dazu kommt ein spürbar höherer Token-Verbrauch: Die realen Kosten pro Aufgabe steigen laut übereinstimmenden Analysen um rund 40 % gegenüber 3.7 Flash. Für effizienz- und latenzkritische Workloads empfiehlt Google selbst, bei 3.7 Flash zu bleiben. Nach unserer Einschätzung ist 3.8 Flash damit in erster Linie ein Coding-Update für Agenten-Workflows und kein Grund für einen Wechsel bei einfachen, latenzkritischen Aufgaben.

Features & Modalitäten

Nicht verfügbar
Finetuning
Verfügbar
ReasoningToolsMultimodalitätWebsucheStrukturierte AusgabenQuellenangaben
Input:TextBildAudioVideo
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
65,54k Token
Input-Preis / 1M Token
0,75 $
Output-Preis / 1M Token
3,75 $

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0053 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Gemini 3.8 Flash Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturMultimodale MoE-Architektur
Input Kontextlänge1 Mio.
Output Kontextlänge65,54k
TokenizerSentencePiece-basierter Tokenizer

Besonderheiten

Grounding mit Google SearchIntegriert die offizielle Google Web-Suche, 5.000 Anfragen pro Monat kostenlos.
Computer UseSteuerung von Browser- und Desktop-Oberflächen für agentische Workflows.
Effort-LevelReasoning-Tiefe pro Anfrage in den Stufen low, medium und high wählbar.

Vorteile & Nachteile

Vorteile

  • Starkes agentisches Coding
    73,7 % in DeepSWE v1.1 gegenüber 65,3 % bei 3.7 Flash. Damit liegt das Flash-Modell nahezu gleichauf mit Claude Opus 5 (74,0 %) und klar vor Claude Sonnet 5 (53,8 %).
  • Günstiger Einführungspreis
    Mit $0,75 / $3,75 pro 1 Mio. Input-/Output-Token kostet 3.8 Flash bis Ende 2026 nur die Hälfte von Gemini 3.6 Flash und einen Bruchteil von Opus 5 ($5 / $25) oder GPT-5.6 Sol ($4 / $20).
  • Großes Kontextfenster und Multimodalität
    1 Mio. Token Kontext für Text, Bild, Audio, Video und PDF decken lange Dokumente und multimodale Aufgaben in einem Modell ab.
  • Integrierte Agenten-Tools
    Function Calling, Computer Use und Grounding mit Google Search (5.000 Suchanfragen pro Monat kostenlos) sind eingebaut. Der Einsatz als KI-Agent ist damit ohne Zusatz-Infrastruktur möglich.
  • Steuerbarer Reasoning-Aufwand
    Über Effort-Level (low/medium/high) lässt sich pro Anfrage zwischen schnellen, günstigen Antworten und tiefem Reasoning wählen.

Nachteile

  • Hoher Token-Verbrauch treibt die realen Kosten
    Das Modell erzeugt rund 70 % mehr Output-Token als vergleichbare Modelle. Trotz unveränderter Token-Preise steigen die Kosten pro Aufgabe laut mehreren Analysen um etwa 40 % gegenüber 3.7 Flash.
  • Hohe Latenz
    Die Zeit bis zum ersten Token liegt bei rund 13 Sekunden, üblich sind in dieser Klasse etwa 3 Sekunden. Für interaktive Anwendungen ist das Modell damit kaum geeignet.
  • Preis verdoppelt sich ab 2027
    Die Einführungspreise gelten nur bis zum 31.12.2026. Ab Januar 2027 steigen sie auf $1,50 / $7,50 pro 1 Mio. Input-/Output-Token, das Niveau von Gemini 3.6 Flash.
  • Schwach bei Terminal-Aufgaben
    In Terminal-Bench 4.0 erreicht 3.8 Flash nur 19,1 % (Claude Opus 5: 51,8 %). Für Agenten, die viel in der Kommandozeile arbeiten, ist es keine Alternative zu den Frontier-Modellen.
  • Proprietäres Modell
    Wie alle Gemini Modelle gibt es keine Open Weights und kein lokales Deployment. Du bist an Googles API mit deren Preisen, Limits und Datenschutzbedingungen gebunden.

Vergleiche Gemini 3.8 Flash mit anderen LLMs

Vergleiche Gemini 3.8 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Gemini 3.8 Flash ausprobieren

Du musst kein Entwickler sein: Gemini 3.8 Flash ist auch direkt in Gemini nutzbar.

App
Gemini
Kostenlose Nutzung
Ja
Pro-Abo / Monat
4,99 €

Provider & APIs

Du kannst Google DeepMind Gemini 3.8 Flash über die API folgender Anbieter nutzen.

Das Modell ist derzeit bei keinen Anbietern verfügbar.

Häufige Fragen zu Gemini 3.8 Flash

Kann ich Gemini 3.8 Flash kostenlos nutzen?

Ja, Gemini 3.8 Flash ist in Gemini auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist Gemini 3.8 Flash Open Source?

Nein, Gemini 3.8 Flash ist proprietär. Es gibt keine offenen Gewichte, die Nutzung läuft über Apps oder die API von Google DeepMind.

Welche Eingabeformate versteht Gemini 3.8 Flash?

Gemini 3.8 Flash verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video.

Was kostet Gemini 3.8 Flash über die API?

Über die API kostet Gemini 3.8 Flash 0,75 $ pro 1 Mio. Input-Token und 3,75 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Gemini 3.8 Flash?

Gemini 3.8 Flash verarbeitet bis zu 1 Mio. Token in einer Anfrage.

Was ist der Vorgänger von Gemini 3.8 Flash?

Der direkte Vorgänger von Gemini 3.8 Flash ist Gemini 3.5 Flash Lite (erschienen Juli 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.