Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Gemini 2.5 Flash

Veröffentlichung
Juni 2025
Kontextfenster
1,05 Mio. Token
API-Preis In / Out
0,30 $ / 2,50 $
Knowledge Cutoff
Januar 2025
Daten aktualisiert: 15. Juni 2026

Gemini 2.5 Flash Modell-Übersicht

Gemini 2.5 Flash ist das mittlere LLM aus der Gemini 2.5 Modellfamilie. 2.5 Flash ist ein hybrides Thinking-Modell auf Basis einer MoE Transformer-Architektur. Das Modell eignet sich durch ein hervorragendes Preis-Leistungs-Verhältnis für ein breites Spektrum an Aufgaben.

Features & Modalitäten

Verfügbar
ReasoningToolsMultimodalitätWebsucheStrukturierte AusgabenQuellenangabenFinetuning
Input:TextBildAudioVideoPDF
Output:Text

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1,05 Mio. Token
Max. Output
65,54k Token
Input-Preis / 1M Token
0,30 $
Output-Preis / 1M Token
2,50 $

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0034 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Gemini 2.5 Flash Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturHybrider MoE-Transformer
Input Kontextlänge1,05 Mio.
Output Kontextlänge65,54k
TokenizerSentencePiece-Unigram-Tokenizer

Besonderheiten

Besonderheit 1Adaptive Thinking
Besonderheit 2Tool-Use Kapazitäten
Besonderheit 3Großes Kontextfenster

Vorteile & Nachteile

Vorteile

  • Extrem großes Kontextfenster
    Mit bis zu 1 Mio. Tokens kann Gemini 2.5 Flash ganze Codebasen oder Bücher als Input verarbeiten.
  • Günstige Preise
    Im Gegensatz zu Gemini 2.5 Pro werden die Kosten bei größeren Kontextfenstern für Gemini 2.5 Flash nicht erhöht.
  • Unterstützt viele Modalitäten
    Neben Text- und Bildeingaben kann Gemini 2.5 Flash auch Audio- und Video-Input nativ im selben Modell verarbeiten.
  • Flexibles Reasoning
    Das hybride Reasoning-LLM lässt sich stufenweise konfigurieren, sodass hochkomplexe Aufgaben genauso sorgfältig bearbeitet werden, wie kleinere Tasks schnell umgesetzt werden können.
  • Hohe Geschwindigkeit
    Gemini 2.5 Flash bietet selbst mit aktiviertem "Thinking" einen hohen Token-Throughput von ca. 100 Token pro Sekunde.

Nachteile

  • Geringer Output
    Mit nur 64k Token ist die Länge des Outputs in Gemini 2.5 Flash deutlich eingeschränkt.
  • API für Entwickler unübersichtlich
    Die Einrichtung sowie der Zugriff auf API-Schnittstellen ist bei Google deutlich umständlicher, als bei anderen LLM-Entwicklern.

Vergleiche Gemini 2.5 Flash mit anderen LLMs

Vergleiche Gemini 2.5 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Gemini 2.5 Flash ausprobieren

Du musst kein Entwickler sein: Gemini 2.5 Flash ist auch direkt in Gemini nutzbar.

App
Gemini
Kostenlose Nutzung
Ja
Pro-Abo / Monat
4,99 €

Provider & APIs

Du kannst Google DeepMind Gemini 2.5 Flash über die API folgender Anbieter nutzen.

Das Modell ist derzeit bei keinen Anbietern verfügbar.

Häufige Fragen zu Gemini 2.5 Flash

Kann ich Gemini 2.5 Flash kostenlos nutzen?

Ja, Gemini 2.5 Flash ist in Gemini auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist Gemini 2.5 Flash Open Source?

Nein, Gemini 2.5 Flash ist proprietär. Es gibt keine offenen Gewichte, die Nutzung läuft über Apps oder die API von Google DeepMind.

Welche Eingabeformate versteht Gemini 2.5 Flash?

Gemini 2.5 Flash verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video, PDF.

Was kostet Gemini 2.5 Flash über die API?

Über die API kostet Gemini 2.5 Flash 0,30 $ pro 1 Mio. Input-Token und 2,50 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Gemini 2.5 Flash?

Gemini 2.5 Flash verarbeitet bis zu 1,05 Mio. Token in einer Anfrage.

Wie aktuell ist das Wissen von Gemini 2.5 Flash?

Der Wissensstand (Knowledge Cutoff) von Gemini 2.5 Flash reicht bis Januar 2025. Über die integrierte Websuche kann das Modell zusätzlich aktuelle Informationen abrufen.

Was ist der Vorgänger von Gemini 2.5 Flash?

Der direkte Vorgänger von Gemini 2.5 Flash ist Gemini Diffusion (erschienen Mai 2025). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.