Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Gemini 3.1 Flash-Lite

Veröffentlichung
März 2026
Kontextfenster
1,05 Mio. Token
API-Preis In / Out
0,25 $ / 1,50 $
Knowledge Cutoff
Januar 2025
Daten aktualisiert: 15. Juni 2026

Gemini 3.1 Flash-Lite Modell-Übersicht

Gemini 3.1 Flash-Lite ist ein kleines, schnelles und kostengünstiges LLM aus der Gemini 3.1 Modellfamilie. Wie auch das größere Gemini 3.1 Pro basiert Gemini 3.1 Flash-Lite auf der Gemini 3 Pro-Architektur. Es ist optimiert für häufig wiederholende Anwendungsfälle oder Aufgaben mit hohen Anforderungen an niedrige Latenzen. Im Vergleich zum Vorgänger Gemini 2.5 Flash-Lite ist 3.1 Flash-Lite ca. 2,5x so schnell um das erste Token zu generieren und hat insgesamt eine ca. 45 % höherere Output-Geschwindigkeit. Damit eignet sich Flash-Lite besonders gut für realtime Übersetzungen, schnelle, Klassifikationsaufgaben und den Einsatz in low-latency (Agenten-)Workflows.

Features & Modalitäten

Nicht verfügbar
Finetuning
Verfügbar
ReasoningToolsMultimodalitätWebsucheStrukturierte AusgabenQuellenangaben
Input:TextBildAudioVideoPDF
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1,05 Mio. Token
Max. Output
65,54k Token
Input-Preis / 1M Token
0,25 $
Output-Preis / 1M Token
1,50 $

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0021 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Gemini 3.1 Flash-Lite Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturTransformer
Input Kontextlänge1,05 Mio.
Output Kontextlänge65,54k
TokenizerGoogle SentencePiece Tokenizer

Besonderheiten

Anpassbare Thinking LevelsVier Reasoning-Stufen: Minimal, Low, Medium und High.
Search GroundingIntegrierte Google-Suche
Code ExecutionNatives Ausführen von Code innerhalb der API-Umgebung.

Vorteile & Nachteile

Vorteile

  • Extrem kosteneffizient
    Mit nur $0,25/ 1 Mio. Input- und $1,50 / Mio. Output-Tokens ist Gemini 3.1 Flash-Lite ca. 8x günstiger als Gemini 3.1 Pro und lässt sich für viele reale Anwendungsfälle nutzen.
  • Hohe Geschwindigkeit
    Laut Angaben von Google DeepMind erreicht Gemini 3.1 Flash-Lite bis zu 363 Token pro Sekunde. Kombiniert mit der schnellen Time-to-First-Token Geschwindigkeit lässt sich das Modell damit hervorragend für Low-Latency-Apps verwenden.
  • 1M Token Kontextfenster
    Mit bis zu 1 Million Token (multimodalem) Kontext kann Gemini 3.1 Flash-Lite große Kontexte verarbeiten.
  • Starke multimodale Fähigkeiten
    3.1 Flash-Lite verarbeitet Text, Bilder, Audio, Video und PDFs. Dabei erreicht es in vielen Multimodal-Benchmarks starke Ergebnisse (VideoMMMU: 84,8 %, MMMU-Pro: 76,8 %).

Nachteile

  • Preview-Version
    Wie von Google bereits bekannt, wird auch Gemini 3.1 Flash-Lite zunächst als Preview-Version veröffentlicht. Änderungen an der API oder der erwarteten Output-Qualität ist damit möglich.
  • Nur bis zu 64k Text-Output
    Trotz multimodaler Eingabe beschränkt sich die Ausgabe von Gemini 3.1 Flash-Lite auf eher niedrige 64k Token Text-Output.
  • Proprietäres Modell
    Das Modell ist ausschließlich über Googles APIs nutzbar und kann nicht lokal betrieben werden. Auch Fine-Tuning von Gemini 3.1 Flash-Lite ist nicht möglich.

Vergleiche Gemini 3.1 Flash-Lite mit anderen LLMs

Vergleiche Gemini 3.1 Flash-Lite mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Gemini 3.1 Flash-Lite ausprobieren

Du musst kein Entwickler sein: Gemini 3.1 Flash-Lite ist auch direkt in Gemini nutzbar.

App
Gemini
Kostenlose Nutzung
Ja
Pro-Abo / Monat
4,99 €

Provider & APIs

Du kannst Google DeepMind Gemini 3.1 Flash-Lite über die API folgender Anbieter nutzen.

Das Modell ist derzeit bei keinen Anbietern verfügbar.

Häufige Fragen zu Gemini 3.1 Flash-Lite

Kann ich Gemini 3.1 Flash-Lite kostenlos nutzen?

Ja, Gemini 3.1 Flash-Lite ist in Gemini auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist Gemini 3.1 Flash-Lite Open Source?

Nein, Gemini 3.1 Flash-Lite ist proprietär. Es gibt keine offenen Gewichte, die Nutzung läuft über Apps oder die API von Google DeepMind.

Welche Eingabeformate versteht Gemini 3.1 Flash-Lite?

Gemini 3.1 Flash-Lite verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video, PDF.

Was kostet Gemini 3.1 Flash-Lite über die API?

Über die API kostet Gemini 3.1 Flash-Lite 0,25 $ pro 1 Mio. Input-Token und 1,50 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Gemini 3.1 Flash-Lite?

Gemini 3.1 Flash-Lite verarbeitet bis zu 1,05 Mio. Token in einer Anfrage.

Wie aktuell ist das Wissen von Gemini 3.1 Flash-Lite?

Der Wissensstand (Knowledge Cutoff) von Gemini 3.1 Flash-Lite reicht bis Januar 2025. Über die integrierte Websuche kann das Modell zusätzlich aktuelle Informationen abrufen.

Was ist der Vorgänger von Gemini 3.1 Flash-Lite?

Der direkte Vorgänger von Gemini 3.1 Flash-Lite ist Gemini 3.1 Pro (erschienen Februar 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.