Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Gemini 3.5 Flash Lite

Veröffentlichung
Juli 2026
Kontextfenster
1 Mio. Token
API-Preis In / Out
0,30 $ / 2,50 $
Daten aktualisiert: 24. Juli 2026

Gemini 3.5 Flash-Lite Modell-Übersicht

Gemini 3.5 Flash-Lite ist das schnellste und günstigste LLM aus der Googles Gemini-3.5-Familie und wurde am 21. Juli 2026 von Google DeepMind veröffentlicht. Das KI-Modell zielt auf hohen Token-Throughput und niedrige Latenz ab. Damit eignet es sich besonders für Aufgaben als Sub-Agent in Agentic Workflows, wie z.B. Websuche und Dokumentenverarbeitung. Laut Artificial Analysis können bis zu 350 Output-Token pro Sekunde erreicht werden. Gegenüber dem Vorgänger 3.1 Flash-Lite legt es vor allem bei Coding und langem Kontext zu (Terminal-Bench 2.1: 54 % statt 31 %) und übertrifft in einzelnen agentischen Benchmarks sogar das größere Gemini 3 Flash (SWE-Bench Pro: 54,2 % vs. 49,6 %). Mit $0,30 pro 1 Mio. Input- und $2,50 pro 1 Mio. Output-Token bei 1 Mio. Token Kontextfenster gehört Gemini 3.5 Flash-Lite auch zu den günstigen Modellen und lässt sich mit GPT-5.6 Luna oder Claude Haiku 4.5 vergleichen

Features & Modalitäten

Nicht verfügbar
Finetuning
Verfügbar
ReasoningToolsMultimodalitätWebsucheStrukturierte AusgabenQuellenangaben
Input:TextBildAudioVideoPDF
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
65,54k Token
Input-Preis / 1M Token
0,30 $
Output-Preis / 1M Token
2,50 $

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0034 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Gemini 3.5 Flash-Lite Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturTransformer
Input Kontextlänge1 Mio.
Output Kontextlänge65,54k
TokenizerProprietärer Transformer

Besonderheiten

Computer UseIntegriertes Tool zur Steuerung von UI-/Browser-Aktionen für Aufgaben als KI-Agent.
Search GroundingOffizielle Google-Suche als Tool.
1 Mio. Token KontextfensterEntspricht ca. 1.500 DinA4 Seiten.
Multimodaler InputVerarbeitet Text, Bild, Audio, Video und PDF. Ausgabe nur in Text-Form.

Vorteile & Nachteile

Vorteile

  • Sehr günstig bei hohem Durchsatz
    Mit $0,30 / $2,50 pro 1 Mio. Input-/Output-Token und rund 350 Output-Token pro Sekunde (laut Artificial Analysis) ist das Modell für Aufgaben mit hohem Token-Volumen ausgelegt.
  • Übertrifft teils das größere Gemini 3 Flash
    In agentischen Benchmarks liegt 3.5 Flash-Lite vorne: SWE-Bench Pro 54,2 % vs. 49,6 % und OSWorld-Verified 74,0 % vs. 65,1 % gegenüber Gemini 3 Flash.
  • Großes Kontextfenster und breite Modalitäten
    1 Mio. Token Kontext sowie Text-, Bild-, Audio-, Video- und PDF-Input decken viele Dokumenten- und Agenten-Workflows ab.
  • Integrierte Agenten-Tools
    Function Calling, Google-Suche als Tool und Computer Use sind eingebaut. Google positioniert das Modell explizit als Subagent in komplexen Workflows.

Nachteile

  • Proprietär, keine Open Weights
    Das Modell läuft nur über Googles API und Cloud; lokale Ausführung oder Self-Hosting sind nicht möglich, anders als bei offenen Modellen wie Kimi-K3 oder Laguna S2.1.
  • Output vergleichsweise teuer
    Mit $2,50 pro 1 Mio. Output-Token kostet die Ausgabe rund das Achtfache der Eingabe ($0,30). Bei Aufgaben mit viel Output summiert sich das trotz der 'Lite'-Positionierung.
  • Begrenzte Transparenz
    Google nennt weder Knowledge Cutoff noch Architektur, Parameterzahl oder Trainingsdaten offiziell. Eine unabhängige Einordnung oder das Nachvollziehen des Trainings wird dadurch erschwert.

Vergleiche Gemini 3.5 Flash-Lite mit anderen LLMs

Vergleiche Gemini 3.5 Flash-Lite mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Gemini 3.5 Flash-Lite ausprobieren

Du musst kein Entwickler sein: Gemini 3.5 Flash-Lite ist auch direkt in Gemini nutzbar.

App
Gemini
Kostenlose Nutzung
Ja
Pro-Abo / Monat
4,99 €

Provider & APIs

Du kannst Google DeepMind Gemini 3.5 Flash-Lite über die API folgender Anbieter nutzen.

Das Modell ist derzeit bei keinen Anbietern verfügbar.

Häufige Fragen zu Gemini 3.5 Flash-Lite

Kann ich Gemini 3.5 Flash-Lite kostenlos nutzen?

Ja, Gemini 3.5 Flash-Lite ist in Gemini auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist Gemini 3.5 Flash-Lite Open Source?

Nein, Gemini 3.5 Flash-Lite ist proprietär. Es gibt keine offenen Gewichte, die Nutzung läuft über Apps oder die API von Google DeepMind.

Welche Eingabeformate versteht Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video, PDF.

Was kostet Gemini 3.5 Flash-Lite über die API?

Über die API kostet Gemini 3.5 Flash-Lite 0,30 $ pro 1 Mio. Input-Token und 2,50 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite verarbeitet bis zu 1 Mio. Token in einer Anfrage.

Was ist der Vorgänger von Gemini 3.5 Flash-Lite?

Der direkte Vorgänger von Gemini 3.5 Flash-Lite ist Gemini 3.5 Flash (erschienen Mai 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.