Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Gemini 3.5 Flash Lite

Veröffentlichung
Juli 2026
Knowledge Cutoff
Unbekannt
Parameter
Unbekannt
Modellfamilie
Gemini 3.5 Flash Lite
Proprietär

Gemini 3.5 Flash Lite Modell-Übersicht

Gemini 3.5 Flash-Lite ist das schnellste und günstigste LLM aus der Googles Gemini-3.5-Familie und wurde am 21. Juli 2026 von Google DeepMind veröffentlicht. Das KI-Modell zielt auf hohen Token-Throughput und niedrige Latenz ab. Damit eignet es sich besonders für Aufgaben als Sub-Agent in Agentic Workflows, wie z.B. Websuche und Dokumentenverarbeitung. Laut Artificial Analysis können bis zu 350 Output-Token pro Sekunde erreicht werden. Gegenüber dem Vorgänger 3.1 Flash-Lite legt es vor allem bei Coding und langem Kontext zu (Terminal-Bench 2.1: 54 % statt 31 %) und übertrifft in einzelnen agentischen Benchmarks sogar das größere Gemini 3 Flash (SWE-Bench Pro: 54,2 % vs. 49,6 %). Mit $0,30 pro 1 Mio. Input- und $2,50 pro 1 Mio. Output-Token bei 1 Mio. Token Kontextfenster gehört Gemini 3.5 Flash-Lite auch zu den günstigen Modellen und lässt sich mit GPT-5.6 Luna oder Claude Haiku 4.5 vergleichen

Features

Tools

Websuche, Bildgenerierung, Computer Use und MCP-Server.

Multimodalität

Das Modell kann Text, Bilder, Audio und PDFs als Input verarbeiten.

Finetuning

Finetuning des Modells ist aktuell nicht möglich.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
65,54k Token
Trainingsdaten
Unbekannt
Parameter
Unbekannt
Input Preis
0,30 $
Output Preis
2,50 $
Vokabular
Unbekannt
Dateigröße
Unbekannt

Gemini 3.5 Flash Lite Benchmark Scores

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung – gemessen anhand standardisierter Benchmarks zur objektiven Vergleichbarkeit.



Technologie & Daten

Technische Spezifikationen

ArchitekturTransformer
Input Kontextlänge1 Mio.
Output Kontextlänge65,54k
TokenizerProprietärer Transformer

Besonderheiten

Computer UseIntegriertes Tool zur Steuerung von UI-/Browser-Aktionen für Aufgaben als KI-Agent.
Search GroundingOffizielle Google-Suche als Tool.
1 Mio. Token KontextfensterEntspricht ca. 1.500 DinA4 Seiten.
Multimodaler InputVerarbeitet Text, Bild, Audio, Video und PDF. Ausgabe nur in Text-Form.

Vorteile & Nachteile

Vorteile

  • Sehr günstig bei hohem Durchsatz
    Mit $0,30 / $2,50 pro 1 Mio. Input-/Output-Token und rund 350 Output-Token pro Sekunde (laut Artificial Analysis) ist das Modell für Aufgaben mit hohem Token-Volumen ausgelegt.
  • Übertrifft teils das größere Gemini 3 Flash
    In agentischen Benchmarks liegt 3.5 Flash-Lite vorne: SWE-Bench Pro 54,2 % vs. 49,6 % und OSWorld-Verified 74,0 % vs. 65,1 % gegenüber Gemini 3 Flash.
  • Großes Kontextfenster und breite Modalitäten
    1 Mio. Token Kontext sowie Text-, Bild-, Audio-, Video- und PDF-Input decken viele Dokumenten- und Agenten-Workflows ab.
  • Integrierte Agenten-Tools
    Function Calling, Google-Suche als Tool und Computer Use sind eingebaut. Google positioniert das Modell explizit als Subagent in komplexen Workflows.

Nachteile

  • Proprietär, keine Open Weights
    Das Modell läuft nur über Googles API und Cloud; lokale Ausführung oder Self-Hosting sind nicht möglich, anders als bei offenen Modellen wie Kimi-K3 oder Laguna S2.1.
  • Output vergleichsweise teuer
    Mit $2,50 pro 1 Mio. Output-Token kostet die Ausgabe rund das Achtfache der Eingabe ($0,30). Bei Aufgaben mit viel Output summiert sich das trotz der 'Lite'-Positionierung.
  • Begrenzte Transparenz
    Google nennt weder Knowledge Cutoff noch Architektur, Parameterzahl oder Trainingsdaten offiziell. Eine unabhängige Einordnung oder das Nachvollziehen des Trainings wird dadurch erschwert.

Vergleiche Gemini 3.5 Flash Lite mit anderen LLMs

Vergleiche Gemini 3.5 Flash Lite mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Parameteranzahl, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Provider & APIs

Du kannst Google DeepMind Gemini 3.5 Flash Lite über die API folgender Anbieter nutzen.