Gemini 3.5 Flash Lite
Gemini 3.5 Flash Lite Modell-Übersicht
Gemini 3.5 Flash-Lite ist das schnellste und günstigste LLM aus der Googles Gemini-3.5-Familie und wurde am 21. Juli 2026 von Google DeepMind veröffentlicht. Das KI-Modell zielt auf hohen Token-Throughput und niedrige Latenz ab. Damit eignet es sich besonders für Aufgaben als Sub-Agent in Agentic Workflows, wie z.B. Websuche und Dokumentenverarbeitung. Laut Artificial Analysis können bis zu 350 Output-Token pro Sekunde erreicht werden. Gegenüber dem Vorgänger 3.1 Flash-Lite legt es vor allem bei Coding und langem Kontext zu (Terminal-Bench 2.1: 54 % statt 31 %) und übertrifft in einzelnen agentischen Benchmarks sogar das größere Gemini 3 Flash (SWE-Bench Pro: 54,2 % vs. 49,6 %). Mit $0,30 pro 1 Mio. Input- und $2,50 pro 1 Mio. Output-Token bei 1 Mio. Token Kontextfenster gehört Gemini 3.5 Flash-Lite auch zu den günstigen Modellen und lässt sich mit GPT-5.6 Luna oder Claude Haiku 4.5 vergleichen
Features
Tools
Websuche, Bildgenerierung, Computer Use und MCP-Server.
Multimodalität
Das Modell kann Text, Bilder, Audio und PDFs als Input verarbeiten.
Finetuning
Finetuning des Modells ist aktuell nicht möglich.
Details zum Modell
Gemini 3.5 Flash Lite Benchmark Scores
Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung – gemessen anhand standardisierter Benchmarks zur objektiven Vergleichbarkeit.
Technologie & Daten
Technische Spezifikationen
| Architektur | Transformer |
|---|---|
| Input Kontextlänge | 1 Mio. |
| Output Kontextlänge | 65,54k |
| Tokenizer | Proprietärer Transformer |
Besonderheiten
| Computer Use | Integriertes Tool zur Steuerung von UI-/Browser-Aktionen für Aufgaben als KI-Agent. |
|---|---|
| Search Grounding | Offizielle Google-Suche als Tool. |
| 1 Mio. Token Kontextfenster | Entspricht ca. 1.500 DinA4 Seiten. |
| Multimodaler Input | Verarbeitet Text, Bild, Audio, Video und PDF. Ausgabe nur in Text-Form. |
Vorteile & Nachteile
Vorteile
- Sehr günstig bei hohem DurchsatzMit $0,30 / $2,50 pro 1 Mio. Input-/Output-Token und rund 350 Output-Token pro Sekunde (laut Artificial Analysis) ist das Modell für Aufgaben mit hohem Token-Volumen ausgelegt.
- Übertrifft teils das größere Gemini 3 FlashIn agentischen Benchmarks liegt 3.5 Flash-Lite vorne: SWE-Bench Pro 54,2 % vs. 49,6 % und OSWorld-Verified 74,0 % vs. 65,1 % gegenüber Gemini 3 Flash.
- Großes Kontextfenster und breite Modalitäten1 Mio. Token Kontext sowie Text-, Bild-, Audio-, Video- und PDF-Input decken viele Dokumenten- und Agenten-Workflows ab.
- Integrierte Agenten-ToolsFunction Calling, Google-Suche als Tool und Computer Use sind eingebaut. Google positioniert das Modell explizit als Subagent in komplexen Workflows.
Nachteile
- Proprietär, keine Open WeightsDas Modell läuft nur über Googles API und Cloud; lokale Ausführung oder Self-Hosting sind nicht möglich, anders als bei offenen Modellen wie Kimi-K3 oder Laguna S2.1.
- Output vergleichsweise teuerMit $2,50 pro 1 Mio. Output-Token kostet die Ausgabe rund das Achtfache der Eingabe ($0,30). Bei Aufgaben mit viel Output summiert sich das trotz der 'Lite'-Positionierung.
- Begrenzte TransparenzGoogle nennt weder Knowledge Cutoff noch Architektur, Parameterzahl oder Trainingsdaten offiziell. Eine unabhängige Einordnung oder das Nachvollziehen des Trainings wird dadurch erschwert.
Vergleiche Gemini 3.5 Flash Lite mit anderen LLMs
Vergleiche Gemini 3.5 Flash Lite mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Parameteranzahl, Preisen und Benchmark-Leistung.
Provider & APIs
Du kannst Google DeepMind Gemini 3.5 Flash Lite über die API folgender Anbieter nutzen.