Gemini 3.5 Flash Lite
Gemini 3.5 Flash-Lite Modell-Übersicht
Gemini 3.5 Flash-Lite ist das schnellste und günstigste LLM aus der Googles Gemini-3.5-Familie und wurde am 21. Juli 2026 von Google DeepMind veröffentlicht. Das KI-Modell zielt auf hohen Token-Throughput und niedrige Latenz ab. Damit eignet es sich besonders für Aufgaben als Sub-Agent in Agentic Workflows, wie z.B. Websuche und Dokumentenverarbeitung. Laut Artificial Analysis können bis zu 350 Output-Token pro Sekunde erreicht werden. Gegenüber dem Vorgänger 3.1 Flash-Lite legt es vor allem bei Coding und langem Kontext zu (Terminal-Bench 2.1: 54 % statt 31 %) und übertrifft in einzelnen agentischen Benchmarks sogar das größere Gemini 3 Flash (SWE-Bench Pro: 54,2 % vs. 49,6 %). Mit $0,30 pro 1 Mio. Input- und $2,50 pro 1 Mio. Output-Token bei 1 Mio. Token Kontextfenster gehört Gemini 3.5 Flash-Lite auch zu den günstigen Modellen und lässt sich mit GPT-5.6 Luna oder Claude Haiku 4.5 vergleichen
Features & Modalitäten
Gemini 3.5 Flash-Lite Benchmark Scores
Technologie & Daten
Technische Spezifikationen
| Architektur | Transformer |
|---|---|
| Input Kontextlänge | 1 Mio. |
| Output Kontextlänge | 65,54k |
| Tokenizer | Proprietärer Transformer |
Besonderheiten
| Computer Use | Integriertes Tool zur Steuerung von UI-/Browser-Aktionen für Aufgaben als KI-Agent. |
|---|---|
| Search Grounding | Offizielle Google-Suche als Tool. |
| 1 Mio. Token Kontextfenster | Entspricht ca. 1.500 DinA4 Seiten. |
| Multimodaler Input | Verarbeitet Text, Bild, Audio, Video und PDF. Ausgabe nur in Text-Form. |
Vorteile & Nachteile
Vorteile
- Sehr günstig bei hohem DurchsatzMit $0,30 / $2,50 pro 1 Mio. Input-/Output-Token und rund 350 Output-Token pro Sekunde (laut Artificial Analysis) ist das Modell für Aufgaben mit hohem Token-Volumen ausgelegt.
- Übertrifft teils das größere Gemini 3 FlashIn agentischen Benchmarks liegt 3.5 Flash-Lite vorne: SWE-Bench Pro 54,2 % vs. 49,6 % und OSWorld-Verified 74,0 % vs. 65,1 % gegenüber Gemini 3 Flash.
- Großes Kontextfenster und breite Modalitäten1 Mio. Token Kontext sowie Text-, Bild-, Audio-, Video- und PDF-Input decken viele Dokumenten- und Agenten-Workflows ab.
- Integrierte Agenten-ToolsFunction Calling, Google-Suche als Tool und Computer Use sind eingebaut. Google positioniert das Modell explizit als Subagent in komplexen Workflows.
Nachteile
- Proprietär, keine Open WeightsDas Modell läuft nur über Googles API und Cloud; lokale Ausführung oder Self-Hosting sind nicht möglich, anders als bei offenen Modellen wie Kimi-K3 oder Laguna S2.1.
- Output vergleichsweise teuerMit $2,50 pro 1 Mio. Output-Token kostet die Ausgabe rund das Achtfache der Eingabe ($0,30). Bei Aufgaben mit viel Output summiert sich das trotz der 'Lite'-Positionierung.
- Begrenzte TransparenzGoogle nennt weder Knowledge Cutoff noch Architektur, Parameterzahl oder Trainingsdaten offiziell. Eine unabhängige Einordnung oder das Nachvollziehen des Trainings wird dadurch erschwert.
Vergleiche Gemini 3.5 Flash-Lite mit anderen LLMs
Vergleiche Gemini 3.5 Flash-Lite mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.
Gemini 3.5 Flash-Lite ausprobieren
Du musst kein Entwickler sein: Gemini 3.5 Flash-Lite ist auch direkt in Gemini nutzbar.
Provider & APIs
Du kannst Google DeepMind Gemini 3.5 Flash-Lite über die API folgender Anbieter nutzen.
Das Modell ist derzeit bei keinen Anbietern verfügbar.
Häufige Fragen zu Gemini 3.5 Flash-Lite
Kann ich Gemini 3.5 Flash-Lite kostenlos nutzen?
Ja, Gemini 3.5 Flash-Lite ist in Gemini auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.
Ist Gemini 3.5 Flash-Lite Open Source?
Nein, Gemini 3.5 Flash-Lite ist proprietär. Es gibt keine offenen Gewichte, die Nutzung läuft über Apps oder die API von Google DeepMind.
Welche Eingabeformate versteht Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video, PDF.
Was kostet Gemini 3.5 Flash-Lite über die API?
Über die API kostet Gemini 3.5 Flash-Lite 0,30 $ pro 1 Mio. Input-Token und 2,50 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.
Wie groß ist das Kontextfenster von Gemini 3.5 Flash-Lite?
Gemini 3.5 Flash-Lite verarbeitet bis zu 1 Mio. Token in einer Anfrage.
Was ist der Vorgänger von Gemini 3.5 Flash-Lite?
Der direkte Vorgänger von Gemini 3.5 Flash-Lite ist Gemini 3.5 Flash (erschienen Mai 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.