Gemini 3.5 Flash Lite
Gemini 3.5 Flash Lite Modell-Übersicht
Gemini 3.5 Flash-Lite ist das schnellste und günstigste LLM aus der Googles Gemini-3.5-Familie und wurde am 21. Juli 2026 von Google DeepMind veröffentlicht. Das KI-Modell zielt auf hohen Token-Throughput und niedrige Latenz ab. Damit eignet es sich besonders für Aufgaben als Sub-Agent in Agentic Workflows, wie z.B. Websuche und Dokumentenverarbeitung. Laut Artificial Analysis können bis zu 350 Output-Token pro Sekunde erreicht werden. Gegenüber dem Vorgänger 3.1 Flash-Lite legt es vor allem bei Coding und langem Kontext zu (Terminal-Bench 2.1: 54 % statt 31 %) und übertrifft in einzelnen agentischen Benchmarks sogar das größere Gemini 3 Flash (SWE-Bench Pro: 54,2 % vs. 49,6 %). Mit $0,30 pro 1 Mio. Input- und $2,50 pro 1 Mio. Output-Token bei 1 Mio. Token Kontextfenster gehört Gemini 3.5 Flash-Lite auch zu den günstigen Modellen und lässt sich mit GPT-5.6 Luna oder Claude Haiku 4.5 vergleichen
Features & Modalitäten
Gemini 3.5 Flash Lite Benchmark Scores
Technologie & Daten
Technische Spezifikationen
| Architektur | Transformer |
|---|---|
| Input Kontextlänge | 1 Mio. |
| Output Kontextlänge | 65,54k |
| Tokenizer | Proprietärer Transformer |
Besonderheiten
| Computer Use | Integriertes Tool zur Steuerung von UI-/Browser-Aktionen für Aufgaben als KI-Agent. |
|---|---|
| Search Grounding | Offizielle Google-Suche als Tool. |
| 1 Mio. Token Kontextfenster | Entspricht ca. 1.500 DinA4 Seiten. |
| Multimodaler Input | Verarbeitet Text, Bild, Audio, Video und PDF. Ausgabe nur in Text-Form. |
Vorteile & Nachteile
Vorteile
- Sehr günstig bei hohem DurchsatzMit $0,30 / $2,50 pro 1 Mio. Input-/Output-Token und rund 350 Output-Token pro Sekunde (laut Artificial Analysis) ist das Modell für Aufgaben mit hohem Token-Volumen ausgelegt.
- Übertrifft teils das größere Gemini 3 FlashIn agentischen Benchmarks liegt 3.5 Flash-Lite vorne: SWE-Bench Pro 54,2 % vs. 49,6 % und OSWorld-Verified 74,0 % vs. 65,1 % gegenüber Gemini 3 Flash.
- Großes Kontextfenster und breite Modalitäten1 Mio. Token Kontext sowie Text-, Bild-, Audio-, Video- und PDF-Input decken viele Dokumenten- und Agenten-Workflows ab.
- Integrierte Agenten-ToolsFunction Calling, Google-Suche als Tool und Computer Use sind eingebaut. Google positioniert das Modell explizit als Subagent in komplexen Workflows.
Nachteile
- Proprietär, keine Open WeightsDas Modell läuft nur über Googles API und Cloud; lokale Ausführung oder Self-Hosting sind nicht möglich, anders als bei offenen Modellen wie Kimi-K3 oder Laguna S2.1.
- Output vergleichsweise teuerMit $2,50 pro 1 Mio. Output-Token kostet die Ausgabe rund das Achtfache der Eingabe ($0,30). Bei Aufgaben mit viel Output summiert sich das trotz der 'Lite'-Positionierung.
- Begrenzte TransparenzGoogle nennt weder Knowledge Cutoff noch Architektur, Parameterzahl oder Trainingsdaten offiziell. Eine unabhängige Einordnung oder das Nachvollziehen des Trainings wird dadurch erschwert.
Vergleiche Gemini 3.5 Flash Lite mit anderen LLMs
Vergleiche Gemini 3.5 Flash Lite mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.
Gemini 3.5 Flash Lite ausprobieren
Du musst kein Entwickler sein: Gemini 3.5 Flash Lite ist auch direkt in Gemini nutzbar.
Provider & APIs
Du kannst Google DeepMind Gemini 3.5 Flash Lite über die API folgender Anbieter nutzen.
Das Modell ist derzeit bei keinen Anbietern verfügbar.
Häufige Fragen zu Gemini 3.5 Flash Lite
Kann ich Gemini 3.5 Flash Lite kostenlos nutzen?
Ja, Gemini 3.5 Flash Lite ist in Gemini auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.
Ist Gemini 3.5 Flash Lite Open Source?
Nein, Gemini 3.5 Flash Lite ist proprietär. Es gibt keine offenen Gewichte, die Nutzung läuft über Apps oder die API von Google DeepMind.
Welche Eingabeformate versteht Gemini 3.5 Flash Lite?
Gemini 3.5 Flash Lite verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video, PDF.
Was kostet Gemini 3.5 Flash Lite über die API?
Über die API kostet Gemini 3.5 Flash Lite 0,30 $ pro 1 Mio. Input-Token und 2,50 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.
Wie groß ist das Kontextfenster von Gemini 3.5 Flash Lite?
Gemini 3.5 Flash Lite verarbeitet bis zu 1 Mio. Token in einer Anfrage.
Was ist der Vorgänger von Gemini 3.5 Flash Lite?
Der direkte Vorgänger von Gemini 3.5 Flash Lite ist Gemini 3.5 Flash (erschienen Mai 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.