Gemini 2.5 Flash-Lite
Gemini 2.5 Flash-Lite Modell-Übersicht
Gemini 2.5 Flash-Lite ist das kleinste LLM aus der Gemini 2.5 Modellfamilie. 2.5 Flash-Lite wurde auf Anwendungsfälle spezialisiert, die eine hohe Geschwindigkeit bei der Inferenz erfordern. Wie die anderen Gemini 2.5 Modelle auch, handelt es sich bei 2.5 Flash-Lite um ein hybrides Reasoning-Modell mit einem Input-Kontextfenster von 1 Mio. Tokens.
Features & Modalitäten
Gemini 2.5 Flash-Lite Benchmark Scores
Technologie & Daten
Technische Spezifikationen
| Architektur | Hybrider MoE-Transformer |
|---|---|
| Input Kontextlänge | 1,05 Mio. |
| Output Kontextlänge | 65,54k |
| Tokenizer | SentencePiece-Unigram-Tokenizer |
Besonderheiten
| Besonderheit 1 | Geringe Latenz |
|---|---|
| Besonderheit 2 | Tool-Use Kapazitäten |
| Besonderheit 3 | Kosteneffizienz |
Vorteile & Nachteile
Vorteile
- Extrem großes KontextfensterMit bis zu 1 Mio. Tokens kann Gemini 2.5 Flash-Lite ganze Codebasen oder Bücher als Input verarbeiten.
- Sehr kostengünstigIm Gegensatz zu Gemini 2.5 Pro werden die Kosten bei größeren Kontextfenstern für Gemini 2.5 Flash-Lite nicht erhöht.
- Unterstützt viele ModalitätenGemini 2.5 Flash-Lite unterstützt sowohl Text-, Bild- Audio- als auch Video-Inputs.
- Flexibles ReasoningDas hybride Reasoning-LLM lässt sich stufenweise konfigurieren, sodass hochkomplexe Aufgaben genauso sorgfältig bearbeitet werden, wie kleinere Tasks schnell umgesetzt werden können.
- Sehr Hohe GeschwindigkeitGemini 2.5 Flash-Lite bietet selbst mit aktiviertem "Thinking" einen hohen Token-Throughput von über 100 Token pro Sekunde.
Nachteile
- Limitierte Output-QualitätDurch den Fokus auf Geschwindigkeit eignet sich Gemini 2.5 Flash-Lite weniger für komplexe Tasks, bei denen eine hohe Korrektheit vorausgesetzt wird.
- Eingeschränkte Output-LängeMit nur 64k Token ist die Länge des Outputs in Gemini 2.5 Flash-Lite deutlich eingeschränkt.
- API für Entwickler unübersichtlichDie Einrichtung sowie der Zugriff auf API-Schnittstellen ist bei Google deutlich umständlicher, als bei anderen LLM-Entwicklern.
Vergleiche Gemini 2.5 Flash-Lite mit anderen LLMs
Vergleiche Gemini 2.5 Flash-Lite mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.
Gemini 2.5 Flash-Lite ausprobieren
Du musst kein Entwickler sein: Gemini 2.5 Flash-Lite ist auch direkt in Gemini nutzbar.
Provider & APIs
Du kannst Google DeepMind Gemini 2.5 Flash-Lite über die API folgender Anbieter nutzen.
Das Modell ist derzeit bei keinen Anbietern verfügbar.
Häufige Fragen zu Gemini 2.5 Flash-Lite
Kann ich Gemini 2.5 Flash-Lite kostenlos nutzen?
Ja, Gemini 2.5 Flash-Lite ist in Gemini auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.
Ist Gemini 2.5 Flash-Lite Open Source?
Nein, Gemini 2.5 Flash-Lite ist proprietär. Es gibt keine offenen Gewichte, die Nutzung läuft über Apps oder die API von Google DeepMind.
Welche Eingabeformate versteht Gemini 2.5 Flash-Lite?
Gemini 2.5 Flash-Lite verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video, PDF.
Was kostet Gemini 2.5 Flash-Lite über die API?
Über die API kostet Gemini 2.5 Flash-Lite 0,10 $ pro 1 Mio. Input-Token und 0,40 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.
Wie groß ist das Kontextfenster von Gemini 2.5 Flash-Lite?
Gemini 2.5 Flash-Lite verarbeitet bis zu 1,05 Mio. Token in einer Anfrage.
Wie aktuell ist das Wissen von Gemini 2.5 Flash-Lite?
Der Wissensstand (Knowledge Cutoff) von Gemini 2.5 Flash-Lite reicht bis Januar 2025. Über die integrierte Websuche kann das Modell zusätzlich aktuelle Informationen abrufen.
Was ist der Vorgänger von Gemini 2.5 Flash-Lite?
Der direkte Vorgänger von Gemini 2.5 Flash-Lite ist Gemini 2.5 Flash (erschienen Juni 2025). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.