Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Gemma 4

Veröffentlichung
April 2026
Kontextfenster
262,14k Token
API-Preis In / Out
0,14 $ / 0,40 $
Knowledge Cutoff
Januar 2025
Daten aktualisiert: 10. Juli 2026

Gemma 4 Modell-Übersicht

Gemma 4 31B ist ein Open Weights Modell von Google DeepMind, das auf der technischen Grundlage von Gemini 3 aufbaut. Die größte Version von Gemma 4 ist ein 30.7B Dense-Transformer mit hybridem Attention-Mechanismus. Das Modell eignet sich, trotz seiner kleinen Größe, für agentische Aufgaben, die Reasoning voraussetzen. Gemma 4 ist multimodal und unterstützt Text-, Bild- und Video-Input mit einem 256K-Token-Kontextfenster und erreicht vergleichbare Benchmark Scores zu deutlich größeren Open Weights Modellen wie GLM-5, Qwen 3.5 (397B) oder Kimi-K2.5. In den kleineren "Edge" Versionen lässt sich Gemma 4 über die Google AI Edge Gallery sogar auf modernen Smartphones lokal und ohne Internetverbindung ausführen.

Features & Modalitäten

Nicht verfügbar
WebsucheQuellenangaben
Verfügbar
ReasoningToolsMultimodalitätStrukturierte AusgabenFinetuning
Input:TextBildVideo
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
262,14k Token
Max. Output
131,07k Token
Input-Preis / 1M Token
0,14 $
Output-Preis / 1M Token
0,40 $
Parameter
30,7 Mrd.
Dateigröße
58,25 GB
Vokabular
262k

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0006 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Gemma 4 Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturDense-Transformer
Input Kontextlänge262,14k
Output Kontextlänge131,07k
TokenizerSentencePiece-Tokenizer

Besonderheiten

Multimodales Function CallingUnterstützt nativ auch Bild-Input bei Function Calls.
Thinking ModeAktivierbarer Reasoning-Modus (enable_thinking=True)
Video-InputsNative Verarbeitung von Video-Input über Frame-Level-Reasoning

Vorteile & Nachteile

Vorteile

  • Hervorragende Benchmark Ergebnisse
    Mit nur 31B Parametern ist Gemma 4 ein kleines LLM. Dennoch erreicht es in manchen Benchmarks bessere Ergebnisse, als Modelle mit 20x mehr Parametern, z.B. einen ELO von 1452 im Arena.ai Ranking vs. 1449 von Qwen 3.5 397B oder 1425 bei DeepSeek V3-2 Thinking.
  • Reasoning- und Coding-Fähigkeiten
    Gemma 4 (31B) erreicht 89.2% in AIME 2026, 80.0% auf LiveCodeBench v6, 84.3% auf GPQA Diamond und einen Codeforces ELO von 2.150. Damit eignet sich das Modell auch für Coding-Aufgaben.
  • Vollständig Open Source unter Apache 2.0
    Gemma 4 ist im Vergleich zum Vorgänger Gemma 3 uneingeschränkt kommerziell und ohne Lizenzgebühren nutzbar. Die Gewichte von Gemma 4 lassen sich HuggingFace herunterladen, sodass sich das Modell lokal ausführen lässt.
  • Kostenlos über Google AI Studio API
    Zum Zeitpunkt der Veröffentlichung ist Gemma 4 kostenlos über die API von Google AI Studio abrufbar.
  • Breiter Framework-Support
    Unterstützt transformers, llama.cpp, SGLang, Ollama, LM Studio, MLX, ONNX, Mistral.rs und weitere Frameworks.
  • Multimodal mit Bild- und Video-Inputs
    Gemma 4 kann Text, Bilder und Videos nativ mit variablen Auflösungen und konfigurierbaren Token-Budgets als Inputs verarbeiten.

Nachteile

  • Kein Audio-Support im 31B-Modell
    Audio-Input ist nur bei den kleineren Edge-Varianten (E2B, E4B) verfügbar, nicht bei der großen 31B-Dense Hauptversion.
  • Hoher Speicherbedarf für lokales Deployment
    Um Gemma 4 (31B) in BF16 nutzen zu können, werden mindestens 61.4 GB RAM benötigt. Als Alternative werden quantisierte Versionen, z.B. Q4_K_M (ca. 18.7 GB RAM-Anforderung) oder die kleineren Versionen der Gemma-4 Familie als Alternativen angeboten.
  • Tooling + Community Aufbau notwendig
    Bislang drehte sich das OSS-KI-Ökosystem hauptsächlich um chinesische Modelle. Entsprechend muss das Ökosystem rund um westliche OSS Modelle noch wachsen. Durch die neue Apache-2.0 Lizenzierung dürfte dies voraussichtlich aber rasch geschehen.

Vergleiche Gemma 4 mit anderen LLMs

Vergleiche Gemma 4 mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Gemma 4 ausprobieren

Du musst kein Entwickler sein: Gemma 4 ist auch direkt in Gemini nutzbar.

App
Gemini
Kostenlose Nutzung
Ja
Pro-Abo / Monat
4,99 €

Provider & APIs

Du kannst Google DeepMind Gemma 4 über die API folgender Anbieter nutzen.

Das Modell ist derzeit bei keinen Anbietern verfügbar.

Häufige Fragen zu Gemma 4

Kann ich Gemma 4 kostenlos nutzen?

Ja, Gemma 4 ist in Gemini auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist Gemma 4 Open Source?

Gemma 4 wird unter der Lizenz „Apache 2.0“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht Gemma 4?

Gemma 4 verarbeitet folgende Eingabeformate: Text, Bild, Video.

Was kostet Gemma 4 über die API?

Über die API kostet Gemma 4 0,14 $ pro 1 Mio. Input-Token und 0,40 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Gemma 4?

Gemma 4 verarbeitet bis zu 262,14k Token in einer Anfrage.

Wie aktuell ist das Wissen von Gemma 4?

Der Wissensstand (Knowledge Cutoff) von Gemma 4 reicht bis Januar 2025.

Was ist der Vorgänger von Gemma 4?

Der direkte Vorgänger von Gemma 4 ist Gemma 3 (erschienen März 2025). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.