Gemini 3.5 Flash LiteGoogle DeepMindGemini 3.5 Flash-Lite ist das schnellste und günstigste LLM aus der Googles Gemini-3.5-Familie und wurde am 21. Juli 2026 von Google DeepMind veröffentlicht. Das KI-Modell zielt auf hohen Token-Throughput und niedrige Latenz ab. Damit eignet es sich besonders für Aufgaben als Sub-Agent in Agentic Workflows, wie z.B. Websuche und Dokumentenverarbeitung. Laut Artificial Analysis können bis zu 350 Output-Token pro Sekunde erreicht werden. Gegenüber dem Vorgänger 3.1 Flash-Lite legt es vor allem bei Coding und langem Kontext zu (Terminal-Bench 2.1: 54 % statt 31 %) und übertrifft in einzelnen agentischen Benchmarks sogar das größere Gemini 3 Flash (SWE-Bench Pro: 54,2 % vs. 49,6 %). Mit $0,30 pro 1 Mio. Input- und $2,50 pro 1 Mio. Output-Token bei 1 Mio. Token Kontextfenster gehört Gemini 3.5 Flash-Lite auch zu den günstigen Modellen und lässt sich mit GPT-5.6 Luna oder Claude Haiku 4.5 vergleichenParameterUnbekanntVeröffentlichungJuli 2026TrainingUnbekanntLizenzProprietärMultimodalWeb Search
Gemini 3.6 FlashGoogle DeepMindGemini 3.6 Flash ist Googles schnelles "Mittelklasse-Modell", das sich zwischen Gemini 3.5 Flash-Lite und dem weiterhin verzögerten Gemini 3.5 Pro positioniert. Gegenüber dem direkten Vorgänger Gemini 3.5 Flash verbraucht es laut Google rund 17 % weniger Output-Token und benötigt weniger Reasoning-Schritte und Tool-Calls für die gleichen Aufgaben. Der Output-Preis sinkt von $9 auf $7,50 pro 1 Mio. Token, der Knowledge Cutoff rückt von Januar 2025 auf März 2026 vor. Mit einem Kontextfenster von 1 Mio. Token und nativer Multimodalität zielt es auf agentische Workflows, Coding und multimodale Aufgaben. Gemini 3.6 lässt sich als Übergangsmodell und kleines Update von 3.5 bezeichnen, das vermutlich die Wartezeit auf das große Gemini 3.5 Pro Modell verkürzen soll.ParameterUnbekanntVeröffentlichungJuli 2026TrainingUnbekanntLizenzProprietärMultimodalWeb Search
Laguna S 2.1PoolsideLaguna S 2.1 ist das neue Open-Weight-Modell von Poolside, das auf Agentic Coding und Aufgaben in Agentic Workflows über lange Zeithorizonte ausgelegt ist. Technisch ist es ein Mixture-of-Experts-Modell mit 118 Mrd. Parametern, von denen pro Token nur rund 8 Mrd. aktiv sind. Das hält die Inference günstig und erlaubt Self-Hosting auf einer einzelnen NVIDIA DGX Spark! Mit einem Kontextfenster von gut 1 Mio. Token und einem Preis von $0,10 / $0,20 pro 1 Mio. Input-/Output-Token liegt es preislich deutlich unter proprietären Flaggschiffen wie Claude Sonnet 5 oder GPT-5.6 Terra. In Coding-Benchmarks wie Terminal-Bench 2.1 (70,2 %) und SWE-Bench Pro (59,4 %) hält Poolside laut eigenen Angaben mit teils mehrfach größeren Modellen mit. Anders als reine Cloud-Modelle sind die Gewichte unter der OpenMDW-1.1-Lizenz frei verfügbar, sodass Teams sensiblen Code im eigenen Rechenzentrum halten können.Parameter118 Mrd.VeröffentlichungJuli 2026Training30.000 Mrd.LizenzOpen Model LicenseFinetuning