GPT-6 AstraOpenAIGPT-6 Astra ist OpenAIs neue Flaggschiff-Generation und der Nachfolger von GPT-5.6 Sol, veröffentlicht am 4. September 2026. OpenAI positioniert es nicht als Chat-Modell, sondern als Computer-Use-System, das Browser, Terminals, Tabellen und Anwendungen selbst bedient. Neu sind ein Kontextfenster von 1.050.000 Token, zwei zusätzliche Reasoning-Stufen (xhigh und max) und persistente Notizen, die statt Context-Compaction in frühere Nachrichten und Tool-Ausgaben zurücksuchen. Dahinter steckt ein "recurrent depth"-Ansatz, der die Chain-of-Thought teilweise verbirgt. Das zahlt sich vor allem agentisch aus: 72,6 % in OSWorld V2-Offline gegenüber 65,7 % bei Sol und 91,5 % in BrowseComp, vor Kimi K3 (91,2 %) und Claude Opus 5 (90,8 %). Im Artificial Analysis Intelligence Index liegt Astra mit 61,2 Punkten vor Sol (58,9), aber hinter Claude Fable 5.1 (65,7). Mit $10 / $50 pro 1 Mio. Input-/Output-Token kostet Astra doppelt so viel wie Sol ($5 / $30) und genauso viel wie Fable 5.1. Ab 272K Input-Token verdoppelt sich die Input-Rate für den gesamten Request. Nach unserer Einschätzung ist Astra für Computer-Use und lange Agenten-Läufe ein echter Sprung, in der Breite aber kein neuer Spitzenreiter. Als erstes OpenAI-Modell mit der Preparedness-Einstufung "Critical" wird es zudem nur gestaffelt freigegeben und teils aktiv blockiert.ParameterUnbekanntVeröffentlichungSeptember 2026TrainingUnbekanntLizenzProprietärMultimodalWeb Search
Gemini 3.8 FlashGoogle DeepMindGemini 3.8 Flash ist das neue "Arbeitspferd" der Gemini-Familie von Google DeepMind und laut Google bereits der vierte Flash-Release in unter vier Monaten. Ein neues Basismodell gibt es nicht: 3.8 Flash baut ausdrücklich auf Gemini 3.7 Flash auf und wurde vor allem für agentisches Coding und mehrstufiges Reasoning nachtrainiert. Im Software-Engineering-Benchmark DeepSWE v1.1 steigt der Score von 65,3 % auf 73,7 % und liegt damit nur knapp unter Claude Opus 5 (74,0 %), aber deutlich über Claude Sonnet 5 (53,8 %). Der Einführungspreis von $0,75 / $3,75 pro 1 Mio. Input-/Output-Token liegt bei der Hälfte von Gemini 3.6 Flash ($1,50 / $7,50), gilt allerdings nur bis Ende 2026. Dazu kommt ein spürbar höherer Token-Verbrauch: Die realen Kosten pro Aufgabe steigen laut übereinstimmenden Analysen um rund 40 % gegenüber 3.7 Flash. Für effizienz- und latenzkritische Workloads empfiehlt Google selbst, bei 3.7 Flash zu bleiben. Nach unserer Einschätzung ist 3.8 Flash damit in erster Linie ein Coding-Update für Agenten-Workflows und kein Grund für einen Wechsel bei einfachen, latenzkritischen Aufgaben.ParameterUnbekanntVeröffentlichungSeptember 2026TrainingUnbekanntLizenzProprietärMultimodalWeb Search
Qwen 3.8 MaxAlibabaQwen3.8 Max 0902 ist ein aktualisierter Snapshot von Alibabas Flaggschiff Qwen 3.8 Max, veröffentlicht am 1. September 2026. Architektur und Größe bleiben unverändert: ein Sparse-Mixture-of-Experts-Modell (MoE) mit rund 2,4 Billionen Parametern, 1 Mio. Token Kontextfenster, optionalem Thinking-Modus und nativer Verarbeitung von Text, Bild und Video. Der Fortschritt stammt laut Qwen-Team ausschließlich aus zusätzlichem Post-Training auf Coding- und Cowork-Aufgaben. Im Front-End-Ranking der CodeArena legt der Snapshot um 22 Punkte auf 1.691 zu und übernimmt damit Platz 1. Alibaba sieht das Modell in mehreren Coding-Benchmarks vor Claude Opus 5; in der Gesamtwertung unabhängiger Tests liegt es je nach Aufgabe aber knapp vor oder hinter Opus 5. Die Stärke bei Coding- und Agenten-Aufgaben ist also real, eine durchgängige Führung sehen wir nicht. Preislich bleibt es bei $2 / $6 pro 1 Mio. Input-/Output-Token und damit deutlich unter Opus 5 ($5 / $25).Parameter2.400 Mrd.VeröffentlichungSeptember 2026TrainingUnbekanntLizenzProprietärMultimodal