Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Qwen3.8 2.4T A95B

Veröffentlichung
August 2026
Kontextfenster
1 Mio. Token
API-Preis In / Out
2,00 $ / 6,00 $
Parameter
2.400 Mrd.
Daten aktualisiert: 3. September 2026

Qwen3.8 2.4T A95B Modell-Übersicht

Qwen3.8 2.4T A95B ist der technische Name des Modells, das Alibaba als Qwen 3.8 Max vermarktet: das bislang größte Modell der Qwen-Familie mit 2,4 Billionen Gesamtparametern, von denen pro Token rund 95 Mrd. aktiv sind (daher das Kürzel A95B). Das Sparse-Mixture-of-Experts-Modell (MoE) baut auf der Qwen-3.5-Architektur auf und kombiniert sie mit einem hybriden Attention-Mechanismus, der Latenz und Rechenkosten bei langen Kontexten senken soll. Neu gegenüber älteren Qwen-Generationen sind das 1 Mio. Token Kontextfenster, die native Verarbeitung von Text, Bild und Video sowie der Fokus auf langlaufende, autonome Coding-Aufgaben als KI-Agent. Alibaba nennt intern ein Software-Projekt, an dem das Modell 16 Tage eigenständig gearbeitet haben soll. Mit $2 / $6 pro 1 Mio. Input-/Output-Token positioniert sich das Modell preislich aggressiv gegenüber westlichen Flaggschiffen wie GPT-5.6 Sol oder Claude Fable 5. Die Coding- und Multimodal-Bestwerte stammen bislang allerdings vom Anbieter selbst. Eine Model Card, unabhängige Benchmarks und die Lizenz der angekündigten Open Weights standen zum Launch noch aus.

Features & Modalitäten

Nicht verfügbar
Quellenangaben
Verfügbar
ReasoningToolsMultimodalitätWebsucheStrukturierte AusgabenFinetuning
Input:TextBildVideo
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
128k Token
Input-Preis / 1M Token
2,00 $
Output-Preis / 1M Token
6,00 $
Parameter
2.400 Mrd.

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0088 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Qwen3.8 2.4T A95B Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturSparse MoE-Transformer
Input Kontextlänge1 Mio.
Output Kontextlänge128k
TokenizerUnbekannt

Besonderheiten

Native VisionVerarbeitet Bild, Video und Dokumente nativ im selben Modell.
Langlaufende Agenten-TasksLaut Alibaba über mehr als zehn Tage autonom an einer Aufgabe.
Eingebaute Tools & Reasoning-StufenWebsuche, Code-Interpreter und Bildsuche als Built-in-Tools, drei wählbare Reasoning-Stufen.

Vorteile & Nachteile

Vorteile

  • Aggressiver Preis für ein Flaggschiff
    Mit $2 / $6 pro 1 Mio. Input-/Output-Token unterbietet Alibaba westliche Top-Modelle wie Claude Opus 5 ($5 / $25) deutlich. Implizites Caching senkt die Input-Kosten weiter auf rund $0,25 pro 1 Mio. Token.
  • Sehr großes Kontextfenster
    1 Mio. Token Kontext erlauben die Arbeit an ganzen Codebases oder langen Dokumenten ohne Chunking, ein klarer Sprung gegenüber älteren Qwen-Modellen.
  • Native Multimodalität inkl. Video
    Text-, Bild- und Video-Input sind von Grund auf integriert statt nachgerüstet. In der Vision Arena wird das Modell auf Rang 2 geführt.
  • Auf langlaufende Agenten-Tasks ausgelegt
    Laut Alibaba kann das Modell autonome Coding- und Cowork-Aufgaben über mehr als zehn Tage eigenständig bearbeiten. Function Calling, Structured Outputs und eingebaute Tools (Websuche, Code-Interpreter) sind an Bord.

Nachteile

  • Benchmark Scores noch unbelegt
    Die genannten Coding- und Multimodal-Bestwerte sowie die Vergleiche mit GPT-5.6 und Claude Fable 5 stammen vom Anbieter. Model Card und unabhängige Verifikation fehlten zum Launch.
  • Open Weights und Lizenz noch offen
    Die Gewichte wurden für die Woche nach dem Launch angekündigt, waren aber zunächst nicht auf Hugging Face verfügbar. Eine konkrete Lizenz hat Alibaba nicht benannt.
  • Hoher Hardware-Bedarf beim Self-Hosting
    Ein MoE mit 2,4 Billionen Parametern läuft selbst gehostet nur auf umfangreicher Datacenter-Hardware. Für die meisten Nutzer bleibt die Cloud-API die praktikable Option.

Vergleiche Qwen3.8 2.4T A95B mit anderen LLMs

Vergleiche Qwen3.8 2.4T A95B mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Provider & APIs

Du kannst Alibaba Qwen3.8 2.4T A95B über die API folgender Anbieter nutzen.




Häufige Fragen zu Qwen3.8 2.4T A95B

Welche Eingabeformate versteht Qwen3.8 2.4T A95B?

Qwen3.8 2.4T A95B verarbeitet folgende Eingabeformate: Text, Bild, Video.

Was kostet Qwen3.8 2.4T A95B über die API?

Über die API kostet Qwen3.8 2.4T A95B 2,00 $ pro 1 Mio. Input-Token und 6,00 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Qwen3.8 2.4T A95B?

Qwen3.8 2.4T A95B verarbeitet bis zu 1 Mio. Token in einer Anfrage.