Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

GLM 5.3

Veröffentlichung
August 2026
Kontextfenster
1 Mio. Token
API-Preis In / Out
1,40 $ / 4,40 $
Parameter
753 Mrd.
Daten aktualisiert: 25. September 2026

GLM 5.3 Modell-Übersicht

GLM-5.3 ist das neue Flaggschiff von Z.ai (ehemals Zhipu AI) und der Nachfolger von GLM-5.2, veröffentlicht am 14. August 2026. Die Open Weights folgten am 28. August auf Hugging Face. Das Besondere: GLM-5.3 nutzt dasselbe Basismodell wie GLM-5.2, ein Sparse-Mixture-of-Experts-Modell (MoE) mit rund 753 Mrd. Parametern, von denen pro Token etwa 40 Mrd. aktiv sind. Sämtliche Fortschritte stammen laut Z.ai aus stark skaliertem Post-Training für Coding- und Cybersecurity-Aufgaben. Kontextfenster (1 Mio. Token) und Preis ($1,40 / $4,40 pro 1 Mio. Input-/Output-Token) bleiben gleich. Der Effekt ist beachtlich: In Terminal-Bench 3.0 springt der Wert von 4,6 % auf 28,3 %, in CyberGym von 77,2 % auf 84,5 %. In einer Blindbewertung von Tencent liegt GLM-5.3 zudem auf Augenhöhe mit Kimi K3 und Hy4 Preview. Nach unserer Einschätzung zeigt GLM-5.3 eindrucksvoll, wie viel Leistung allein im Post-Training steckt. Ein Wermutstropfen: Die Gewichte stehen nicht mehr unter MIT, sondern unter einer eigenen Lizenz mit Auflagen für sehr große Hoster.

Features & Modalitäten

Nicht verfügbar
MultimodalitätWebsucheQuellenangaben
Verfügbar
ReasoningToolsStrukturierte AusgabenFinetuning
Input:Text
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
131,07k Token
Input-Preis / 1M Token
1,40 $
Output-Preis / 1M Token
4,40 $
Parameter
753 Mrd.

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0064 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

GLM 5.3 Benchmark Scores

‌
‌

Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturSparse MoE-Transformer
Input Kontextlänge1 Mio.
Output Kontextlänge131,07k
TokenizerProprietärer GLM-Tokenizer

Besonderheiten

Post-Training-only UpgradeGleiches Basismodell wie GLM-5.2, alle Verbesserungen stammen aus zusätzlichem Post-Training.
Reasoning-StufenDrei Stufen (low, high, max) über reasoning_effort, Standard ist max.
Context CachingImplizites Caching senkt den Input-Preis auf rund $0,26 pro 1 Mio. Token.

Vorteile & Nachteile

Vorteile

  • Großer Sprung im Agentic Coding
    In Terminal-Bench 3.0 steigt GLM-5.3 von 4,6 % auf 28,3 %, im hauseigenen Z.ai Code Bench legt es rund 50 % zu. Und das ganz ohne neues Pre-Training.
  • Stark in Cybersecurity
    Mit 84,5 % in CyberGym (GLM-5.2: 77,2 %) gehört GLM-5.3 beim Auffinden bekannter Schwachstellen zu den stärksten offenen Modellen.
  • Günstiges Pricing
    Mit $1,40 / $4,40 pro 1 Mio. Input-/Output-Token bleibt der Preis unverändert und liegt deutlich unter westlichen Frontier-Modellen wie Claude Opus 5 ($5 / $25). Cached Input kostet nur rund $0,26.
  • Sehr großes Kontextfenster
    1 Mio. Token Kontext reichen für Software-Engineering auf Projektebene, bei dem ganze Codebases im Kontext bleiben müssen.
  • Open Weights verfügbar
    Die Gewichte stehen auf Hugging Face bereit und lassen sich selbst hosten und finetunen.

Nachteile

  • Lizenz nicht mehr MIT
    Anders als GLM-5.2 steht GLM-5.3 unter einer eigenen Lizenz: Hoster mit mehr als $10 Mrd. Jahresumsatz müssen vor der kommerziellen Nutzung eine Security-Review von Z.ai durchlaufen.
  • Nur Text, keine Multimodalität
    GLM-5.3 verarbeitet ausschließlich Text. Für Bild-, Audio- oder Video-Input brauchst du ein anderes Modell.
  • Reasoning nicht abschaltbar
    Thinking ist immer aktiv und steht standardmäßig auf max. Bei einfachen Anfragen erhöht das Latenz und Output-Kosten, solange du reasoning_effort nicht aktiv senkst.
  • Hoher Hardware-Bedarf beim Self-Hosting
    Mit rund 753 Mrd. Parametern braucht der lokale Betrieb Berichten zufolge etwa acht Datacenter-GPUs.

Vergleiche GLM 5.3 mit anderen LLMs

Vergleiche GLM 5.3 mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.

‌
Alle Modelle vergleichen

GLM 5.3 ausprobieren

Du musst kein Entwickler sein: GLM 5.3 ist auch direkt in GLM Coding Plan nutzbar.

App
GLM Coding Plan
Kostenlose Nutzung
Ja
Pro-Abo / Monat
18,00 $

Provider & APIs

Du kannst Z.ai GLM 5.3 über die API folgender Anbieter nutzen.

‌
‌
‌

Häufige Fragen zu GLM 5.3

Kann ich GLM 5.3 kostenlos nutzen?

Ja, GLM 5.3 ist in GLM Coding Plan auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist GLM 5.3 Open Source?

GLM 5.3 wird unter der Lizenz „Community License“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht GLM 5.3?

GLM 5.3 verarbeitet folgende Eingabeformate: Text.

Was kostet GLM 5.3 über die API?

Über die API kostet GLM 5.3 1,40 $ pro 1 Mio. Input-Token und 4,40 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von GLM 5.3?

GLM 5.3 verarbeitet bis zu 1 Mio. Token in einer Anfrage.

Was ist der Vorgänger von GLM 5.3?

Der direkte Vorgänger von GLM 5.3 ist GLM 5.2 (erschienen Juni 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.