Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Inkling

Veröffentlichung
Juli 2026
Kontextfenster
1 Mio. Token
API-Preis In / Out
1,00 $ / 4,05 $
Parameter
975 Mrd.
Daten aktualisiert: 17. Juli 2026

Inkling Modell-Übersicht

Inkling ist das erste vollständig trainierte Foundation-Model von Thinking Machines Lab und wurde am 15. Juli 2026 unter Apache 2.0 als Open-Weights-Modell veröffentlicht. Inkling ist ein nativ multimodales Mixture-of-Experts-Modell mit 975 Mrd. Gesamt- und 41 Mrd. aktiven Parametern, das Text, Bilder und Audio als Eingabe verarbeitet und Text ausgibt. Mit bis zu 1 Mio. Token Kontextfenster und Benchmark Scores, die viele andere Open Weights Modelle übertreffen, etabliert sich Inkling als US-Alternative zum chinesischen GLM-5.2.

Features & Modalitäten

Verfügbar
ReasoningToolsMultimodalitätWebsucheStrukturierte AusgabenQuellenangabenFinetuning
Input:TextBildAudio
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
256k Token
Input-Preis / 1M Token
1,00 $
Output-Preis / 1M Token
4,05 $
Parameter
975 Mrd.
Dateigröße
1773,94 GB
Vokabular
201,02k
Trainingsdaten
45.000 Mrd.

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0058 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Inkling Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturMultimodaler Sparse-MoE Transformer
Input Kontextlänge1 Mio.
Output Kontextlänge256k
TokenizerUnbekannt

Besonderheiten

Encoder-freie MultimodalitätText, Bild und Audio laufen ohne separate Encoder in ein Modell
Agentic Tool-UseFunction Calling, Code-Execution, Browser-Nutzung und Websuche

Vorteile & Nachteile

Vorteile

  • Starke Reasoning- und Coding-Benchmarks
    Bei effort=0.99 erreicht Inkling laut Model Card 97,1 % in AIME, 87,2 % in GPQA Diamond und 77,6 % auf SWE-Bench Verified und ist damit konkurrenzfähig zu Claude Opus 4.8 und GPT-5.5.
  • Open Weights unter Apache 2.0
    Die vollständigen Gewichte von Inkling lassen sich auf Hugging Face unter der Apache-2.0-Lizenz herunterladen. Damit ist das Modell auch kommerziell nutzbar und lokal deploybar (vLLM, SGLang, llama.cpp).
  • Native Audio- und Bildeingabe
    Ohne separate Encoder oder vorgeschaltete Modelle kann Inkling Text, Bilder und Audio al Input verarbeiten.
  • Token-Effizientes Reasoning
    Über die steuerbare Thinking-Tiefe erreicht Inkling in Terminal Bench 2.1 laut Thinking Machine Labs die Qualität von Nemotron 3 Ultra mit rund einem Drittel der Token, also deutlich niedrigeren Inference-Kosten.

Nachteile

  • Sehr hohe Hardware-Anforderungen
    Der BF16-Checkpoint braucht laut Thinking Machine Labs rund 2 TB aggregierten VRAM, selbst die NVFP4-Quantisierung noch ca. 600 GB. Lokaler Betrieb ist damit realistisch nur auf Multi-GPU-Datacenter-Hardware.
  • Nur Text-Ausgabe
    Trotz multimodaler Eingabe gibt Inkling ausschließlich Text aus. Bild-, Audio- oder Video-Generierung ist nicht Teil des Modells.

Vergleiche Inkling mit anderen LLMs

Vergleiche Inkling mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Inkling ausprobieren

Inkling hat offene Gewichte: Du kannst das Modell herunterladen und selbst hosten — oder es bei einem der API-Provider unten nutzen.

Lizenz
Apache 2.0
Selbst hosten
Möglich
Dateigröße
1773,94 GB

Provider & APIs

Du kannst Thinking Machines Lab Inkling über die API folgender Anbieter nutzen.

Das Modell ist derzeit bei keinen Anbietern verfügbar.

Häufige Fragen zu Inkling

Ist Inkling Open Source?

Inkling wird unter der Lizenz „Apache 2.0“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht Inkling?

Inkling verarbeitet folgende Eingabeformate: Text, Bild, Audio.

Was kostet Inkling über die API?

Über die API kostet Inkling 1,00 $ pro 1 Mio. Input-Token und 4,05 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Inkling?

Inkling verarbeitet bis zu 1 Mio. Token in einer Anfrage.