Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Inkling Small

Veröffentlichung
Juli 2026Neu
Kontextfenster
1 Mio. Token
API-Preis In / Out
0,50 $ / 1,20 $
Parameter
276 Mrd.
Daten aktualisiert: 3. August 2026

Inkling-Small Modell-Übersicht

Inkling-Small ist die kleine Variante des ersten Open-Weights-Modells von Thinking Machines Lab (dem Startup von Mira Murati). Es ist ein Mixture-of-Experts-Modell mit 276 Mrd. Parametern insgesamt, von denen 12 Mrd. Parametern während der Token-Inferenz aktiviert werden. Das Modell wurde per Distillation aus dem größeren Inkling (975B/41B aktiv) trainiert. Trotz der kleinen Größe zieht Inkling-small in einigen Benchmarks mit dem großen Inkling-Modell gleich oder überholt es sogar (z.B. 82,2 % in IFBench (Inkling: 79,8 %) oder 80,2 % in SWEBench-Verified (Inkling: 77,6 %)). Wie die große Inkling Version auch, bringt es natives Reasoning über Text, Bild und Audio, ein Kontextfenster von bis zu 1 Mio. Token und anpassbare Thinking-Effort-Stufen mit. Thinking Machines positioniert die Familie ausdrücklich nicht als stärkstes Modell am Markt, sondern als offene Basis zum Fine-Tuning über die hauseigene Plattform Tinker.

Features & Modalitäten

Nicht verfügbar
WebsucheQuellenangaben
Verfügbar
ReasoningToolsMultimodalitätStrukturierte AusgabenFinetuning
Input:TextBildAudio
Output:Text

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
1 Mio. Token
Input-Preis / 1M Token
0,50 $
Output-Preis / 1M Token
1,20 $
Parameter
276 Mrd.
Dateigröße
495,38 GB
Vokabular
201,02k

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0018 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

Inkling-Small Benchmark Scores



Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturDecoder-only-Transformer mit Sparse-MoE-Architektur
Input Kontextlänge1 Mio.
Output Kontextlänge1 Mio.
TokenizerUnbekannt

Besonderheiten

Native Multimodalität Text, Bild, Audio
On-Policy DistillationAus größerem Inkling Modell destilliert
Fine-Tuning über TinkerOpen Weights, ausgelegt zum Finetunen mit eigenen Daten über die Plattform Tinker.

Vorteile & Nachteile

Vorteile

  • Effizientes Modell
    Mit nur 12 Mrd. aktiven von 276 Mrd. Parametern lässt sich Inkling-small auf zwei NVIDIA DGX Spark bei vertretbarer Token-Geschwindigkeit (ca. 25 Tokens/s) ausführen.
  • Günstiger Preis
    Mit $0,50 / $1,20 pro 1 Mio. Input-/Output-Token gehört Inkling-small zu den preisgünstigsten LLMs mit 1M-Kontext.
  • Open Weights unter Apache 2.0
    Die vollständigen Open Weights liegen offen auf Hugging Face und lassen sich lokal herunterladen und deployen. Auch ein NVFP4-Checkpoint für NVIDIA-Blackwell-GPUs ist verfügbar.
  • Multimodal inklusive Audio
    Inkling-small kann neben Text und Bild auch Audio-Input verarbeiten. Das macht es besonders unter vergleichbaren Open-Weights-Modellen wie DeepSeek-V4-Flash, die diese Modalität oftmals nicht unterstützen.
  • Auf Fine-Tuning ausgelegt
    Über die Plattform Tinker lässt sich das Modell gezielt mit eigenen Daten anpassen, was es besonders interessant für Firmen mit proprietären Daten macht. Thinking Labs setzt genau auf diesen Anwendungsfall / diese Enterprise-Zielgruppe.

Nachteile

  • Schwächer als chinesische Open Weights Modelle
    Im direkten Vergleich zu vergleichbaren Open Weights Modellen aus China (z.B. Qwen 3.8 oder DeepSeek V4 Flash) liegt die Leistung des US-Modells noch niedriger.
  • Kein natives Web-Search und keine Quellenangaben
    Thinking Labs dokumentiert weder integrierte Live-Web-Suche noch automatische Zitierungen. Beide Funktionen müssen über eigene Tool-Integrationen ergänzt werden.

Vergleiche Inkling-Small mit anderen LLMs

Vergleiche Inkling-Small mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Inkling-Small ausprobieren

Inkling-Small hat offene Gewichte: Du kannst das Modell herunterladen und selbst hosten — oder es bei einem der API-Provider unten nutzen.

Lizenz
Apache 2.0
Selbst hosten
Möglich
Dateigröße
495,38 GB

Provider & APIs

Du kannst Thinking Machines Lab Inkling-Small über die API folgender Anbieter nutzen.




Häufige Fragen zu Inkling-Small

Ist Inkling-Small Open Source?

Inkling-Small wird unter der Lizenz „Apache 2.0“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht Inkling-Small?

Inkling-Small verarbeitet folgende Eingabeformate: Text, Bild, Audio.

Was kostet Inkling-Small über die API?

Über die API kostet Inkling-Small 0,50 $ pro 1 Mio. Input-Token und 1,20 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von Inkling-Small?

Inkling-Small verarbeitet bis zu 1 Mio. Token in einer Anfrage.

Was ist der Vorgänger von Inkling-Small?

Der direkte Vorgänger von Inkling-Small ist Inkling (erschienen Juli 2026). Einen tabellarischen Vergleich der beiden Modelle findest du auf dieser Seite im Abschnitt „Vergleiche“.