Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

Inkling Small

Veröffentlichung
Juli 2026
Knowledge Cutoff
Unbekannt
Parameter
276 Mrd.
Modellfamilie
Inkling Small
Apache 2.0

Inkling Small Modell-Übersicht

Inkling-Small ist die kleine Variante des ersten Open-Weights-Modells von Thinking Machines Lab (dem Startup von Mira Murati). Es ist ein Mixture-of-Experts-Modell mit 276 Mrd. Parametern insgesamt, von denen 12 Mrd. Parametern während der Token-Inferenz aktiviert werden. Das Modell wurde per Distillation aus dem größeren Inkling (975B/41B aktiv) trainiert. Trotz der kleinen Größe zieht Inkling-small in einigen Benchmarks mit dem großen Inkling-Modell gleich oder überholt es sogar (z.B. 82,2 % in IFBench (Inkling: 79,8 %) oder 80,2 % in SWEBench-Verified (Inkling: 77,6 %)). Wie die große Inkling Version auch, bringt es natives Reasoning über Text, Bild und Audio, ein Kontextfenster von bis zu 1 Mio. Token und anpassbare Thinking-Effort-Stufen mit. Thinking Machines positioniert die Familie ausdrücklich nicht als stärkstes Modell am Markt, sondern als offene Basis zum Fine-Tuning über die hauseigene Plattform Tinker.

Features

Tools

Websuche, Bildgenerierung, Computer Use und MCP-Server.

Multimodalität

Das Modell kann Text, Bilder, Audio und PDFs als Input verarbeiten.

Finetuning

Finetuning des Modells ist aktuell nicht möglich.

Details zum Modell

Max. Input
1 Mio. Token
Max. Output
1 Mio. Token
Trainingsdaten
Unbekannt
Parameter
276 Mrd.
Input Preis
0,50 $
Output Preis
1,20 $
Vokabular
201,02k
Dateigröße
495,38 GB

Inkling Small Benchmark Scores

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung – gemessen anhand standardisierter Benchmarks zur objektiven Vergleichbarkeit.



Technologie & Daten

Technische Spezifikationen

ArchitekturDecoder-only-Transformer mit Sparse-MoE-Architektur
Input Kontextlänge1 Mio.
Output Kontextlänge1 Mio.
TokenizerUnbekannt

Besonderheiten

Native Multimodalität Text, Bild, Audio
On-Policy DistillationAus größerem Inkling Modell destilliert
Fine-Tuning über TinkerOpen Weights, ausgelegt zum Finetunen mit eigenen Daten über die Plattform Tinker.

Vorteile & Nachteile

Vorteile

  • Effizientes Modell
    Mit nur 12 Mrd. aktiven von 276 Mrd. Parametern lässt sich Inkling-small auf zwei NVIDIA DGX Spark bei vertretbarer Token-Geschwindigkeit (ca. 25 Tokens/s) ausführen.
  • Günstiger Preis
    Mit $0,50 / $1,20 pro 1 Mio. Input-/Output-Token gehört Inkling-small zu den preisgünstigsten LLMs mit 1M-Kontext.
  • Open Weights unter Apache 2.0
    Die vollständigen Open Weights liegen offen auf Hugging Face und lassen sich lokal herunterladen und deployen. Auch ein NVFP4-Checkpoint für NVIDIA-Blackwell-GPUs ist verfügbar.
  • Multimodal inklusive Audio
    Inkling-small kann neben Text und Bild auch Audio-Input verarbeiten. Das macht es besonders unter vergleichbaren Open-Weights-Modellen wie DeepSeek-V4-Flash, die diese Modalität oftmals nicht unterstützen.
  • Auf Fine-Tuning ausgelegt
    Über die Plattform Tinker lässt sich das Modell gezielt mit eigenen Daten anpassen, was es besonders interessant für Firmen mit proprietären Daten macht. Thinking Labs setzt genau auf diesen Anwendungsfall / diese Enterprise-Zielgruppe.

Nachteile

  • Schwächer als chinesische Open Weights Modelle
    Im direkten Vergleich zu vergleichbaren Open Weights Modellen aus China (z.B. Qwen 3.8 oder DeepSeek V4 Flash) liegt die Leistung des US-Modells noch niedriger.
  • Kein natives Web-Search und keine Quellenangaben
    Thinking Labs dokumentiert weder integrierte Live-Web-Suche noch automatische Zitierungen. Beide Funktionen müssen über eigene Tool-Integrationen ergänzt werden.

Vergleiche Inkling Small mit anderen LLMs

Vergleiche Inkling Small mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Parameteranzahl, Preisen und Benchmark-Leistung.


Alle Modelle vergleichen

Provider & APIs

Du kannst Thinking Machines Lab Inkling Small über die API folgender Anbieter nutzen.