Inkling Small
Inkling Small Modell-Übersicht
Inkling-Small ist die kleine Variante des ersten Open-Weights-Modells von Thinking Machines Lab (dem Startup von Mira Murati). Es ist ein Mixture-of-Experts-Modell mit 276 Mrd. Parametern insgesamt, von denen 12 Mrd. Parametern während der Token-Inferenz aktiviert werden. Das Modell wurde per Distillation aus dem größeren Inkling (975B/41B aktiv) trainiert. Trotz der kleinen Größe zieht Inkling-small in einigen Benchmarks mit dem großen Inkling-Modell gleich oder überholt es sogar (z.B. 82,2 % in IFBench (Inkling: 79,8 %) oder 80,2 % in SWEBench-Verified (Inkling: 77,6 %)). Wie die große Inkling Version auch, bringt es natives Reasoning über Text, Bild und Audio, ein Kontextfenster von bis zu 1 Mio. Token und anpassbare Thinking-Effort-Stufen mit. Thinking Machines positioniert die Familie ausdrücklich nicht als stärkstes Modell am Markt, sondern als offene Basis zum Fine-Tuning über die hauseigene Plattform Tinker.
Features
Tools
Websuche, Bildgenerierung, Computer Use und MCP-Server.
Multimodalität
Das Modell kann Text, Bilder, Audio und PDFs als Input verarbeiten.
Finetuning
Finetuning des Modells ist aktuell nicht möglich.
Details zum Modell
Inkling Small Benchmark Scores
Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung – gemessen anhand standardisierter Benchmarks zur objektiven Vergleichbarkeit.
Technologie & Daten
Technische Spezifikationen
| Architektur | Decoder-only-Transformer mit Sparse-MoE-Architektur |
|---|---|
| Input Kontextlänge | 1 Mio. |
| Output Kontextlänge | 1 Mio. |
| Tokenizer | Unbekannt |
Besonderheiten
| Native Multimodalität | Text, Bild, Audio |
|---|---|
| On-Policy Distillation | Aus größerem Inkling Modell destilliert |
| Fine-Tuning über Tinker | Open Weights, ausgelegt zum Finetunen mit eigenen Daten über die Plattform Tinker. |
Vorteile & Nachteile
Vorteile
- Effizientes ModellMit nur 12 Mrd. aktiven von 276 Mrd. Parametern lässt sich Inkling-small auf zwei NVIDIA DGX Spark bei vertretbarer Token-Geschwindigkeit (ca. 25 Tokens/s) ausführen.
- Günstiger PreisMit $0,50 / $1,20 pro 1 Mio. Input-/Output-Token gehört Inkling-small zu den preisgünstigsten LLMs mit 1M-Kontext.
- Open Weights unter Apache 2.0Die vollständigen Open Weights liegen offen auf Hugging Face und lassen sich lokal herunterladen und deployen. Auch ein NVFP4-Checkpoint für NVIDIA-Blackwell-GPUs ist verfügbar.
- Multimodal inklusive AudioInkling-small kann neben Text und Bild auch Audio-Input verarbeiten. Das macht es besonders unter vergleichbaren Open-Weights-Modellen wie DeepSeek-V4-Flash, die diese Modalität oftmals nicht unterstützen.
- Auf Fine-Tuning ausgelegtÜber die Plattform Tinker lässt sich das Modell gezielt mit eigenen Daten anpassen, was es besonders interessant für Firmen mit proprietären Daten macht. Thinking Labs setzt genau auf diesen Anwendungsfall / diese Enterprise-Zielgruppe.
Nachteile
- Schwächer als chinesische Open Weights ModelleIm direkten Vergleich zu vergleichbaren Open Weights Modellen aus China (z.B. Qwen 3.8 oder DeepSeek V4 Flash) liegt die Leistung des US-Modells noch niedriger.
- Kein natives Web-Search und keine QuellenangabenThinking Labs dokumentiert weder integrierte Live-Web-Suche noch automatische Zitierungen. Beide Funktionen müssen über eigene Tool-Integrationen ergänzt werden.
Vergleiche Inkling Small mit anderen LLMs
Vergleiche Inkling Small mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Parameteranzahl, Preisen und Benchmark-Leistung.
Provider & APIs
Du kannst Thinking Machines Lab Inkling Small über die API folgender Anbieter nutzen.