Alle AI-Trends
Direkt in dein Postfach
Erhalte exklusive AI-Tutorials, Praxistipps und KI-News direkt in dein Postfach.
*Mit deiner Anmeldung akzeptierst du unsere Datenschutzrichtlinien.
Jetzt neu: Byte Pulse – Token-Limits von Claude Code, Codex & Co. tracken! 

MiMo V2.6 Flash

Veröffentlichung
September 2026Neu
Kontextfenster
1,05 Mio. Token
API-Preis In / Out
0,14 $ / 0,28 $
Parameter
309 Mrd.
Daten aktualisiert: 25. September 2026

MiMo V2.6 Flash Modell-Übersicht

MiMo V2.6 Flash ist das kompakte Modell der neuen MiMo-V2.6-Generation von Xiaomi, veröffentlicht am 21. September 2026 zusammen mit dem Flaggschiff MiMo V2.6 Pro als Open Weights Modell unter MIT-Lizenz. Das Sparse-Mixture-of-Experts-Modell (MoE) hat 309 Mrd. Parameter, von denen pro Token nur 15 Mrd. aktiv sind. Wie Pro verarbeitet es Text, Bild, Audio und Video in einem Kontextfenster von 1 Mio. Token. Eine hybride Attention aus Sliding-Window- und Global-Layern verkleinert den KV-Cache laut Xiaomi um nahezu das Sechsfache, Multi-Token Prediction beschleunigt die Ausgabe. In Xiaomis eigenen Agenten-Benchmarks liegt Flash nur knapp hinter Pro, etwa mit 87,6 % gegenüber 89,9 % in Terminal-Bench 2.1, kostet mit $0,14 / $0,28 pro 1 Mio. Input-/Output-Token aber nur rund ein Drittel. Das entspricht exakt dem Preis von DeepSeek V4 Flash 0731, das allerdings nur Text verarbeitet. Nach unserer Einschätzung ist V2.6 Flash eines der besten Preis-Leistungs-Modelle für multimodale Agenten-Workflows. Unabhängige Benchmarks fehlen allerdings noch weitgehend.

Features & Modalitäten

Nicht verfügbar
WebsucheQuellenangaben
Verfügbar
ReasoningToolsMultimodalitätStrukturierte AusgabenFinetuning
Input:TextBildAudioVideo
Output:TextJson

Features & Modalitäten

Reasoning, Tool-Nutzung und strukturierte Ausgaben gehören 2026 zum Standard aktueller LLMs. Interessant wird es bei Abweichungen und die unterstützten Modalitäten.

Fähigkeiten mit grünem Haken sind verfügbar, rot markierte fehlen dem Modell. Details zu jeder Fähigkeit kannst du über das jeweilige Info-Symbol einsehen.

Details zum Modell

Max. Input
1,05 Mio. Token
Max. Output
131,07k Token
Input-Preis / 1M Token
0,14 $
Output-Preis / 1M Token
0,28 $
Parameter
309 Mrd.

API-Preise einordnen

Eine typische Antwort (ca. 1.000 Wörter, kurzer Prompt) kostet über die API rund 0,0004 $.

Als Reasoning-Modell erzeugt es zusätzlich Thinking-Tokens, die als Output abgerechnet werden. Die realen Kosten liegen je nach Aufgabe deutlich darüber.

Dein eigenes Nutzungsprofil kannst du mit dem Kosten-Rechner, den wir unter der Tabelle verlinkt haben, berechnen.

MiMo V2.6 Flash Benchmark Scores

‌
‌

Benchmarks & Performance

Im KI-Kontext bezeichnet Performance die Leistungsfähigkeit eines Modells in Bereichen wie Sprachverständnis, Logik oder Programmierung, gemessen anhand standardisierter Benchmarks für eine objektive Vergleichbarkeit.

Achte beim Vergleichen darauf, ob die LLMs Tools oder mehrere Durchläufe („Pass@k“) nutzen durften. Benchmark Scores lassen sich untereinander nur vergleichen, wenn sie der gleichen Methodik zugrunde liegen.

Technologie & Daten

Technische Spezifikationen

ArchitekturSparse MoE-Transformer
Input Kontextlänge1,05 Mio.
Output Kontextlänge131,07k
TokenizerUnbekannt

Besonderheiten

Hybrid Attention (SWA + GA)39 Sliding-Window- und 9 Global-Attention-Layer mit 128-Token-Fenster.
Multi-Token Prediction (MTP)Ein MTP-Drafter sagt bis zu sieben Folge-Token pro Durchlauf voraus.
Omnimodale EingabeVerarbeitet Text, Bild, Audio und Video in einem Modell.

Vorteile & Nachteile

Vorteile

  • Sehr günstiges Pricing
    Mit $0,14 / $0,28 pro 1 Mio. Input-/Output-Token kostet Flash rund ein Drittel von MiMo V2.6 Pro und liegt auf dem Niveau von DeepSeek V4 Flash 0731.
  • Fast Pro-Niveau in Agenten-Benchmarks
    Laut Xiaomi erreicht Flash 87,6 % in Terminal-Bench 2.1 (Pro: 89,9 %) und 80,8 % in OSWorld-Verified (82 %). In CyberGym liegt es mit 95,1 % sogar knapp vor Pro.
  • Omnimodal mit 1 Mio. Token Kontext
    Text, Bild, Audio und Video werden nativ in einem Kontextfenster von 1 Mio. Token verarbeitet, in dieser Preisklasse eine Seltenheit.
  • Open Weights unter MIT-Lizenz
    Die Gewichte stehen auf Hugging Face bereit und lassen sich kommerziell nutzen, finetunen und selbst hosten.

Nachteile

  • Benchmark Scores noch unbelegt
    Die Agenten-Werte stammen aus Xiaomis eigener Benchmark-Tabelle. Unabhängige Tests zu Qualität und Zuverlässigkeit stehen noch aus.
  • Hoher Hardware-Bedarf beim Self-Hosting
    Trotz nur 15 Mrd. aktiver Parameter müssen alle 309 Mrd. Gewichte im Speicher liegen. Lokaler Betrieb erfordert daher Multi-GPU-Setups.
  • Dünne Detaildokumentation
    Tokenizer, Trainingsvolumen und Knowledge Cutoff nennt Xiaomi nicht, eine offizielle Preisseite für V2.6 Flash fehlt ebenfalls.

Vergleiche MiMo V2.6 Flash mit anderen LLMs

Vergleiche MiMo V2.6 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.

‌
Alle Modelle vergleichen

MiMo V2.6 Flash ausprobieren

Du musst kein Entwickler sein: MiMo V2.6 Flash ist auch direkt in MiMo nutzbar.

App
MiMo
Kostenlose Nutzung
Ja

Provider & APIs

Du kannst Xiaomi MiMo V2.6 Flash über die API folgender Anbieter nutzen.

Das Modell ist derzeit bei keinen Anbietern verfügbar.

Häufige Fragen zu MiMo V2.6 Flash

Kann ich MiMo V2.6 Flash kostenlos nutzen?

Ja, MiMo V2.6 Flash ist in MiMo auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.

Ist MiMo V2.6 Flash Open Source?

MiMo V2.6 Flash wird unter der Lizenz „MIT“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.

Welche Eingabeformate versteht MiMo V2.6 Flash?

MiMo V2.6 Flash verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video.

Was kostet MiMo V2.6 Flash über die API?

Über die API kostet MiMo V2.6 Flash 0,14 $ pro 1 Mio. Input-Token und 0,28 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.

Wie groß ist das Kontextfenster von MiMo V2.6 Flash?

MiMo V2.6 Flash verarbeitet bis zu 1,05 Mio. Token in einer Anfrage.