MiMo V2.6 Flash
MiMo V2.6 Flash Modell-Übersicht
MiMo V2.6 Flash ist das kompakte Modell der neuen MiMo-V2.6-Generation von Xiaomi, veröffentlicht am 21. September 2026 zusammen mit dem Flaggschiff MiMo V2.6 Pro als Open Weights Modell unter MIT-Lizenz. Das Sparse-Mixture-of-Experts-Modell (MoE) hat 309 Mrd. Parameter, von denen pro Token nur 15 Mrd. aktiv sind. Wie Pro verarbeitet es Text, Bild, Audio und Video in einem Kontextfenster von 1 Mio. Token. Eine hybride Attention aus Sliding-Window- und Global-Layern verkleinert den KV-Cache laut Xiaomi um nahezu das Sechsfache, Multi-Token Prediction beschleunigt die Ausgabe. In Xiaomis eigenen Agenten-Benchmarks liegt Flash nur knapp hinter Pro, etwa mit 87,6 % gegenüber 89,9 % in Terminal-Bench 2.1, kostet mit $0,14 / $0,28 pro 1 Mio. Input-/Output-Token aber nur rund ein Drittel. Das entspricht exakt dem Preis von DeepSeek V4 Flash 0731, das allerdings nur Text verarbeitet. Nach unserer Einschätzung ist V2.6 Flash eines der besten Preis-Leistungs-Modelle für multimodale Agenten-Workflows. Unabhängige Benchmarks fehlen allerdings noch weitgehend.
Features & Modalitäten
MiMo V2.6 Flash Benchmark Scores
Technologie & Daten
Technische Spezifikationen
| Architektur | Sparse MoE-Transformer |
|---|---|
| Input Kontextlänge | 1,05 Mio. |
| Output Kontextlänge | 131,07k |
| Tokenizer | Unbekannt |
Besonderheiten
| Hybrid Attention (SWA + GA) | 39 Sliding-Window- und 9 Global-Attention-Layer mit 128-Token-Fenster. |
|---|---|
| Multi-Token Prediction (MTP) | Ein MTP-Drafter sagt bis zu sieben Folge-Token pro Durchlauf voraus. |
| Omnimodale Eingabe | Verarbeitet Text, Bild, Audio und Video in einem Modell. |
Vorteile & Nachteile
Vorteile
- Sehr günstiges PricingMit $0,14 / $0,28 pro 1 Mio. Input-/Output-Token kostet Flash rund ein Drittel von MiMo V2.6 Pro und liegt auf dem Niveau von DeepSeek V4 Flash 0731.
- Fast Pro-Niveau in Agenten-BenchmarksLaut Xiaomi erreicht Flash 87,6 % in Terminal-Bench 2.1 (Pro: 89,9 %) und 80,8 % in OSWorld-Verified (82 %). In CyberGym liegt es mit 95,1 % sogar knapp vor Pro.
- Omnimodal mit 1 Mio. Token KontextText, Bild, Audio und Video werden nativ in einem Kontextfenster von 1 Mio. Token verarbeitet, in dieser Preisklasse eine Seltenheit.
- Open Weights unter MIT-LizenzDie Gewichte stehen auf Hugging Face bereit und lassen sich kommerziell nutzen, finetunen und selbst hosten.
Nachteile
- Benchmark Scores noch unbelegtDie Agenten-Werte stammen aus Xiaomis eigener Benchmark-Tabelle. Unabhängige Tests zu Qualität und Zuverlässigkeit stehen noch aus.
- Hoher Hardware-Bedarf beim Self-HostingTrotz nur 15 Mrd. aktiver Parameter müssen alle 309 Mrd. Gewichte im Speicher liegen. Lokaler Betrieb erfordert daher Multi-GPU-Setups.
- Dünne DetaildokumentationTokenizer, Trainingsvolumen und Knowledge Cutoff nennt Xiaomi nicht, eine offizielle Preisseite für V2.6 Flash fehlt ebenfalls.
Vergleiche MiMo V2.6 Flash mit anderen LLMs
Vergleiche MiMo V2.6 Flash mit anderen Sprachmodellen anhand wichtiger Metriken wie Kontextgröße, Preisen und Benchmark-Leistung.
MiMo V2.6 Flash ausprobieren
Du musst kein Entwickler sein: MiMo V2.6 Flash ist auch direkt in MiMo nutzbar.
Provider & APIs
Du kannst Xiaomi MiMo V2.6 Flash über die API folgender Anbieter nutzen.
Das Modell ist derzeit bei keinen Anbietern verfügbar.
Häufige Fragen zu MiMo V2.6 Flash
Kann ich MiMo V2.6 Flash kostenlos nutzen?
Ja, MiMo V2.6 Flash ist in MiMo auch mit einem kostenlosen Konto nutzbar — allerdings meist mit Nutzungslimits.
Ist MiMo V2.6 Flash Open Source?
MiMo V2.6 Flash wird unter der Lizenz „MIT“ veröffentlicht. Details stehen in den Lizenzbedingungen des Anbieters.
Welche Eingabeformate versteht MiMo V2.6 Flash?
MiMo V2.6 Flash verarbeitet folgende Eingabeformate: Text, Bild, Audio, Video.
Was kostet MiMo V2.6 Flash über die API?
Über die API kostet MiMo V2.6 Flash 0,14 $ pro 1 Mio. Input-Token und 0,28 $ pro 1 Mio. Output-Token. Bei Reasoning-Modellen kommen Thinking-Tokens hinzu, die als Output abgerechnet werden.
Wie groß ist das Kontextfenster von MiMo V2.6 Flash?
MiMo V2.6 Flash verarbeitet bis zu 1,05 Mio. Token in einer Anfrage.