Robocikowo>ROBOCIKOWO
MiMo-V2.6-Flash-RL

MiMo-V2.6-Flash-RL

V2.6-Flash-RL · Rodzina: MiMo
Zrównoważony wydajnościowo checkpoint serii MiMo-V2.6 od Xiaomi: omnimodalny model MoE 309 mld parametrów (15 mld aktywnych), okno 1M tokenów, trenowany skalowanym RL.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel multimodalnyModel rozumowaniaModel używający narzędzi📁 MiMo
Okno kontekstowe
1M
tokenów
Parametry
309B total / 15B active
parametrów
Data premiery
21 września 2026
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

MiMo-V2.6-Flash-RL to zrównoważony wydajnościowo checkpoint serii MiMo-V2.6 rozwijanej przez zespół Xiaomi MiMo. Jest to omnimodalny model z rzadką architekturą Mixture of Experts o 309 miliardach parametrów, z których w pojedynczym przebiegu aktywowanych jest 15 miliardów (256 ekspertów routowanych, 8 aktywnych). Model przyjmuje tekst, obraz, wideo i audio, generuje tekst (w tym kod) i obsługuje kontekst do 1 miliona tokenów.

Architektura

Backbone LLM liczy 48 warstw transformera (39 z uwagą przesuwnego okna SWA i 9 z uwagą globalną GA), o rozmiarze ukrytym 4096, z 64 głowicami uwagi i 4 głowicami klucz-wartość (GQA). Model łączy omnimodalne enkodery: wizyjny MiMo ViT (681 mln parametrów, 28 warstw) oraz audio (tokenizer 308 mln + enkoder patchy 127 mln). Dekodowanie spekulatywne realizuje 5-warstwowy moduł Multi-Token Prediction. Wagi udostępniono w formacie FP8.

Czym różni się wariant Flash

Flash-RL to mniejszy, zrównoważony wydajnościowo wariant serii — obok flagowego MiMo-V2.6-Pro-RL (1,02 bln / 42 mld aktywnych, 384 ekspertów) i destylowanego MiMo-V2.6-Distill-Qwen-9B. Ma 309 mld parametrów łącznych i 15 mld aktywnych (256 ekspertów, 8 aktywnych) oraz 48 warstw zamiast 70 w Pro-RL, co obniża wymagania wdrożeniowe (referencyjnie 8 GPU tensor-parallel × 2 data-parallel w SGLang lub 4 GPU tensor-parallel w vLLM). Kosztem kilkuprocentowego spadku wyników na większości benchmarków; w CyberGym osiąga nieznacznie wyższy wynik (95,1 vs 94,0). Model trenowano tą samą metodą skalowanego uczenia ze wzmocnieniem (GRPO) z dystylacją on-policy (MOPD2) i pętlą samodoskonalenia.

Klasyfikacja
Model multimodalnyModel rozumowaniaModel używający narzędzi
Rodzina: MiMo
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 1M
🧩 Parametry: 309B total / 15B active
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst, obraz, wideo, audio

Specyfikacja techniczna

Okno kontekstowe
1M
tokenów
Parametry
309B total / 15B active
parametrów
Licencja
MIT
Wymagania sprzętowe
Wdrożenie referencyjne SGLang: 8 GPU tensor-parallel × 2 data-parallel; vLLM: 4 GPU tensor-parallel. Wagi w formacie FP8 (mxfp4).
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
textimagevideoaudio
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie audio
Zdolność modelu do interpretowania dźwięku, mowy, tonów i sygnałów audio.
Kategoria: audio
Cyberbezpieczeństwo
Zdolność modelu do zadań z zakresu bezpieczeństwa komputerowego: analizy podatności, generowania exploitów proof-of-concept, łatania luk i odpowiadania na pytania z cyberbezpieczeństwa.
Kategoria: other
Obsługa komputera
Zdolność modelu do obsługi interfejsu komputera poprzez interpretację zrzutów ekranu oraz generowanie akcji takich jak kliknięcia, wpisywanie tekstu i nawigacja po aplikacjach.
Kategoria: planning

Wyniki benchmarków

16 benchmarków
DeepSWE v1.1
MiMo-V2.6-Flash-RL
67.9
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
ProgramBench
MiMo-V2.6-Flash-RL
26.0
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
MiMo Code Bench
MiMo-V2.6-Flash-RL
61.2
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
AutomationBench v1.0.6
MiMo-V2.6-Flash-RL
52.3
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
Toolathlon-Verified
MiMo-V2.6-Flash-RL
73.6
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
Agents' Last Exam
MiMo-V2.6-Flash-RL
27.6
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
Terminal Bench 4.0
MiMo-V2.6-Flash-RL
28.8
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
Terminal Bench 2.1
MiMo-V2.6-Flash-RL
87.6
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
OSWorld
MiMo-V2.6-Flash-RL
80.8
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
JobBench
MiMo-V2.6-Flash-RL
61.2
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
CyberGym
MiMo-V2.6-Flash-RL
95.1
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
MiMo Cyber Bench
MiMo-V2.6-Flash-RL
77.2
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
ExploitGym
MiMo-V2.6-Flash-RL
6.0
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
ExploitBench
MiMo-V2.6-Flash-RL
25.3
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
SEC Bench Pro
MiMo-V2.6-Flash-RL
47.5
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
MiMo VisualCoding
MiMo-V2.6-Flash-RL
71.5
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6

Architektura techniczna