Robocikowo>ROBOCIKOWO
MiMo-V2.6

MiMo-V2.6

V2.6 · Rodzina: MiMo
Seria omnimodalnych modeli agentowych Xiaomi (Pro-RL, Flash-RL, Distill-Qwen-9B) trenowana skalowanym RL; wejście tekst/obraz/wideo/audio, kontekst 1M.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel multimodalnyModel rozumowaniaModel używający narzędzi📁 MiMo
Okno kontekstowe
1M tokenów
tokenów
Parametry
1,02 bln / 42 mld aktywnych (Pro-RL); 309 mld / 15 mld (Flash-RL); 9 mld (Distill-Qwen-9B)
parametrów
Data premiery
21 września 2026
Dostęp:APIDownloadHostedWdrożenie:☁ Cloud💻 Lokalnie

Przegląd

MiMo-V2.6 to seria natywnie omnimodalnych modeli językowych opracowana przez zespół Xiaomi MiMo, udostępniona 21 września 2026 roku na licencji MIT. Modele przyjmują na wejściu tekst, obraz, wideo i audio, generują tekst (w tym kod) i obsługują kontekst do 1 miliona tokenów.

Seria obejmuje trzy warianty: flagowy MiMo-V2.6-Pro-RL (rzadka architektura Mixture-of-Experts, 1,02 bln parametrów łącznie / 42 mld aktywnych, 384 ekspertów routowanych, 8 aktywnych), zrównoważony wydajnościowo MiMo-V2.6-Flash-RL (309 mld / 15 mld aktywnych) oraz destylowany MiMo-V2.6-Distill-Qwen-9B (9 mld, SFT na bazie Qwen3.5-9B). Architektura łączy hybrydowy szkielet z uwagą przesuwnego okna (SWA), enkoder wizyjny MiMo ViT (681 mln), enkodery audio oraz 5-warstwowy dekoder spekulatywny (Multi-Token Prediction).

Modele trenowano metodą skalowanego uczenia ze wzmocnieniem (Group Relative Policy Optimization) z jednym mieszanym przebiegiem RL obejmującym kodowanie, agentów ogólnego przeznaczenia, zadania wizualne i cyberbezpieczeństwo, uzupełnionym destylacją on-policy (MOPD2) i pętlą samodoskonalenia (Groupwise Reward Synthesis, Groupwise Advantage Redistribution). Modele wspierają wywoływanie narzędzi i pracę agentową.

Klasyfikacja
Model multimodalnyModel rozumowaniaModel używający narzędzi
Rodzina: MiMo
Dostęp i wdrożenie
APIPobieranieHostowane
ChmuraLokalnie
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 1M tokenów
🧩 Parametry: 1,02 bln / 42 mld aktywnych (Pro-RL); 309 mld / 15 mld (Flash-RL); 9 mld (Distill-Qwen-9B)
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst, obraz, wideo, audio

Specyfikacja techniczna

Okno kontekstowe
1M tokenów
tokenów
Parametry
1,02 bln / 42 mld aktywnych (Pro-RL); 309 mld / 15 mld (Flash-RL); 9 mld (Distill-Qwen-9B)
parametrów
Licencja
MIT
Wymagania sprzętowe
Duże warianty (Pro-RL, Flash-RL) wymagają wdrożenia wielokartowego (multi-GPU, tensor parallelism); rekomendowane SGLang lub vLLM. Wariant Distill-Qwen-9B (9 mld) można uruchomić na pojedynczym GPU.
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
textimagevideoaudio
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie audio
Zdolność modelu do interpretowania dźwięku, mowy, tonów i sygnałów audio.
Kategoria: audio
Cyberbezpieczeństwo
Zdolność modelu do zadań z zakresu bezpieczeństwa komputerowego: analizy podatności, generowania exploitów proof-of-concept, łatania luk i odpowiadania na pytania z cyberbezpieczeństwa.
Kategoria: other
Obsługa komputera
Zdolność modelu do obsługi interfejsu komputera poprzez interpretację zrzutów ekranu oraz generowanie akcji takich jak kliknięcia, wpisywanie tekstu i nawigacja po aplikacjach.
Kategoria: planning

Wyniki benchmarków

7 benchmarków
DeepSWE v1.1
Code Agent (MiMo-V2.6 Pro)
71.9
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
Terminal Bench 2.1
General Agent (MiMo-V2.6 Pro)
89.9
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
Toolathlon-Verified
General Agent (MiMo-V2.6 Pro)
76.9
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
OSWorld
General Agent (MiMo-V2.6 Pro)
82.0
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
GDPval-AA
General Agent (MiMo-V2.6 Pro)
1673
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
Agents' Last Exam
General Agent (MiMo-V2.6 Pro)
31.6
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6
CyberGym
Cybersecurity (MiMo-V2.6 Pro)
94.0
📅 21 wrz 2026📄 Raport techniczny MiMo-V2.6

Architektura techniczna