Robocikowo>ROBOCIKOWO
MiMo-V2.6-Pro-RL

MiMo-V2.6-Pro-RL

V2.6-Pro-RL · Rodzina: MiMo
Flagowy checkpoint serii MiMo-V2.6 od Xiaomi: omnimodalny model MoE 1,02 bln parametrów (42 mld aktywnych), okno 1M tokenów, trenowany przez skalowane uczenie ze wzmocnieniem.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel multimodalnyModel rozumowaniaModel używający narzędzi📁 MiMo
Okno kontekstowe
1M
tokenów
Parametry
1.02T total / 42B active
parametrów
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

MiMo-V2.6-Pro-RL to flagowy checkpoint serii MiMo-V2.6 rozwijanej przez zespół Xiaomi MiMo. Jest to omnimodalny model z rzadką architekturą Mixture of Experts o 1,02 biliona parametrów, z których w pojedynczym przebiegu aktywowanych jest 42 miliardy (384 ekspertów routowanych, 8 aktywnych). Model przyjmuje tekst, obraz, wideo i audio, a generuje tekst, i obsługuje kontekst do 1 miliona tokenów.

Architektura

Backbone LLM liczy 70 warstw transformera (60 z uwagą przesuwnego okna SWA i 10 z uwagą globalną GA), o rozmiarze ukrytym 6144. Model łączy omnimodalne enkodery: wizyjny MiMo ViT (681 mln parametrów, 28 warstw) oraz audio (tokenizer 308 mln + enkoder patchy 127 mln). Dekodowanie spekulatywne realizuje 5-warstwowy moduł Multi-Token Prediction. Wagi udostępniono w formacie FP8.

Czym różni się wariant Pro-RL

Pro-RL to największy, flagowy wariant serii (obok mniejszego MiMo-V2.6-Flash-RL) i punkt centralny podejścia „skalowania uczenia ze wzmocnieniem ku samodoskonaleniu". Model przechodzi jeden mieszany przebieg RL obejmujący kodowanie, agentów ogólnych, zadania wizyjne i cyberbezpieczeństwo, z w pełni asynchronicznym GRPO na dużych batchach (1568 promptów × 16 rolloutów na krok). Sygnał nagrody skaluje grupowe ocenianie agentowe (Groupwise Reward Synthesis i Groupwise Advantage Redistribution), a po fazie RL stosowana jest dystylacja on-policy z wieloma nauczycielami (MOPD2).

Klasyfikacja
Model multimodalnyModel rozumowaniaModel używający narzędzi
Rodzina: MiMo
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 1M
🧩 Parametry: 1.02T total / 42B active
Narzędzia
📥 Wejście: tekst, obraz, wideo, audio

Specyfikacja techniczna

Okno kontekstowe
1M
tokenów
Parametry
1.02T total / 42B active
parametrów
Licencja
MIT
Wymagania sprzętowe
Wdrożenie referencyjne SGLang: tensor-parallel 16 × data-parallel 2 (32 GPU). Wagi w formacie FP8 (mxfp4).
Funkcje:Używanie narzędzi
Modalności
⬇ Wejście (Input)
textimagevideoaudio
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie audio
Zdolność modelu do interpretowania dźwięku, mowy, tonów i sygnałów audio.
Kategoria: audio
Cyberbezpieczeństwo
Zdolność modelu do zadań z zakresu bezpieczeństwa komputerowego: analizy podatności, generowania exploitów proof-of-concept, łatania luk i odpowiadania na pytania z cyberbezpieczeństwa.
Kategoria: other
Obsługa komputera
Zdolność modelu do obsługi interfejsu komputera poprzez interpretację zrzutów ekranu oraz generowanie akcji takich jak kliknięcia, wpisywanie tekstu i nawigacja po aplikacjach.
Kategoria: planning

Wyniki benchmarków

17 benchmarków
DeepSWE v1.1
71.9
📄 technical_report
ProgramBench
26.5
📄 technical_report
MiMo Code Bench
63.2
📄 technical_report
AutomationBench v1.0.6
53.1
📄 technical_report
Toolathlon-Verified
76.9
📄 technical_report
GDPval-AA 2.1
1673
📄 technical_report
Agents' Last Exam
31.6
📄 technical_report
Terminal Bench 4.0
34.9
📄 technical_report
Terminal Bench 2.1
89.9
📄 technical_report
OSWorld-Verified
82.0
📄 technical_report
JobBench
62.0
📄 technical_report
CyberGym
94.0
📄 technical_report
MiMo Cyber Bench
80.2
📄 technical_report
ExploitGym
17.8
📄 technical_report
ExploitBench
47.9
📄 technical_report
SEC Bench Pro
66.3
📄 technical_report
MiMo VisualCoding
72.3
📄 technical_report

Architektura techniczna