Xiaomi udostępniło 21 września wagi rodziny MiMo-V2.6 na licencji MIT. Flagowy MiMo-V2.6-Pro to MoE o 1,02 bln parametrów, z których każde przejście aktywuje około 42 mld. Firma podała przy okazji liczbę, której producenci modeli zwykle nie ujawniają — faza uczenia ze wzmocnieniem kosztowała około 3,47 mln USD (ok. 12,7 mln zł).
Najważniejsze w skrócie
- MiMo-V2.6-Pro: 1,02 bln parametrów, 42 mld aktywnych, kontekst 1 mln tokenów
- MiMo-V2.6-Flash: 309 mld parametrów, 15 mld aktywnych, licencja MIT dla obu
- Faza RL: ok. 2,62 mln USD (Pro) i 850 tys. USD (Flash)
- 30 kroków RL w niecałe sześć dni, ok. 750 tys. trajektorii na model
- 46,32 pkt w Artificial Analysis Intelligence Index v4.3
Jeden przebieg RL zamiast czterech
Zamiast osobnych przebiegów RL dla kodu, wizji i wywoływania narzędzi, zespół MiMo zmieszał wszystkie zadania w jednej sesji — w karcie modelu nazwano to „You Only RL Once". Trening prowadzono w pełni asynchronicznym GRPO, a jeden krok wyglądał tak:
Konfiguracja jednego kroku RL:
Nagroda, która odróżnia dobre od poprawnych
Binarne „test przeszedł albo nie" nie rozróżnia dwóch rozwiązań, które oba działają. Xiaomi dołożyło więc agenta oceniającego, porównującego trajektorie wewnątrz grupy: Groupwise Reward Synthesis buduje kryteria jakości z kontrastujących rolloutów?Rollout: Pojedynczy przebieg modelu przez zadanie od początku do końca — jedna próba rozwiązania, którą można potem ocenić., a Groupwise Advantage Redistribution przesuwa część nagrody od słabszych poprawnych odpowiedzi do lepszych. Na sam grader poszło 12,7% budżetu obliczeniowego Pro.
Mocny w zadaniach agentowych, słabszy w kodzie
W zadaniach agentowych model dogania zamknięte flagowce. Dystans widać dopiero tam, gdzie liczy się jakość samego kodu.
| Benchmark | MiMo-V2.6-Pro | Claude Opus 5 |
|---|---|---|
| Terminal Bench 2.1 | 89,9 | 89,1 |
| AutomationBench v1.0.6 | 53,1 | 50,3 |
| ProgramBench | 26,5 | 37,0 |
| Terminal Bench 4.0 | 34,9 | 49,0 |
W indeksie Artificial Analysis model Pro wyprzedza DeepSeek V4.1.
Dlaczego to ważne?
Otwarte wagi to dziś standard, otwarty rachunek za trening — nie. Podając koszt, rozkład wydatków i kod środowisk RL, Xiaomi przesuwa dyskusję z „ile parametrów" na „ile obliczeń na interakcję z zadaniem". To zarazem test tezy, że skalowanie RL działa dalej niż skalowanie pretreningu. Trzydzieści kroków to zbyt krótki odcinek, by ją rozstrzygnąć, ale wystarczająco długi, by inni mogli go powtórzyć.
Co dalej?
- Wyniki da się sprawdzić niezależnie — Xiaomi wypuściło raport techniczny, środowiska treningowe i kod RL razem z wagami
- Cennik API został na poziomie serii V2.5: 0,435/0,87 USD za milion tokenów dla Pro i 0,14/0,28 USD dla Flash
Źródła
- Hugging Face — MiMo-V2.6-Pro-RL model card
- Hugging Face — MiMo-V2.6-Flash-RL model card
- 36氪 — 罗福莉押注大规模RL、小米最强开源模型亮相
- VentureBeat — 'Better than DeepSeek': Xiaomi's MiMo-V2.6-Pro debuts as the top open weights model in the world





