Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Xiaomi otwiera MiMo-V2.6. Trening RL kosztował 3,47 mln USD

Pan Robocik24 września 2026 · 2 min czytania
Xiaomi otwiera MiMo-V2.6. Trening RL kosztował 3,47 mln USD

Xiaomi udostępniło 21 września wagi rodziny MiMo-V2.6 na licencji MIT. Flagowy MiMo-V2.6-Pro to MoE o 1,02 bln parametrów, z których każde przejście aktywuje około 42 mld. Firma podała przy okazji liczbę, której producenci modeli zwykle nie ujawniają — faza uczenia ze wzmocnieniem kosztowała około 3,47 mln USD (ok. 12,7 mln zł).

Najważniejsze w skrócie

  • MiMo-V2.6-Pro: 1,02 bln parametrów, 42 mld aktywnych, kontekst 1 mln tokenów
  • MiMo-V2.6-Flash: 309 mld parametrów, 15 mld aktywnych, licencja MIT dla obu
  • Faza RL: ok. 2,62 mln USD (Pro) i 850 tys. USD (Flash)
  • 30 kroków RL w niecałe sześć dni, ok. 750 tys. trajektorii na model
  • 46,32 pkt w Artificial Analysis Intelligence Index v4.3
3,47 mln USDłączny koszt fazy RL dla MiMo-V2.6-Pro i FlashKarta modelu MiMo-V2.6 (Xiaomi)

Jeden przebieg RL zamiast czterech

Zamiast osobnych przebiegów RL dla kodu, wizji i wywoływania narzędzi, zespół MiMo zmieszał wszystkie zadania w jednej sesji — w karcie modelu nazwano to „You Only RL Once". Trening prowadzono w pełni asynchronicznym GRPO, a jeden krok wyglądał tak:

Konfiguracja jednego kroku RL:

1568 promptówzadań pobranych na krok
× 16 trajektoriiniezależnych prób na każdy prompt
= 25 088 rolloutówprzebiegów agenta w jednym kroku
× 30 krokówtyle wykonały zarówno Pro, jak i Flash

Nagroda, która odróżnia dobre od poprawnych

Binarne „test przeszedł albo nie" nie rozróżnia dwóch rozwiązań, które oba działają. Xiaomi dołożyło więc agenta oceniającego, porównującego trajektorie wewnątrz grupy: Groupwise Reward Synthesis buduje kryteria jakości z kontrastujących Rollout: Pojedynczy przebieg modelu przez zadanie od początku do końca — jedna próba rozwiązania, którą można potem ocenić., a Groupwise Advantage Redistribution przesuwa część nagrody od słabszych poprawnych odpowiedzi do lepszych. Na sam grader poszło 12,7% budżetu obliczeniowego Pro.

Mocny w zadaniach agentowych, słabszy w kodzie

W zadaniach agentowych model dogania zamknięte flagowce. Dystans widać dopiero tam, gdzie liczy się jakość samego kodu.

BenchmarkMiMo-V2.6-ProClaude Opus 5
Terminal Bench 2.189,989,1
AutomationBench v1.0.653,150,3
ProgramBench26,537,0
Terminal Bench 4.034,949,0
Punktacja wg karty modelu MiMo-V2.6-Pro. Wyższy wynik jest lepszy.

W indeksie Artificial Analysis model Pro wyprzedza DeepSeek V4.1.

Dlaczego to ważne?

Otwarte wagi to dziś standard, otwarty rachunek za trening — nie. Podając koszt, rozkład wydatków i kod środowisk RL, Xiaomi przesuwa dyskusję z „ile parametrów" na „ile obliczeń na interakcję z zadaniem". To zarazem test tezy, że skalowanie RL działa dalej niż skalowanie pretreningu. Trzydzieści kroków to zbyt krótki odcinek, by ją rozstrzygnąć, ale wystarczająco długi, by inni mogli go powtórzyć.

Co dalej?

  • Wyniki da się sprawdzić niezależnie — Xiaomi wypuściło raport techniczny, środowiska treningowe i kod RL razem z wagami
  • Cennik API został na poziomie serii V2.5: 0,435/0,87 USD za milion tokenów dla Pro i 0,14/0,28 USD dla Flash

Źródła

Udostępnij ten artykuł