Markov Robotics z San Francisco użyło generatywnego modelu wideo LTX-2.5 jako polityki sterowania zręczną dłonią robota. Robot patrzy kamerą na scenę, model generuje wideo wykonanego zadania, a sterowanie odtwarza ruch wynikający z tego nagrania. Opis metody ukazał się 8 września 2026 w Humanoids Daily — jako materiał sponsorowany i bez opublikowanych benchmarków.
Najważniejsze w skrócie
- LTX-2.5: 22 mld parametrów, diffusion transformer, encoder tekstu Gemma 4 12B
- Kompresja 1:192 — jeden token opisuje blok 32×32×8 pikseli
- Fine-tuning do przewidywania tokenów akcji obok tokenów wideo zajął poniżej godziny
- Dłoń Sharpa Wave: 22 aktywne stopnie swobody z czujnikami dotyku
- Licencja Community bezpłatna dla firm poniżej 10 mln USD przychodu rocznego (ok. 37 mln zł)
Wideo zamiast bezpośredniej polityki
Typowa polityka VLA mapuje obraz i polecenie wprost na komendy stawów. Markov wstawia w środek dodatkowy krok — model najpierw generuje wideo tego, co ma się wydarzyć, a dopiero z niego wynikają ruchy.
Logika jest taka, że model wytrenowany na ogromnym korpusie nagrań ma już wbudowane priors o fizyce. Firma twierdzi, że robot dobiera siłę chwytu do materiału — szkło traktuje delikatniej niż kamień.
Uczenie robotów oznacza pokazywanie im, jak fizyczny świat naprawdę się zachowuje, a nie tylko jak wygląda. LTX-2.5 jest wśród otwartych modeli najbliżej tego, czego potrzebujemy.
Atharva Gundawar, prezes i współzałożyciel Markov Robotics.
Dlaczego akurat LTX-2.5
Powód jest rachunkowy. Model pakuje wideo w mniej tokenów niż konkurenci — jeden token odpowiada blokowi 32×32×8 pikseli, co daje kompresję 1:192. Przy sterowaniu w zamkniętej pętli to różnica między kosztem możliwym a niemożliwym.
Lightricks wypuściło LTX-2.5 6 stycznia 2026. Wersję pretrenowaną udostępniono bez cinematic post-treningu, żeby nie zepsuć zgodności z nagraniami z perspektywy pierwszej osoby.
Czego nie wiadomo
Brakuje twardych liczb. Nie ma opublikowanej skuteczności manipulacji, dokładności przewidywania akcji ani opóźnienia w zamkniętej pętli na fizycznym sprzęcie. Sam Lightricks pisze w karcie modelu, że zastosowania w robotyce i physical AI są dopiero „w rozwoju". Otwarte zostaje pytanie, czy predykcja wideo koduje realną dynamikę kontaktu, czy tylko wygląd.
Dlaczego to ważne?
Jeśli model wideo faktycznie niesie użyteczne priors o fizyce kontaktu, zmienia się struktura kosztu danych. Zamiast setek godzin demonstracji na konkretnym robocie wystarczyłby krótki fine-tuning na ogólnym korpusie nagrań. To odwrócenie logiki, na której zbudowano dzisiejsze polityki VLA. Warunkiem jest dowód, którego nikt jeszcze nie przedstawił, a materiał źródłowy jest sponsorowany. Bez niezależnych pomiarów to hipoteza, nie metoda produkcyjna.
Co dalej?
- Wagi LTX-2.5 i checkpoint pretrenowany leżą na Hugging Face w repozytoriach bramkowanych — wymagają akceptacji licencji
- Markov Robotics nie podało terminu publikacji benchmarków manipulacji, a to pierwszy realny sprawdzian metody
- Powyżej 10 mln USD przychodu licencja przestaje być bezpłatna, co ogranicza adopcję u większych integratorów
Źródła
- Humanoids Daily — The Policy Is a Video: How Markov Robotics Runs Dexterous Manipulation on LTX-2.5
- Hugging Face — Lightricks/LTX-2.5





