Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Wideo jako polityka: Markov Robotics steruje dłonią przez LTX-2.5

Pan Robocik13 września 2026 · 3 min czytania
Wideo jako polityka: Markov Robotics steruje dłonią przez LTX-2.5

Markov Robotics z San Francisco użyło generatywnego modelu wideo LTX-2.5 jako polityki sterowania zręczną dłonią robota. Robot patrzy kamerą na scenę, model generuje wideo wykonanego zadania, a sterowanie odtwarza ruch wynikający z tego nagrania. Opis metody ukazał się 8 września 2026 w Humanoids Daily — jako materiał sponsorowany i bez opublikowanych benchmarków.

Najważniejsze w skrócie

  • LTX-2.5: 22 mld parametrów, diffusion transformer, encoder tekstu Gemma 4 12B
  • Kompresja 1:192 — jeden token opisuje blok 32×32×8 pikseli
  • Fine-tuning do przewidywania tokenów akcji obok tokenów wideo zajął poniżej godziny
  • Dłoń Sharpa Wave: 22 aktywne stopnie swobody z czujnikami dotyku
  • Licencja Community bezpłatna dla firm poniżej 10 mln USD przychodu rocznego (ok. 37 mln zł)

Wideo zamiast bezpośredniej polityki

Typowa polityka VLA mapuje obraz i polecenie wprost na komendy stawów. Markov wstawia w środek dodatkowy krok — model najpierw generuje wideo tego, co ma się wydarzyć, a dopiero z niego wynikają ruchy.

Logika jest taka, że model wytrenowany na ogromnym korpusie nagrań ma już wbudowane priors o fizyce. Firma twierdzi, że robot dobiera siłę chwytu do materiału — szkło traktuje delikatniej niż kamień.

Uczenie robotów oznacza pokazywanie im, jak fizyczny świat naprawdę się zachowuje, a nie tylko jak wygląda. LTX-2.5 jest wśród otwartych modeli najbliżej tego, czego potrzebujemy.

Atharva Gundawar, prezes i współzałożyciel Markov Robotics.

Dlaczego akurat LTX-2.5

Powód jest rachunkowy. Model pakuje wideo w mniej tokenów niż konkurenci — jeden token odpowiada blokowi 32×32×8 pikseli, co daje kompresję 1:192. Przy sterowaniu w zamkniętej pętli to różnica między kosztem możliwym a niemożliwym.

Lightricks wypuściło LTX-2.5 6 stycznia 2026. Wersję pretrenowaną udostępniono bez cinematic post-treningu, żeby nie zepsuć zgodności z nagraniami z perspektywy pierwszej osoby.

Czego nie wiadomo

Brakuje twardych liczb. Nie ma opublikowanej skuteczności manipulacji, dokładności przewidywania akcji ani opóźnienia w zamkniętej pętli na fizycznym sprzęcie. Sam Lightricks pisze w karcie modelu, że zastosowania w robotyce i physical AI są dopiero „w rozwoju". Otwarte zostaje pytanie, czy predykcja wideo koduje realną dynamikę kontaktu, czy tylko wygląd.

Dlaczego to ważne?

Jeśli model wideo faktycznie niesie użyteczne priors o fizyce kontaktu, zmienia się struktura kosztu danych. Zamiast setek godzin demonstracji na konkretnym robocie wystarczyłby krótki fine-tuning na ogólnym korpusie nagrań. To odwrócenie logiki, na której zbudowano dzisiejsze polityki VLA. Warunkiem jest dowód, którego nikt jeszcze nie przedstawił, a materiał źródłowy jest sponsorowany. Bez niezależnych pomiarów to hipoteza, nie metoda produkcyjna.

Co dalej?

  • Wagi LTX-2.5 i checkpoint pretrenowany leżą na Hugging Face w repozytoriach bramkowanych — wymagają akceptacji licencji
  • Markov Robotics nie podało terminu publikacji benchmarków manipulacji, a to pierwszy realny sprawdzian metody
  • Powyżej 10 mln USD przychodu licencja przestaje być bezpłatna, co ogranicza adopcję u większych integratorów

Źródła

Udostępnij ten artykuł