1) Bazowy generatywny model wideo jest wstepnie trenowany na duzej skali nagran, ucząc sie dynamiki i zachowania swiata. 2) Dla danego zadania i obserwacji model przewiduje przyszle klatki/sekwencje wideo (jak scena powinna sie rozwinac). 3) Dekoder akcji zamienia te przewidziane klatki na komendy ruchu robota (np. trajektorie, sterowanie manipulatorem). 4) Model jest dostrajany do konkretnego zadania na niewielkiej ilosci danych robota (demonstracje), poniewaz wiekszosc wiedzy o dynamice pochodzi z pretreningu wideo.
Modele Vision-Language-Action trenowane na statycznych obrazach wymagaja bardzo duzych ilosci danych robota i slabo generalizuja do nowej dynamiki sceny. VAM redukuje zapotrzebowanie na dane i poprawia rozumienie dynamiki, przenoszac wiedze z generatywnych modeli wideo.
Wstepnie wytrenowany model generacji wideo, ktory rozumie dynamike i zachowanie swiata i przewiduje przyszle klatki sceny.
Oficjalna
Modul zamieniajacy przewidziane klatki/sekwencje wideo na komendy ruchu robota (trajektorie, sterowanie manipulatorem).
Oficjalna
Generacja klatek moze byc zbyt wolna dla sterowania w czasie rzeczywistym.
Przewidziane klatki moga byc fizycznie niewykonalne przez robota (dekoder musi je urealnic).
mimic robotics wprowadza koncept modeli wideo-akcja, laczac generacje wideo z predykcja akcji robota.
mimic robotics i Black Forest Labs prezentuja FLUX-mimic; dostrojenie zadania z ~30 min danych robota, wdrozenie w Audi Production Lab.
Złożoność czasowa: Zalezna od bazowego modelu wideo. Złożoność przestrzenna: O(rozmiar modelu wideo + dekoder).
Predykcja klatek/sekwencji wideo w czasie sterowania jest najbardziej kosztowna obliczeniowo; wyzwaniem jest osiagniecie latencji wystarczajacej do sterowania robotem w czasie rzeczywistym.
Wybor generatywnego modelu wideo stanowiacego rdzen.
Sposob mapowania przewidzianych klatek na komendy ruchu.
Ilosc danych robota potrzebna do dostrojenia zadania.
Predykcja zalezna od obserwacji i zadania.
Brak routingu — jednolity model wideo + dekoder.
Trening (pretrening wideo) jest silnie zrownoleglony; inferencja sterujaca jest ograniczona sekwencyjna petla.
Generatywne modele wideo (transformery dyfuzyjne / flow matching) sa intensywne obliczeniowo i korzystaja z akceleratorow GPU.