Etap 1 (Latent Action Model): enkoder oparty o inverse dynamics I(z_t | I_t, I_{t+H}) i dekoder oparty o forward dynamics F(I_{t+H} | I_t, z_t) modeluja dynamike miedzy kolejnymi klatkami. Enkoder to spatial-temporal transformer z przyczynowymi maskami czasowymi, dekoder to spatial transformer przyjmujacy klatke poczatkowa i zdyskretyzowane tokeny latentnej akcji z_t = [z_t^0, ..., z_t^{k-1}] (k=4), kwantyzowane celem VQ-VAE z kodksiazka o rozmiarze |C|. Etap 2 (Latent Planner): wstepnie wytrenowany VLM na skali webowej uzywa latentnych akcji jako pseudo-etykiet do planowania dlugohoryzontowego niezaleznego od ucielesnienia. Etap 3 (Action Expert): Action Expert jest wprowadzany i trenowany wspólnie z Latent Plannerem, przeksztalcajac latentny plan w konkretne, zreczne akcje sterujace robotem.
Ilosc danych robotycznych z etykietami akcji jest niewielka w porównaniu do danych internetowych, co ogranicza generalizacje klasycznego VLA. ViLLA rozwiazuje ten deficyt danych, wprowadzajac latentne akcje jako posrednia reprezentacje uczona z filmów ludzi bez etykiet akcji i z danych cross-embodiment, oraz oddziela dlugohoryzontowe planowanie od niskopoziomowego sterowania.
Enkoder-dekoder trenowany na internetowej skali heterogenicznych danych. Enkoder oparty o inverse dynamics I(z_t|I_t,I_{t+H}) to spatial-temporal transformer z przyczynowymi maskami czasowymi; dekoder oparty o forward dynamics F(I_{t+H}|I_t,z_t) to spatial transformer. Tokeny latentnej akcji z_t=[z_t^0..z_t^{k-1}] (k=4) sa kwantyzowane celem VQ-VAE z kodksiazka o rozmiarze |C|.
Wykorzystuje wstepnie wytrenowany na skali webowej VLM i uzywa latentnych akcji jako pseudo-etykiet, laczac generalizacje VLM z planowaniem sekwencji latentnych akcji niezaleznym od konkretnego robota.
Wprowadzany w Etapie 3 i trenowany wspólnie z Latent Plannerem; przeksztalca latentny plan na konkretne, niskopoziomowe akcje sterujace umozliwiajac zreczna manipulacje.
AgiBot (Zhiyuan) publikuje AgiBot World Colosseo (arXiv:2503.06669), definiujac hierarchiczny framework ViLLA i implementujac go w generalistycznej polityce GO-1 (Genie Operator-1).
Podstawowe komponenty (VLM Latent Planner, spatial/spatial-temporal transformery LAM, Action Expert) to gesta architektura transformerowa; przetwarzanie przebiega w trzech etapach o roznej roli.
Trening i inferencja transformerowych komponentów (VLM, LAM, Action Expert) na duzej skali danych korzystaja z akceleracji GPU.