1) Zbierane sa dane: demonstracje (teleoperacja, ludzkie wideo), doswiadczenie z interakcji lub dane z symulacji. 2) Wybierany jest paradygmat uczenia: imitation learning (klonowanie zachowan), reinforcement learning (optymalizacja nagrody) lub uczenie samonadzorowane/pretraining. 3) Model/polityka (np. VLA, VAM, diffusion policy) uczy sie mapowac obserwacje na akcje robota. 4) Polityka jest ewaluowana i przenoszona na robota (sim-to-real, dostrajanie na danych z robota), z uwzglednieniem bezpieczenstwa i generalizacji.
Reczne programowanie robotow jest pracochlonne, kruche i nie generalizuje do nowych zadan/otoczen. Robot learning pozwala robotom nabywac i generalizowac umiejetnosci z danych, radzac sobie ze zlozonoscia i zmiennoscia realnego swiata.
Model mapujacy obserwacje (wizja, sensory, stan) na akcje robota; np. polityka dyfuzyjna, model VLA lub VAM.
Oficjalna
Demonstracje (teleoperacja, ludzkie/egocentryczne wideo), doswiadczenie z interakcji lub symulacja.
Oficjalna
Metoda optymalizacji polityki: imitation learning, reinforcement learning lub uczenie samonadzorowane.
Oficjalna
Przeniesienie wyuczonej polityki na rzeczywistego robota, z pokonaniem luki sim-to-real i zapewnieniem bezpieczenstwa.
Oficjalna
Polityki wyuczone w symulacji czesto zawodza na realnym robocie z powodu roznic dynamiki i percepcji.
Zbieranie danych na robocie jest kosztowne, a RL bywa nieefektywne probkowaniem.
Wyuczone polityki moga zachowywac sie nieprzewidywalnie poza rozkladem treningowym, co jest ryzykowne dla robotow fizycznych.
Uczenie glebokie zaczyna mapowac obserwacje wizualne bezposrednio na akcje robota, otwierajac era nowoczesnego robot learningu.
Modele fundacyjne dla robotow (np. RT-2) lacza wiedze z sieci z akcja robota, poprawiajac generalizacje.
Wielkoskalowe, wieloembodimentowe zbiory danych oraz modele wideo-akcja (VAM) przyspieszaja efektywne uczenie robotow.
Złożoność czasowa: Zalezna od metody (IL/RL) i skali danych. Złożoność przestrzenna: O(model polityki + bufor danych/doswiadczenia).
Zbieranie danych na robocie jest kosztowne, RL bywa nieefektywne probkowaniem, a polityki wyuczone w symulacji nie zawsze przenosza sie na rzeczywistosc (sim-to-real gap).
Imitation learning, reinforcement learning, uczenie samonadzorowane lub hybrydy.
Teleoperacja, ludzkie/egocentryczne wideo, symulacja.
Docelowa platforma robota (ramie, humanoid, mobilny).
Zalezy od wybranej metody (IL/RL/SSL).
Ogolny paradygmat uczenia, bez pojedynczego mechanizmu routingu.
Pretraining i imitation learning sa silnie zrownoleglone; petla RL i sterowanie sa sekwencyjne.
Trening polityk (zwlaszcza z wizji/wideo) i symulacja sa intensywne obliczeniowo i korzystaja z akceleratorow GPU.